
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

花了不少功夫終於搞定了!現在可以同時用 CUDA 和 ROCm 跑大型語言模型(像是 Minimax 2.7 Q4),完全繞過 Vulkan。整個設定把全部 63 層都卸載到 GPU,CUDA 處理 83.6GB、ROCm 處理 40.3GB、CPU 處理剩下的。最大的好處是 prefill 速度快到不行。在 Windows 上的話,就是清空 build 資料夾,然後用 CMake 搭 Ninja 產生器指向你的 AMD ROC 安裝位置。