
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

我成功在 16GB M3 MacBook Air 上執行 Qwen 3.5 35B(一個超大型語言模型),透過記憶體映射(mmap)技術達到 8.9 個 token/秒的速度。考慮到這個模型比我的 RAM 大得多,這個速度其實不錯。秘訣是什麼呢?使用 GGUF 量化來壓縮模型,再搭配 mmap 在磁碟和記憶體之間高效地交換資料。我會一步步帶你走過整個過程,從使用 Hugging Face 下載模型開始。沒有廢話,只有實用的設定步驟,給任何想在 Mac 上本地執行強大 AI 的人。