往下拉回到首頁
在 16GB M3 MacBook Air 上跑 Qwen 3.5 35B,速度竟然有 8.9 TPS!

在 16GB M3 MacBook Air 上跑 Qwen 3.5 35B,速度竟然有 8.9 TPS!

Running Qwen 3.5 35B on a 16GB M3 MacBook Air at 8.9 TPS - Here's How

我成功在 16GB M3 MacBook Air 上執行 Qwen 3.5 35B(一個超大型語言模型),透過記憶體映射(mmap)技術達到 8.9 個 token/秒的速度。考慮到這個模型比我的 RAM 大得多,這個速度其實不錯。秘訣是什麼呢?使用 GGUF 量化來壓縮模型,再搭配 mmap 在磁碟和記憶體之間高效地交換資料。我會一步步帶你走過整個過程,從使用 Hugging Face 下載模型開始。沒有廢話,只有實用的設定步驟,給任何想在 Mac 上本地執行強大 AI 的人。