往下拉回到首頁
用 RTX 3090 跑 Qwen 模型的真實結果——混合專家模型在嚴格限制下反而變慢

用 RTX 3090 跑 Qwen 模型的真實結果——混合專家模型在嚴格限制下反而變慢

Qwen3.5-27B, Qwen3.5-122B, and Qwen3.6-35B on 4x RTX 3090 — MoEs struggle with strict global rules

欸你知道嗎,有人實際在自己的電腦上(4 張 RTX 3090)跑了三個不同版本的 Qwen 大型語言模型(LLM),測試時間超過 20 次,用的是真實的工作場景,不是那種虛假的測試數據。簡單來說就是,他們在跑一個多代理系統(就像是多個 AI 助手同時工作),每次給模型很長的指令(30-60k 個詞),還要求模型必須遵守很嚴格的規則(只能執行白名單裡的指令)。結果發現,那些號稱更聰明、更省電的「混合專家」模型(MoE)在這種嚴格限制下,反而沒有想像中那麼厲害。這對想在自己電腦上跑 AI 的人來說滿重要的,因為你可能會發現花大錢升級硬體,結果模型選錯了反而更慢。