往下拉回到首頁
用 RTX 5090 跑 Qwen3.5-27B,vLLM 達到 77 tps 的速度

用 RTX 5090 跑 Qwen3.5-27B,vLLM 達到 77 tps 的速度

Qwen3.5-27B on RTX 5090 served via vLLM @ 77 tps

這個月 Cursor 和 Zai 的訂閱額度都用爆了,我決定自己架設本地大型語言模型(LLM)。用 RTX 5090 跑 Qwen3.5 27B 的效果出乎意料地好,達到了相當不錯的每秒推論次數(tps)。內容視窗(context window)設定在 218k,甚至還能同時跑 2 個對話,雖然單個對話的速度會下降。有點奇怪的是我在 vLLM 0.19 版本上沒辦法用滿整個 256k 的內容視窗,在 0.17 版本可以跑但速度會變慢,因為 0.17 沒有新版本的那些優化功能。