下に引いて戻る
RTX 5090で Qwen3.5-27B を vLLM で実行、77 tps を達成

RTX 5090で Qwen3.5-27B を vLLM で実行、77 tps を達成

Qwen3.5-27B on RTX 5090 served via vLLM @ 77 tps

今月の Cursor と Zai のサブスクリプション額度を使い切ってしまったので、ローカルで大規模言語モデル(LLM)を構築することにしました。RTX 5090 で Qwen3.5 27B を実行したところ、予想外に良い結果が得られ、かなり良好な推論速度(tps)を達成できました。コンテキストウィンドウは 218k に設定でき、2 つの同時セッションも実行可能ですが、セッションごとの速度は低下します。vLLM 0.19 では 256k のフルコンテキストウィンドウで動作させられませんでしたが、0.17 では動作します。ただし速度は低下します。0.17 には新バージョンの最適化機能が多く含まれていないためです。