往下拉回到首頁
RTX Pro 6000 搭配 vllm 怎樣設定效能最強?

RTX Pro 6000 搭配 vllm 怎樣設定效能最強?

Best RTX Pro 6000 vllm settings?

剛幫公司入手一張 RTX Pro 6000 Blackwell 工作站顯卡。在 Qwen3 27B FP8 模型上跑出不錯的吞吐量(TPS)。用它來跑多個專門處理特定任務的 AI 代理。現在想在 vllm 0.20.1 nightly 版本(CUDA 13.1)上找到速度和並行處理的最佳平衡。 引擎 000 目前表現:平均提示吞吐量 763.5 tokens/s、平均生成吞吐量 1320.2 tokens/s、運行 28 個請求、等待 0 個請求、GPU KV 快取使用率 50.4%、前綴快取命中率 1.3%、多模態快取命中率 0%。