
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

剛幫公司入手一張 RTX Pro 6000 Blackwell 工作站顯卡。在 Qwen3 27B FP8 模型上跑出不錯的吞吐量(TPS)。用它來跑多個專門處理特定任務的 AI 代理。現在想在 vllm 0.20.1 nightly 版本(CUDA 13.1)上找到速度和並行處理的最佳平衡。 引擎 000 目前表現:平均提示吞吐量 763.5 tokens/s、平均生成吞吐量 1320.2 tokens/s、運行 28 個請求、等待 0 個請求、GPU KV 快取使用率 50.4%、前綴快取命中率 1.3%、多模態快取命中率 0%。