
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

你知道在跑大型 AI(LLM)模型時有多煩嗎?要同時開三個終端機看 nvidia-smi、htop 和 vLLM 的原始指標端點,根本是在玩雜耍。我乾脆自己寫了一個儀表板把這些全部整合在一起。 現在只要一個畫面就能看到 GPU、CPU、統一記憶體、磁碟、網路的即時狀態(每秒更新一次),還有 vLLM 的關鍵數據像是吞吐量(tok/s)、首次回應時間(TTFT)、佇列時間、KV 快取使用率和前綴快取命中率。最狂的是它會自動掃描執行中的引擎,支援 Docker,如果你同時跑多個引擎還會自動分頁。另外還有 15 分鐘的滾動歷史記錄,能偵測熱節流和功率限制。後端用 Rust 寫的,前端是 React,資料透過 WebSocket 串流傳輸。有興趣的話試試看,我很想聽聽你的意見!