往下拉回到首頁
終於受不了了!我用一個儀表板統一管理 DGX Spark 的所有監控數據

終於受不了了!我用一個儀表板統一管理 DGX Spark 的所有監控數據

Built a real-time dashboard for the DGX Spark. Give it a try, I'd love the feedback

你知道在跑大型 AI(LLM)模型時有多煩嗎?要同時開三個終端機看 nvidia-smi、htop 和 vLLM 的原始指標端點,根本是在玩雜耍。我乾脆自己寫了一個儀表板把這些全部整合在一起。 現在只要一個畫面就能看到 GPU、CPU、統一記憶體、磁碟、網路的即時狀態(每秒更新一次),還有 vLLM 的關鍵數據像是吞吐量(tok/s)、首次回應時間(TTFT)、佇列時間、KV 快取使用率和前綴快取命中率。最狂的是它會自動掃描執行中的引擎,支援 Docker,如果你同時跑多個引擎還會自動分頁。另外還有 15 分鐘的滾動歷史記錄,能偵測熱節流和功率限制。後端用 Rust 寫的,前端是 React,資料透過 WebSocket 串流傳輸。有興趣的話試試看,我很想聽聽你的意見!