
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

一位開發者在記憶體受限的 GPU 設置上成功實現了 DFlash 推測解碼(speculative decoding)技術。他們使用只有 8GB 顯存的 RTX 2080 SUPER,運行了 35B 參數的 Qwen3.5-35B-A3B 模型(量化為 Q5_K_M,約 24.44GB),並搭配更小的 Q4_K_M 草稿模型來加速推論。該設置採用 CUDA 後端,並根據 llama.cpp 儲存庫中的 DFlash PR 進行測試,證明了先進的推論最佳化技術可以在消費級硬體上運作,只要謹慎選擇量化方式和模型規格。