往下拉回到首頁
成功在 RTX 2080 SUPER 8GB 上執行 DFlash 推測解碼,運行 Qwen3.5-35B-A3B 模型

成功在 RTX 2080 SUPER 8GB 上執行 DFlash 推測解碼,運行 Qwen3.5-35B-A3B 模型

Got DFlash speculative decoding working on Qwen3.5-35B-A3B with an RTX 2080 SUPER 8GB

一位開發者在記憶體受限的 GPU 設置上成功實現了 DFlash 推測解碼(speculative decoding)技術。他們使用只有 8GB 顯存的 RTX 2080 SUPER,運行了 35B 參數的 Qwen3.5-35B-A3B 模型(量化為 Q5_K_M,約 24.44GB),並搭配更小的 Q4_K_M 草稿模型來加速推論。該設置採用 CUDA 後端,並根據 llama.cpp 儲存庫中的 DFlash PR 進行測試,證明了先進的推論最佳化技術可以在消費級硬體上運作,只要謹慎選擇量化方式和模型規格。