
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

有人在 llama.cpp 測試推測解碼(speculative decoding)——一種一次預測多個詞元來加速的技術——結果卻得到超詭異的結果。用同樣的設定,Gemma 4 31b 快了一倍(100% 提升),Qwen 3.6 只快了 40%,但 Devstrall small 竟然快了 665%。問題來了:這些模型到底有什麼差異,才會讓推測解碼的效果差這麼多?他們後來發現調整重複懲罰(repeat penalty)和推測類型可以讓 Qwen 追上來。這是在探討為什麼同一個優化技巧對不同模型的效果天差地遠。