
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

有開發者分享了他們精心調教的 Qwen3.6 27B 在 llama.cpp 上的執行配置,目標是讓推理速度和回答品質都達到最佳狀態。這套配置用了 GPU 加速(ngl 999)、超大上下文視窗(19.6 萬個 token)、推測解碼(speculative decoding)和推理模式。批次大小設定在 1024/512、開啟閃電注意力(flash attention),溫度和取樣參數也經過精心平衡,確保生成的回答既快又有品質。如果你也在本地跑這個模型,這份配置絕對值得參考。