
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

你想在筆電上跑 Qwen 3.6 35B,配備 RTX 3060 6GB 和 40GB RAM?先說實話:技術上可以,但會撞到天花板。一個 35B 的模型量化到 Q4(4 位元)大概要吃掉 18-20GB 顯存,這表示你得把一大堆東西塞到系統記憶體裡。你的 RTX 3060 Mobile 會盡力,但推理速度會很慢——大概 5-15 個 token/秒,取決於你有多少資料要在 GPU 和 RAM 之間搬來搬去。對於 PDF 摘要這種不趕時間的任務,其實還可以接受。真正的瓶頸在哪?你的 4 核心 CPU 和 PCIe 頻寬會在資料交換時拖累效能。建議先試試小一點的模型(比如 13B),看看能不能滿足需求,省得自己麻煩。用 llama.cpp 或 Ollama 這類工具來最佳化你的設定。