
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

一位開發者成功在 OnePlus 12(搭載高通 Snapdragon 8 Gen 3)上執行 llama.cpp,並使用 Hexagon NPU 後端。他們按照高通官方文件進行交叉編譯,在 Ubuntu 上編譯後複製到手機的 Termux 目錄。成果令人印象深刻:Gemma-3-12B 達到 8 tokens/秒(提示詞處理)和 4.5 tokens/秒(文字生成),而較小的 Gemma-3-4B 模型則達到 20 tokens/秒和 12.5 tokens/秒。高通似乎對這個後端投入很大,有多個來自他們工程師的拉取請求,這表明高通對在行動裝置上直接執行大型語言模型有強力的官方支持。