下に引いて戻る
ggml-cpu:x86およびジェネリックCPU q1_0ドット積の最適化(フォローアップ)by pl752 · Pull Request #21636 · ggml-org/llama.cpp

ggml-cpu:x86およびジェネリックCPU q1_0ドット積の最適化(フォローアップ)by pl752 · Pull Request #21636 · ggml-org/llama.cpp

ggml-cpu: Optimized x86 and generic CPU q1_0 dot (follow up) by pl752 · Pull Request #21636 · ggml-org/llama.cpp

b8858コミット以降で利用可能。この最適化されたCPUバージョンはトークン生成速度が大幅に向上しました。古いノートパソコン(16GB DDR3 RAM)でのテストでは、0.3 t/sから1.7 t/sへの改善が確認されました。ただし、AVX/AVX512非対応のため、期待ほどの性能向上には至りませんでした。新しいノートパソコンでの追加テストを予定中。ちなみに、MetalやVulkan、CUDAバージョンもこの最適化に対応しており、1ビット量子化版も利用可能です。まだ試していなければ、チェックしてみる価値があります。