아래로 당겨서 돌아가기
ggml-cpu: x86 및 범용 CPU q1_0 점곱 최적화(후속) by pl752 · Pull Request #21636 · ggml-org/llama.cpp

ggml-cpu: x86 및 범용 CPU q1_0 점곱 최적화(후속) by pl752 · Pull Request #21636 · ggml-org/llama.cpp

ggml-cpu: Optimized x86 and generic CPU q1_0 dot (follow up) by pl752 · Pull Request #21636 · ggml-org/llama.cpp

b8858 버전부터 사용 가능합니다. 이 최적화된 CPU 버전은 토큰 생성 속도가 훨씬 빨라졌습니다. 구형 노트북(16GB DDR3 RAM)에서 테스트한 결과 0.3 t/s에서 1.7 t/s로 개선되었습니다. 다만 AVX/AVX512 미지원으로 인해 예상만큼의 성능 향상은 아니었습니다. 이번 주에 신형 노트북에서 추가 테스트 예정입니다. 참고로 Metal, Vulkan, CUDA 버전도 이 최적화를 지원하며, 1비트 양자화 버전도 있습니다. 아직 시도하지 않았다면 확인해볼 가치가 있습니다.