아래로 당겨서 돌아가기
Google의 TurboQuant(TQ)를 지금 llama-server의 KV 캐시에 바로 사용할 수 있을까? 아니면 PR을 기다려야 할까?

Google의 TurboQuant(TQ)를 지금 llama-server의 KV 캐시에 바로 사용할 수 있을까? 아니면 PR을 기다려야 할까?

Can we already use Google's TurboQuant (TQ) for KV Cache in llama-server? Or are we waiting for a PR?

여러분, Google이 TurboQuant를 발표한 이후로 계속 그 엄청난 압축 능력과 품질 유지에 대해 따라가고 있습니다. 이 커뮤니티에서도 자주 언급되지만, 솔직히 지금 바로 사용할 수 있는지, 어떻게 사용하는지 아직도 좀 헷갈립니다. 최근에 누군가 TQ 양자화를 모델 가중치에 직접 적용해서 Qwen3.5-27B를 빠르게 돌리는 글을 봤는데——