往下拉回到首頁
Google 的 TurboQuant(TQ)現在能直接用在 llama-server 的 KV 快取嗎?還是要等 PR 合併?

Google 的 TurboQuant(TQ)現在能直接用在 llama-server 的 KV 快取嗎?還是要等 PR 合併?

Can we already use Google's TurboQuant (TQ) for KV Cache in llama-server? Or are we waiting for a PR?

各位朋友,自從 Google 發表 TurboQuant 以來,我一直在追蹤它那誇張的壓縮能力卻不損失品質的消息。這個技術在這個社群裡被提到爆炸,但說實話,經過這麼多討論我還是有點霧煞煞:這東西現在到底能不能直接用?要怎麼用?我最近看到有人把 TQ 量化直接套用在模型權重上,成功讓 Qwen3.5-27B 跑得飛快——