下に引いて戻る
Google の TurboQuant(TQ)は今すぐ llama-server の KV キャッシュに使える?それとも PR を待つ必要がある?

Google の TurboQuant(TQ)は今すぐ llama-server の KV キャッシュに使える?それとも PR を待つ必要がある?

Can we already use Google's TurboQuant (TQ) for KV Cache in llama-server? Or are we waiting for a PR?

皆さん、Google が TurboQuant を発表してから、その驚異的な圧縮能力と品質維持についてずっと追い続けています。このサブでも頻繁に話題になっていますが、正直なところ、実際に今すぐ使えるのかどうか、どうやって使うのか、まだよく分かっていません。最近、誰かが TQ 量化をモデルの重みに直接適用して、Qwen3.5-27B を高速で動かしているという記事を見かけました——