26/08/2026
Emlékeztető — erről is írtunk:
A Google TurboQuant algoritmusa akár 7-szeresére tömöríti a modellek KV cache-ét, vagyis az AI memóriaigényét. Kevesebb memória, több párhuzamos kérés, olcsóbb inferencia.
A memória ma is az AI-futtatás egyik fő költsége, így ez a téma a bemutató után is pontosan annyira aktuális.
👇 A cikk a kommentben.