TurboQuant من Google: استهلاك ذاكرة أقل بـ 6 مرات لاستنتاج LLM (2026)
٦ أبريل ٢٠٢٦
تقوم أداة TurboQuant من Google بضغط ذاكرة KV caches الخاصة بنماذج LLM إلى 3 بت دون أي فقدان في الدقة، مما يقلل استهلاك الذاكرة بمقدار 6 مرات ويسرع حسابات attention في معالجات H100 حتى 8 مرات مقارنة بـ FP32.