Gib Bits aus wo Anfragen schauen: KV-Cache-Vektor-Quantisierung mit Attention-erhaltenden Transformationen
arXiv:2608.04074v1 Ankündigungstyp: neu Zusammenfassung: Das Dekodieren mit langem Kontext in LLMs liest den Key-Value (KV)-Cache bei jedem Schritt. Das Laden dauert länger als das Berechnen der Aufmerksamkeit darüber, daher ist der Durchsatz bandbreitenbegrenzt. Daher kann die Reduktion der Cache-Größe sowohl die Dekodiergeschwindigkeit als auch die Serving-Kapazität erhöhen. Der…