Output-bewusstes Rotation für INT2 KV-Cache-Quantisierung

arXiv:2608.02691v1 Der Key-Value (KV) Cache ist ein großer Speicher- und Bandbreitenbottleneck bei Large Language Model Inferenzen mit langem Kontext geworden, was Ultra-Low-Bit-Quantisierung zunehmend wichtig macht. Allerdings optimieren vorhandene rotationsbasierte INT2-Methoden die Cache-Statistiken suboptimal.