Rekurrente Residuale Quantisierung: Eine Progressive Multi-Präzisions-Repräsentation für LLMs
arXiv:2608.04048v1 Ankündigungstyp: neu Zusammenfassung: Die Bereitstellung großer Sprachmodelle (LLMs) unter verschiedenen Deployment-Zwängen erfordert flexible Kompromisse zwischen Genauigkeit, Speicherfußabdruck und Durchsatz. Allerdings erfordern herkömmliche Quantisierungsmethoden typischerweise einen separaten Checkpoint für jedes Ziel…