LeanStream: Ein Speculate-and-Refine-Streaming-Framework für effiziente On-Device LLM Inferenz

arXiv:2609.03079v1 Ankündigungstyp: neu Abstract: On-Device LLM Inferenz ist attraktiv für Datenschutz und Reaktionsfähigkeit, bleibt aber auf mobilen und eingebetteten Geräten herausfordernd, weil Modellgewichte den verfügbaren DRAM weit übersteigen. Frühere Systeme nutzen Activation Sparsity und lagern Gewichte auf SSD oder Flash aus