Beyond KV Reconstruction: Funktionale Rekonstruktion für MLA Draft Models in Speculative Decoding
arXiv:2607.27269v1 Announce Type: new Abstract: Multi-Head Latent Attention (MLA) wird zunehmend wichtig für Long-Context LLM Inferenz, da kompakte latente Zustände den wachsenden Key-Value (KV) Cache ersetzen und den Decoding-Memory-Traffic reduzieren. Doch die meisten fähigen Open Checkpoints verwenden Multi-Head oder Grouped Attention.