LISA: Linear-indizierte Sparse Attention für effizientes Long-Context Reasoning

arXiv:2607.19358v1 Ankündigungstyp: neu Zusammenfassung: Neuere Fortschritte in Long-Chain-of-Thought-Reasoning-Modellen wie DeepSeek-R1 haben zu zunehmend längeren Inference-Kontextlängen unter dem Test-Time-Scaling-Paradigma geführt. Die O(n^2)-Rechenkomplexität von Standard-Self-Attention verursacht jedoch