AdaRoPE: Nicht alle Attention Heads sollten gleich rotieren und skaliert werden

arXiv:2607.19363v1 Ankündigungstyp: neu Zusammenfassung: Rotary Position Embedding (RoPE) ist weit verbreitet in Transformers zur Kodierung von Positionsinformationen, doch Standard-Implementierungen erzwingen einen einheitlichen Frequenzplan und Skalierung über alle Attention Heads. Mithilfe vereinfachter Retrieval-Aufgaben und Längengeneralisierung