Multi-Head Attention Residuals

arXiv:2607.27230v1 Announce Type: new Abstract: Transformer propagieren Informationen über die Tiefe durch einen einzigen additiven Residual-Stream: jede Sublayer liest nur den neuesten Zustand. Attention Residuals lockern dies auf, indem jede Sublayer durch eine gelernte Softmax aufmerksam wird.