LoKiFormer: Lokaliätsbewusstseinsachtung mit entkoppeltem Knowledge-Memory für effizientes Large Language Model Pretraining
arXiv:2608.12419v1 Ankündigungstyp: neu Abstract: Large Language Models (LLMs) haben bemerkenswerte Durchbrüche in vielen Anwendungen erreicht. Allerdings bleiben ihre Architekturen beim Pretraining ineffizient aufgrund von zwei Hauptbeschränkungen: (i) Self-Attention hat keine explizite induktive Verzerrung für Lokalität