Lernen, Middle-Layer Attention in MLLMs zur Visual Token Pruning vorherzusagen

arXiv:2608.06411v1 Ankündigungstyp: neu Abstract: Multimodale Large Language Models (MLLMs) erzielen starke Leistungen in verschiedenen Vision-Language-Aufgaben, aber ihre Effizienz ist durch die Kosten der Verarbeitung zahlreicher visueller Token begrenzt. Visual Token Pruning kann diese Kosten reduzieren, erfordert aber genaue