Sprachlicher Kontext kodiert visuelle Darstellungen in Vision-Language-Modellen neu

Zielgerichtete visuelle Verarbeitung ist ein Merkmal menschlicher visueller Intelligenz und führt zu Darstellungen, die nachgelagerte Aufgaben wie Kategorisierung oder Suche unterstützen. Obwohl Vision-Language-Modelle (VLMs) häufig mit denselben Aufgaben konfrontiert sind, unterscheiden sich ihre Darstellungsweisen