Lesen oder Umschreiben VLMs? Zur Transkriptionstreue in Vision-Language Models

arXiv:2607.21617v1 Vision Language Models werden zunehmend anstelle herkömmlicher OCR-Pipelines für das Dokumentenverständnis eingesetzt. In diesem Paper zeigen wir, dass sie nicht immer als treue Transkriptoren fungieren: Wenn Text fehlerhaft ist, neigen sie dazu, ihn oft in eine verbesserte Form…