StateSight: Benchmarking von latenter räumlicher State-Rekonstruktion in Vision-Language Models

arXiv:2608.20414v1 Ankündigung: neu Zusammenfassung: Vision-Language Models werden zunehmend für multimodale Question Answering verwendet, doch ihre Fähigkeit, latente räumliche Struktur aus einem einzelnen Bild zu rekonstruieren, bleibt schwierig zu isolieren. Breite Benchmarks kombinieren oft Wahrnehmung, optische Zeichenerkennung…