Gleiche Frage, verschiedene Antworten: Evaluierung der LLM-Zuverlässigkeit jenseits der Genauigkeit

arXiv:2607.22554v1 Ankündigung: Neue Arbeit. Abstract: Große Sprachmodelle (LLMs) erzielen oft starke Genauigkeit bei Benchmarks, doch bleibt unklar, wie zuverlässig sie dieses Wissen anwenden, wenn die gleiche Frage in verschiedenen, aber äquivalenten Formulierungen gestellt wird. In dieser Arbeit untersuchen wir, wie sich Modellantworten ändern