Messung der aufgabenübergreifenden Verhaltenskonsistenz in Language-Model-Agenten
arXiv:2608.13598v1 Ankündigungstyp: neu Abstract: Agent-Evaluierung stützt sich fast ausschließlich auf Ergebnis-Metriken wie Erfolgsrate, die erfassen, ob ein Agent erfolgreich ist, aber nicht wie konsistent er sich verhält. Wir argumentieren, dass die Verhaltenskonsistenz über Aufgaben hinweg eine eigenständige und messbare Eigenschaft ist, und