SAAG: Structured Agent Assessment and Grounding
arXiv:2607.18245v1 Exakte Übereinstimmungsbewertung von Agent-Aufrufen verdeckt qualitativ unterschiedliche Fehlermodi: Ein Modell kann die richtige Funktion auswählen, doch Argumentwerte halluzinieren, oder ein Schema erfüllen, während es einen Agent aus falschem Grund wählt. Bestehende Benchmarks vereinfachen