Kalibrierte selektive Faktenprüfung über Beweisverlauf-Evaluierung
arXiv:2607.18240v1 Large Language Models (LLMs) können starke Faktenprüfungsgenauigkeit erreichen, doch erzwungene binäre Entscheidungen verbergen ein kritisches Zuverlässigkeitsproblem: Systeme können selbstbewusste Urteile fällen, auch wenn die unterstützenden Beweise schwach, spärlich oder intern inkonsistent sind.