Präzise aber entkoppelt: Reviewer-Genauigkeit garantiert keine Kritik-Umsetzung im Multi-Agent Math Reasoning

Viele mathe- und wissenschaftsorientierte Agent-Systeme nutzen hierarchische Designs mit spezialisierten Reviewer-Rollen, in der Annahme, dass eine dedizierte Review-Phase falsche Kandidaten in richtige umwandeln sollte. Wir testen diese Annahme an 4.181 verifier-gestützten Omni-