Woodpecker Distillation: Schwache Modelle diagnostizieren Reasoning-Fehler in starken Modellen
arXiv:2608.05168v1 Große Language Models scheitern oft bei Reasoning-Aufgaben, obwohl sie die Fähigkeit haben, diese zu lösen. Wir argumentieren, dass viele solche Fehler von lokalisierten Reasoning-Bugs in Zwischenschritten stammen, nicht von globaler Inkompetenz