Wenn privilegierte Anleitung fehlschlägt: State-matched Routing und kontextualisierte Self-Distillation für Multi-Turn Agents

arXiv:2608.05219v1 Privilegierte On-Policy-Destillation bietet dichte Supervision für Multi-Turn Agents, indem ein synchronisierter Teacher die Antwort des Students bei jedem Turn mit Zugang zu nur im Training verfügbaren Referenzen erneut bewertet