Über Imitation hinaus: Filterung von On-Policy Distillation durch Reasoning Progress

arXiv:2608.19408v1 Ankündigungstyp: neu Abstract: On-Policy Distillation (OPD) hat sich als effektives Framework für Post-Training von Language Models etabliert, indem Student-generierte Trajektorien mit dichter Token-Level-Supervision von einem Teacher gekoppelt werden. OPD setzt jedoch implizit voraus, dass Teacher-abgeleitete Reward