RLPF: Reinforcement Learning aus Performance-Feedback für Code-Generierung
arXiv:2607.27271v1 Announce Type: new Abstract: Code-Modelle werden zunehmend mit Execution-Feedback trainiert, aber die meisten Trainingssignale stoppen bei Correctness. Dies hinterlässt eine wichtige Lücke für Systems-Code: zwei Programme können dieselben Tests bestehen und sich dabei in der Runtime stark unterscheiden.