Leistung, Effizienz und Zusammenbruch – Vorteile und Herausforderungen beim Offline-Nachtraining von Code-LLMs
arXiv:2609.11956v1 Nachtraining mit Reinforcement Learning (RL) ist eine kritische Phase bei der Entwicklung von Code-generierenden Large Language Models (LLMs), da es die Einhaltung von Anweisungen und die Produktion von funktionell korrektem Code gewährleistet. Dieser Prozess erfordert typischerweise