Ein offenes Rezept für IMO-Gold: Training von Nemotron für Olympiade-Mathematik
arXiv:2609.10712v1 Ankündigung: Neu. Zusammenfassung: Wir untersuchen, wie Model-Post-Training und Test-Zeit-Inferenzdesign die Generierung von natürlichsprachigen Beweisen für schwierige Olympiade-Mathematik beeinflussen. Ausgehend von Nemotron 3 Ultra trainieren wir zwei Spezialisten-Checkpoints mit überwachtem Fine-Tuning und Reinforcement Learning