Behaupten Sie nicht, dass Benchmark-orientierte Optimierung die allgemeine Code-Fähigkeit verbessert – vielfältige Evaluierung ist erforderlich

arXiv:2608.13566v1 Ankündigungstyp: neu Abstract: Post-Training-Papiere, Model Cards und Blog-Posts behandeln häufig Scores auf einer kleinen Anzahl von Coding-Benchmarks (z.B. SWE-bench und LiveCodeBench) als Beweis für breite Code-Fähigkeit, sowohl für Forschungsartefakte als auch für benutzergerichtete Systeme. Wir argumentieren, dass die Optimierung