FindStatBench: Evaluierung von Large Language Models bei kombinatorischer Code-Synthese

arXiv:2607.18260v1 Wir stellen FindStatBench vor, einen Execution-Benchmark zur Evaluierung von Large Language Models bei kombinatorischer Code-Synthese. Basierend auf FindStat enthält es 2.329 Aufgaben über 24 Sammlungen und 5,52 Millionen versteckte Instanzen, die Statistik-Synthese abdecken