DataPrep-Bench: Benchmarking von LLMs als Trainingsdaten-Preparatoren
arXiv:2607.20465v1 Ankündigungstyp: neu Abstract: Die Qualität von Trainingsdaten bestimmt grundlegend die Fähigkeiten von Large Language Models (LLMs), doch es gibt keinen einheitlichen Benchmark, um zu messen, wie gut LLMs, Agents und datengetriebene Workflows Trainingsdaten end-to-end tatsächlich vorbereiten. Wir betrachten LLM