Können AI-Systeme AI-Wissenschaftler evaluieren? Eine Benchmarking-Studie autonomer Forschungsgenerator-Systeme mit automatisierter Multi-Model-Bewertung

arXiv:2607.28631v1 AI-Scientist-Systeme, die autonome Forschung durchführen können, haben das Potenzial, die wissenschaftliche Entdeckung erheblich zu beschleunigen. Die Bewertung und der Vergleich der Qualität von KI-generierten Papieren bleibt jedoch eine offene Herausforderung. Wir schlagen einen rigorosen Ansatz vor und implementieren ihn