OpenDiscoveryTrace: Process Traces zur Evaluierung von AI-Scientist-Workflows
arXiv:2609.09203v1 Neuer Beitrag: Bestehende Benchmarks für autonome AI-Scientists bewerten nur finale Outputs – generierter Code, Hypothesen oder Papiere – verwerfen aber den Reasoning-Prozess, durch den diese Outputs gewonnen wurden. Dies macht es unmöglich, wissenschaftliche Methodologie zu überprüfen