Codifying the Judge: Skalierbare Evaluierung durch Program Distillation

arXiv:2607.22561v1 Ankündigung: Neue Arbeit. Abstract: LLM-as-a-Judge ist zum Standard für automatisierte Evaluierung geworden, leidet aber unter hohen Kosten, signifikanter Latenz und undurchsichtigen Entscheidungen – Limitierungen, die seine Skalierbarkeit und Zuverlässigkeit untergraben. Wir adressieren dies mit einer einfachen, effizienten Alternative