Wie viel einer gemessenen AI-Präferenz ist das Modell, und wie viel ist das Messinstrument?
arXiv:2608.23641v1 Ankündigungstyp: neu Abstract: Model-Welfare-Forschung schlussfolgert, was ein Modell bevorzugt, aus den Antworten auf Prompts, die geschrieben wurden, um Präferenzen zu ermitteln. Keeling et al. (2024), Mazeika et al. (2025), Mikaelson et al. (2025), Tagliabue und Dung (2025) sowie Trhlik et al. (2026) haben