Übereinstimmung ist nicht Alignment: Divergente moralische Grundlagen in ethischen Urteilen von Menschen und LLMs
arXiv:2608.12368v1 Ankündigungstyp: neu Abstract: Übereinstimmung mit menschlichen Urteilen ist ein verbreitetes Proxy zur Bewertung des Alignment großer Language Models (LLMs). Doch Übereinstimmung in finalen Labels zeigt nicht, dass menschliche Annotatoren und Modelle auf denselben moralischen Grundlagen basieren. Zwei Agenten können zum selben Urteil gelangen, aber aus unterschiedlichen Gründen