Synchronisierung von Überzeugungen mit Second-Order Theory-of-Mind in Human-Autonomy Teams (erweiterte Version)

arXiv:2608.11229v1 Ankündigungstyp: neu Abstrakt: Vergleichendes Feedback, das Menschen fragt, welches von zwei Verhaltensweisen sie bevorzugen, ist zur Standardmethode geworden, um Robot- und Agent-Verhalten mit menschlichen Absichten abzustimmen, wenn die Belohnung selbst nicht direkt angegeben werden kann. Präferenzbasiertes Reward Learning wirft typischerweise…