Tail-Likelihood Reinforcement Learning

arXiv:2609.02987v1 Ankündigungstyp: neu Abstract: Reinforcement Learning optimiert typischerweise die durchschnittliche Belohnung. Bei generativen Policies kann der Durchschnitt einen wichtigen Unterschied verbergen: Zwei Policies können die gleiche mittlere Belohnung erreichen, während sie sehr unterschiedliche Chancen haben, eine seltene aber hochwertige Rolle zu produzieren