S2T-RLHF: Hierarchische Credit Assignment für stabiles präferenzbasiertes RLHF

arXiv:2607.18258v1 Reinforcement Learning from Human Feedback (RLHF) mit präferenzbasierten Reward-Modellen zeigt oft instabile Trainingsdynamiken. Ein Schlüsselfaktor ist, dass Standard-RLHF sich auf eine einzelne Sequenz-Level-Skalar-Reward verlässt, die auf Token