Jenseits von Routing-Gewichten: Treue Response-Level-Interpretation von Mixture-of-Experts Reward Models via Contribution Contrast

arXiv:2608.06400v1 Ankündigungstyp: neu Abstract: Reward Models sind zentral für das Lernen aus menschlichen Vorlieben, doch die Identifizierung der Faktoren, die ihre Vorhersagen antreiben, bleibt eine Herausforderung. Aktuelle sparse Mixture-of-Experts (MoE) Reward Models versuchen die Interpretierbarkeit zu verbessern, indem sie Prompts zu spezialisierten Experten routen