Signal im Spam finden: Gemeinsames Lernen von Rewards und Worker-Zuverlässigkeit aus paarweisen Vergleichen
arXiv:2608.10045v1 Das Problem des Lernens aus paarweisen Vergleichen wurde in vielen Bereichen wie Empfehlungssystemen, Sozialer Wahl und kürzlich beim Fine-Tuning großer Language Models untersucht. Das Ziel besteht darin, Item-Rewards basierend auf zu lernen.