Data-DPO: Direct Preference Optimization für Zielmodell-Datenselektion beim LLM Post-Training
arXiv:2608.16926v1 Ankündigungstyp: neu Abstract: Datenselektion beim überwachten Fine-Tuning zielt darauf ab, eine kleine Menge effektiver Stichproben aus großflächigen Kandidatendaten auszuwählen, Trainingskosten zu senken und gleichzeitig die Modellleistung zu bewahren. Bestehende Methoden behandeln jedoch normalerweise Datenwert als relativ statisch