Memory Reward Inflation in selbstverbessernden LLM-Agenten

Sich selbst verbessernde LLM-Agenten lernen zunehmend aus Erfahrung, ohne Gewichte zu aktualisieren. Jede Episode wird in einem externen Speicher gespeichert, bewertet und für ähnliche zukünftige Aufgaben abgerufen, um späteres Verhalten zu gestalten. Aus einer Reward-Perspektive können die gespeicherten Werte zu Inflation führen