WebGrader: Training von LLMs für Web Development mit selbstentwickelndem programmatischem Grader

arXiv:2608.06474v1 Ankündigungstyp: neu Abstract: Large Language Models generieren zunehmend vollständige Websites aus natürlichsprachigen Beschreibungen, und Reinforcement Learning ist zu einem zentralen Ansatz zur Schließung ihrer verbleibenden funktionalen Lücke geworden. Dieses Trainingssystem ist durch Reward Design begrenzt