Truth Lies Deep: Bekämpfung von semantischer Tarnung via Latent Intent Verification

arXiv:2608.20378v1 Ankündigung: neu Zusammenfassung: Safety Alignment in Large Language Models (LLMs) ist oft oberflächlich und verlässt sich auf Ablehungsmechanismen, die nur in den letzten Generierungsphasen auslösen, ohne das fundamentale Wissen über schädliche Konzepte zu löschen, das während des Pretraining erworben wurde. Diese Studie…