Robuste Kritiker: Verteidigung von LLMs gegen mehrtürige Angriffe
arXiv:2607.20472v1 Ankündigungstyp: neu Abstract: Wenn ein Nutzer ein Sprachmodell nach etwas Schädlichem fragt, ist es ein echtes Angriff oder eine missverstande, aber wohlmeinende Frage? Diese Mehrdeutigkeit ist einer der zentralen Herausforderungen der LLM-Sicherheit. Ein Modell, das das Schlimmste annimmt, schadet legitimen Nutzern; eines, das