Unvollständige Prompt-Jailbreaks in Large Language Models

arXiv:2607.20473v1 Ankündigungstyp: neu Abstract: Large Language Models (LLMs) werden zunehmend als Open-Weight-Modelle mit Schutzmaßnahmen gegen schädliche Anfragen freigegeben. Dennoch bleibt die Satzvervollständigung anfällig für unvollständige schädliche Prompts. In dieser Arbeit formalisieren wir dieses Phänomen als unvollständige