Safety Alignment Illusion: Die sprachübergreifende Sicherheitslücke in LLMs
arXiv:2608.18131v1 Das aktuelle Safety-Alignment-Training für Large Language Models ist stark auf Englisch konzentriert. Wenn diese Sicherheitsfilter bei nicht-englischen Sprachen ausfallen, sind die Konsequenzen unmittelbar und nutzerseitig: Sprachassistenten und Sprach-Dialog-Systeme können Probleme verursachen.