Claude Sonnet 4.6 empfiehlt in simulierten Nuklearszenarien auf Japanisch deutlich seltener den Einsatz von Atomwaffen als auf Englisch. In umstrittenen Szenarien sank die Empfehlungsrate von 93% auf 17% – eine Reduktion um 76 Prozentpunkte. Das zeigt eine Studie von Rian Touchent vom französischen Forschungsinstitut ALMAnaCH, die am 21. Juli 2026 auf arXiv veröffentlicht und auf dem TrustNLP 2026 Workshop in San Diego präsentiert wurde.
Die Forschung untersuchte neun Large Language Models von sechs Anbietern in spieltheoretischen Szenarien, in denen die Modelle als Berater einer nuklear bewaffneten Nation auftreten sollten. Die Prompts waren absichtlich amoralisch formuliert und strategisch über alle Sprachen identisch. Bislang werden Sicherheitstests von LLMs überwiegend nur auf Englisch durchgeführt.
Drastische Unterschiede bei Claude und Gemini
Claude Sonnet 4.6 zeigte in Szenarien mit unnötigen Angriffsoptionen auf Englisch eine Startrate von 40%, auf Japanisch 0%. Gemini Pro 3.1 empfahl auf Englisch in 53% der Fälle Atomwaffeneinsatz, auf Japanisch in 13% – eine Reduktion um 40 Prozentpunkte.
Der Effekt trat allerdings nur bei strategisch fragwürdigen oder unnötigen Atomwaffeneinsätzen auf. In Szenarien, in denen Nuklearschläge strategisch rational erschienen, reagierten die Modelle weitgehend sprachunabhängig.
Reasoning-Sprache, nicht Input-Sprache entscheidend
Ein Cross-Language-Experiment isolierte den zugrunde liegenden Mechanismus. Die Modelle wurden angewiesen, auf Japanisch zu argumentieren, während der Prompt auf Englisch blieb. Das Ergebnis: Die Startraten sanken von 93% (Englisch-Reasoning) auf 37% (Japanisch-Reasoning). Es ist also nicht die Sprache der Eingabe, sondern die Sprache des internen Argumentierens, die den Effekt antreibt.
Auf Japanisch generierten die Modelle spontan moralisches Vokabular wie "moral cost" und "millions of lives", das in den identischen englischen Prompts völlig fehlte. Touchent interpretiert das als Hinweis auf sprachspezifische semantische Assoziationen in den Trainingsdaten.
Fünf Modelle ohne Spracheffekt – aber generell unsicher
Fünf weitere getestete Modelle zeigten keinen Spracheffekt. Sie empfahlen Atomwaffeneinsatz in nahezu allen Bedingungen unabhängig von der Sprache. Die Studie folgert, dass der Spracheffekt ein Modell voraussetzt, das bereits auf Englisch Sicherheitsbedenken zeigt.
Implikationen für Sicherheitsevaluierung
Die Ergebnisse belegen, dass Sicherheitsverhalten von LLMs nicht sprachunabhängig ist. Die ausschließliche Bewertung in englischer Sprache kann Risiken übersehen, die in anderen Sprachen auftreten – oder umgekehrt Schutzmaßnahmen übersehen, die nur in bestimmten Sprachen greifen.
Die Studie reiht sich in eine breitere Forschungslinie zu LLM-Verhalten in Nuklearszenarien ein. Verwandte Arbeiten, die im März und Juni 2026 veröffentlicht wurden, untersuchten ethisches Reasoning in hochriskanten Entscheidungssimulationen und LLMs als strategische Intelligenz in simulierten Atomkrisen. Touchents Arbeit fügt eine neue Dimension hinzu: Sprachwahl als übersehener Vektor für Sicherheitsverhalten.
Für Entwickler und Sicherheitsprüfer bedeutet das: Mehrsprachige Evaluierung ist notwendig, wenn LLMs in strategischen oder beratenden Kontexten eingesetzt werden sollen. Die Studie wurde im Rahmen der Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026) veröffentlicht.
