Vision-Language-Modelle (VLMs) stoßen bei mehrsprachigen Anwendungen an systematische Grenzen. Mehrere Studien aus den vergangenen zwölf Monaten dokumentieren Schwachstellen in Sicherheit, semantischem Verständnis und kultureller Anpassung. Die Forschung zeigt, dass englischzentriertes Design die Leistung in anderen Sprachen einschränkt.
Englischzentrierung dominiert Modelldesign
Die TowerVision-Studie, veröffentlicht am 22. Oktober 2025 in überarbeiteter Fassung vom 6. November 2025, belegt, dass die meisten VLMs einem englischzentrierten Designprozess folgen. Die Untersuchung analysierte Trainingsdatenzusammensetzung, Encoder-Auswahl und Text-Backbones.
Als Reaktion entwickelten die Forscher TowerVision, eine Familie offener mehrsprachiger VLMs für Bild-Text- und Video-Text-Aufgaben, aufgebaut auf dem mehrsprachigen Text-Modell Tower+. Das System wurde in neun Sprachen evaluiert: Englisch, Europäisches Portugiesisch, Französisch, Niederländisch, Deutsch, Spanisch, Italienisch, Koreanisch und Chinesisch.
Sicherheitsrisiken in mehrsprachigen Kontexten
Die MLingualFC-Studie vom 5. Juni 2026 weist nach, dass VLMs erhebliche Anfälligkeit für Jailbreak-Angriffe in mehrsprachigen Umgebungen aufweisen. Strukturelle visuelle Prompts wie Flowcharts können Sicherheitsvorkehrungen effektiv überwinden.
Die Multi-Everything-Studie vom 6. November 2024 offenbarte weitere Herausforderungen bei der Hate-Speech-Erkennung: VLMs müssen mit multimodalen, mehrsprachigen Inhalten und unterschiedlichen kulturellen Wahrnehmungen umgehen – eine Aufgabe, bei der aktuelle Systeme Schwächen zeigen.
Semantische und syntaktische Limitierungen
Die Seeing Syntax-Studie vom 11. Dezember 2024 dokumentiert erhebliche Limitierungen in den Text-Encodern von VLMs. Die Systeme scheitern besonders bei Kompositionalität und semantischem Verständnis komplexer sprachlicher Strukturen.
Bei Vision-Language-Translation (VLT) ergeben sich zusätzliche Probleme. Eine Studie vom 13. Juni 2025 zeigt, dass VLT die genaue Erkennung mehrsprachiger Texte in Bildern und deren Übersetzung in die Zielsprache mit visueller Kontextunterstützung erfordert. Trotz starker mehrsprachiger Fähigkeiten neuerer Large Vision-Language Models (LVLMs) fehlt eine systematische Bewertung ihrer VLT-Leistung.
TowerVision zeigt Verbesserungen durch kulturellen Kontext
TowerVision erreichte auf mehreren multimodalen mehrsprachigen Benchmarks wettbewerbsfähige Ergebnisse. Das Modell übertrifft bestehende Ansätze bei kulturell verankerten Aufgaben und multimodaler Übersetzung – durch Integration visuellen und kulturellen Kontexts während des Fine-Tunings.
Die Ergebnisse:
- Verbesserte Performance auf ALM-Bench und Multi30K (Bildaufgaben) sowie ViMUL-Bench (Videoaufgaben)
- TowerVision übertraf bestehende Modelle, die mit wesentlich größeren Datensätzen trainiert wurden
- Multilingual Vision-Language-Trainingsdaten verbesserten die sprachübergreifende Generalisierung von High-Resource zu unterrepräsentierten Sprachen und umgekehrt
- Instruction-tuned LLMs erwiesen sich nicht immer als optimaler Initialisierungspunkt
Survey identifiziert Spannungsfeld
Eine Übersichtsarbeit vom 26. September 2025 untersuchte 31 multilingual VLMs und 21 Benchmarks über Encoder-only und generative Architekturen hinweg. Die Autoren identifizierten eine Schlüsselspannung zwischen Sprachneutralität und praktischer Mehrsprachigkeit.
Die Forschungslandschaft zeigt, dass Vision-Language-Modelle in mehrsprachigen Kontexten grundlegende Fragilität aufweisen. Die Integration mehrsprachiger Trainingsdaten und kultureller Kontexte während des Trainings und Fine-Tunings erweist sich als kritisch für robustere Performance – während erhebliche Herausforderungen in Sicherheit, syntaktischem Verständnis und konsistenter Mehrsprachigkeit bestehen bleiben.
