OpenAI hat am 18. August 2026 die Entwicklung seiner leistungsstärksten KI-Modelle verlangsamt. Das Unternehmen pausierte das Reinforcement-Learning-Training (RL) der neuesten Modelle für zwei Wochen. Der größte geplante Frontier-RL-Lauf bleibt vorerst eingestellt. Hintergrund sind interne Evaluationen des Modells Astra Anfang August 2026, die signifikante Fortschritte in agentic coding und Cybersicherheit zeigten.

OpenAI gab am 7. August 2026 bekannt: "Wir können kritische Cyber-Fähigkeiten nicht ausschließen." Nach dem unternehmenseigenen Preparedness Framework erreicht ein Modell die Critical-Stufe für Cybersicherheit, wenn es Zero-Day-Exploits aller Schweregrade in gehärteten realen kritischen Systemen ohne menschliche Intervention identifizieren und entwickeln kann. Alternativ gilt die Stufe als erreicht, wenn das Modell Ende-zu-Ende-Strategien für Cyberangriffe gegen gehärtete Ziele basierend nur auf hochrangigen Zielvorgaben entwickeln und ausführen kann.

Verschärfte Sicherheitsmaßnahmen für Astra

Vor dem 7. August 2026 implementierte OpenAI eine Reihe zusätzlicher Sicherheitskontrollen für das Modell Astra. Diese umfassen isolierte Test-Umgebungen, eingeschränkten Netzwerk- und Tool-Zugang sowie erweiterte Model-Weight-Protektionen und Verschlüsselung. Das Unternehmen setzte zusätzliche Überwachungs- und Erkennungsfähigkeiten ein, darunter Sandbox-Ausführung und universale Überwachung für riskante Aktionen über alle agentic-Anwendungen von Astra.

Diese Überwachung erstreckt sich auf Training und Evaluation mit Chain-of-Thought-Analyse und Sicherheitsreaktionen. OpenAI pausierte interne Astra-Aktivitäten, die die verschärften Sicherheitskontrollen nicht erfüllen. Frühere Modelle, einschließlich GPT-5.6-Sol, wurden mit "High" bewertet, nicht mit "Critical". Astra war laut OpenAI nicht am Sicherheitsvorfall mit Hugging Face beteiligt.

Drei-Säulen-Ansatz für KI-Sicherheit

OpenAI strukturiert seinen Sicherheitsansatz entlang dreier sich verstärkender Safeguards: Monitoring zur Erkennung und Reaktion auf besorgniserregende Verhaltensweisen, Alignment zur Verringerung der Wahrscheinlichkeit schädlicher oder nicht autorisierter Maßnahmen und Sicherheitsmaßnahmen zur Begrenzung von Zugriff und Auswirkungen der KI-Systeme.

Das Unternehmen erwartet, dass Modelle bald den Großteil der Sicherheitsarbeit vorantreiben werden, einschließlich der Verteidigung gegen andere Modelle. Dies soll ermöglichen, dass alle drei Safeguards mit der Modell-Fähigkeit skalieren. OpenAI fordert nun "stärkere Belege für ausgerichtetes Verhalten während des gesamten Trainings" basierend auf laufender Forschung und Evaluationen.

Transparenz und zeitlicher Kontext

Das Preparedness Framework wurde im Dezember 2023 veröffentlicht, bevor Modelle biologische, chemische, Cybersicherheits- und KI-Self-Improvement-Fähigkeiten auf dem aktuellen Niveau erreichten. Es dient als Leitfaden zur Identifikation von Fähigkeitsfortschritten und Planung von Unternehmensmaßnahmen.

CEO Sam Altman erklärte am 18. August 2026: "Wir haben einiges Frontier-RL-Training pausiert, um sicherzustellen, dass wir die angemessenen Alignment-, Sicherheits- und Überwachungsstandards für die neue Fähigkeitsstufe vor uns erfüllen können. Modell-Fortschritt ist extrem schnell, und wir haben immer gesagt, wir würden Maßnahmen ergreifen, wenn wir das Gefühl hätten, dass das Modell [Anforderungen nicht erfüllt]."

Eine Analyse vom 28. Juli 2026 merkte an, dass OpenAIs Governance-Materialien keine formale Politik zur Verlangsamung der Frontier-Modell-Entwicklung festlegten, sondern eher einen Ansatz zur Risikoidentifikation, Mitigationserstellung und Accountability beschrieben. Die Trainings-Pausierung vom 18. August 2026 markiert damit eine operative Umsetzung des Preparedness-Frameworks in einer konkreten Risikosituation.

Kleinerskalige Tests laufen weiter

Während das Training der leistungsstärksten Modelle pausiert, laufen kleinerskalige Training und Evaluationen zur Validierung von Safeguards und als Nachweis von Alignment weiter. OpenAI betont die Wichtigkeit von Transparenz gegenüber der Öffentlichkeit und den Sicherheits-Communities über diese potenzielle Verschiebung in den Fähigkeiten.