OpenAI hat am 25. August 2026 die ersten Benchmark-Ergebnisse für Jalapeño vorgestellt, seinen ersten selbst entwickelten Inferenz-Chip. Der Chip liefert laut Messungen mit dem InferenceX-Benchmark von SemiAnalysis 1,5- bis 1,9-fach höhere Energieeffizienz und 1,7- bis 3,6-fach niedrigere Latenz als aktuell verfügbare Prozessoren bei vergleichbarer Nutzererfahrung.

Jalapeño entstand im Rahmen von OpenAIs Full-Stack-Ansatz, bei dem das Unternehmen Modelle, Produkte, Serving-Software, Chips, Speicher, Netzwerk und Systeme gemeinsam entwickelt. Der Chip wird als „multigenerational platform" konzipiert, die in den kommenden Monaten ausgebaut werden soll.

Performance-Vorteile in Durchsatz und Latenz

Jalapeño kombiniert laut OpenAI höheren Durchsatz und niedrigere Latenz in einer einzigen Architektur. Bestehende Hardware-Systeme erfordern typischerweise einen Kompromiss zwischen diesen beiden Faktoren. Die getesteten Werte zeigen:

  • 1,5- bis 1,9-fache KI-Arbeit pro Watt bei maximaler Durchsatzleistung
  • 1,7- bis 3,6-fach niedrigere End-to-End-Latenz
  • 2,1- bis 4,1-fach höhere Leistung für hochinteraktive Workloads
  • Mehr Tokens pro Nutzer als derzeit verfügbare State-of-the-Art-Inferenz-Prozessoren

OpenAI betont, dass Performance pro Stromeinheit ein nützlicherer Standard ist als Performance pro Chip, da sich damit die tatsächlichen Betriebskosten und Umweltauswirkungen besser abbilden lassen.

Tests mit Open-Weight-Modellen

Die Performance von Jalapeño wurde über mehrere große Open-Weight-Modelle hinweg nachgewiesen, darunter GPT-OSS 120B, DeepSeek R1 (670B-Version) und Kimi K2.5 1T. Die konsistente Performance über sowohl intern bei OpenAI entwickelte als auch externe Modelle zeigt, dass die Architektur modellübergreifend funktioniert.

Der InferenceX-Benchmark von SemiAnalysis misst den gesamten Prozess der Bearbeitung einer KI-Anfrage. Jalapeño wurde über das getestete Operierbereich hinweg mit führenden kommerziell verfügbaren KI-Systemen verglichen – von High-Throughput-Serving bis zu hochinteraktiven, Low-Latency-Anwendungen.

KI-generierter Code übertrifft Experten-Implementierungen

Jalapeño wurde als vorhersehbares Programmierungsziel für Menschen und KI-Systeme konzipiert. Diese klare Struktur ermöglicht es KI-Systemen, die Zuordnung, Platzierung, Scheduling und Koordination von Aufgaben über das System hinweg zu optimieren.

KI-generierte Implementierungen für spezifische Blöcke in Open-Weight-Modellen liefen laut OpenAI 1,5- bis 1,8-mal schneller als von menschlichen Experten geschriebener Code. OpenAI-Modelle beschleunigten auch die Entwicklung von Jalapeño selbst: Frühere Generationen halfen beim Design und der Inbetriebnahme des Chips, während die neuesten Modelle die Optimierung und Programmierung beschleunigten.

Fokus auf Agenten-Workloads

OpenAI bewertet die Performance bei übereinstimmender Nutzererfahrung und misst, wie viel nützliche KI-Arbeit jedes System pro Energieeinheit bei Einhaltung der erforderlichen Latenz leisten kann. Dies ist laut Unternehmen besonders wichtig für Agenten, die viele Schritte nacheinander ausführen müssen, da sich Verzögerungen über eine gesamte Aufgabe hinweg zusammengeben können.

Die Leistungsgewinne sollen laut OpenAI dabei helfen, zunehmend leistungsfähige KI erschwinglicher und breiter verfügbar zu machen. Der Chip wird als Teil der Verwirklichung der Mission beschrieben, sicherzustellen, dass künstliche allgemeine Intelligenz der Menschheit zugute kommt.