OpenAI hat am 23. April 2026 GPT-5.5 gelauncht — und der Sprung gegenueber GPT-5.4 ist deutlicher als das Versionssprung-Komma vermuten laesst. Wir haben die Benchmarks geprueft, die Praxis getestet und zeigen dir, was der neue Default in ChatGPT Pro und der API fuer deine Workflows bedeutet.

Was GPT-5.5 in einem Satz anders macht

Native Omnimodalitaet, ein massiver Long-Context-Sprung und die neue Coding-Krone in der Konsole. Das ist die Kurzfassung. OpenAI hat nicht einfach mehr Parameter draufgepackt, sondern die Architektur konsolidiert — und im Long-Context-Bereich einen 37-Punkte-Sprung hingelegt.

Native Omnimodalitaet: Endlich kein Stitching mehr

Bisher waren GPTs “multimodal” durch Stitching: Text-Modell, Vision-Encoder, Audio-Modell, alle mit Glue-Code verbunden. GPT-5.5 ist nativ omnimodal — eine einzige Architektur, die Text Bild Audio Video gleichzeitig verarbeitet und in jedem Modus antworten kann.

Was das in der Praxis aendert:

  • Du schickst ein YouTube-Video plus Transkript plus Folien — GPT-5.5 versteht den Zusammenhang ohne separate Aufrufe
  • Audio-Eingaben werden mit Bild-Kontext gemeinsam interpretiert (z.B. “Was sagt die Person im Video bei 02:14, waehrend das Diagramm gezeigt wird?”)
  • Latenz fuer Multi-Modal-Aufrufe sinkt um 40-60%, weil keine Pipeline mehr durchlaufen wird

Das ist eine groessere Sache als sie klingt. Fuer Use-Cases wie Customer-Support mit Screenshots, Video-Tutorials oder Meeting-Recaps mit Slides ist das ein Qualitaetssprung.

Die Benchmarks die zaehlen

OpenAI hat die Zahlen gegen GPT-5.4 und Claude Opus 4.7 veroeffentlicht. Wir haben sie konsolidiert (offizielle Eval-Werte und Re-Tests von CodeRabbit, Vellum):

BenchmarkGPT-5.5GPT-5.4Claude Opus 4.7Gemini 3.1 Pro
Expert-SWE (20h-Tasks)73,1%68,5%71,2%64,8%
Terminal-Bench 2.082,7%67,4%69,4%58,2%
SWE-Bench Pro79,1%57,7%64,3%54,2%
MRCR v2 (512K-1M)74,0%36,6%68,3%71,5%
GPQA Diamond92,8%87,3%94,2%94,3%
FrontierMath 251,4%38,2%44,1%41,9%

Drei Werte stechen hervor:

Terminal-Bench 2.0 mit 82,7%. OpenAI fuehrt hier mit 13 Punkten Vorsprung vor Claude Opus 4.7 — der bisherige Champion in dieser Disziplin. Terminal-Bench misst echte Shell-Tasks: Repos clonen, Bugs reproduzieren, Tests fixen, ohne menschliche Hilfe. Das ist der Benchmark, der am direktesten mit “kann der Agent eigenstaendig arbeiten” korreliert.

MRCR v2 mit 74,0%. Dieser Long-Context-Sprung ist krass. GPT-5.4 lag bei 36,6%. Der MRCR-Benchmark testet, ob das Modell mehrere konkurrierende Antworten in 512K-1M-Token-Kontexten korrekt abruft. Der 37-Punkte-Sprung bedeutet: GPT-5.5 verliert bei langen Codebases und Doku-Pakete deutlich seltener den Faden.

Expert-SWE mit 73,1%. OpenAIs interner Benchmark fuer 20-Stunden-Coding-Tasks. Das sind keine Snippets — das sind komplette Feature-Implementierungen mit Tests, Doku und Refactoring.

Coding und Computer-Use: Der direkte Angriff auf Claude Code

Die staerksten Verbesserungen liegen bei agentischen Tasks. OpenAI hat GPT-5.5 explizit auf Computer-Use trainiert — also Mausbewegungen, Tastatureingaben, Browser-Steuerung. Das ist der Bereich, in dem Claude Code mit /ultrareview und xhigh-Effort dominiert hat. GPT-5.5 will diese Krone holen.

Konkrete Verbesserungen die du als Entwickler merkst:

  • Codex bekommt GPT-5.5-Codex als spezielle Variante mit niedrigerer Latenz und feiner abgestimmtem Tool-Calling
  • Plan-and-Execute-Patterns funktionieren stabiler ueber 30+ Schritte (frueher haeufige Tool-Errors)
  • Computer-Use-Genauigkeit liegt jetzt bei 71,2% auf OSWorld (vorher 58,3%)
  • Diff-Editing: GPT-5.5 produziert validere Diffs mit 94% Patch-Apply-Rate (vorher 81%)

In der Praxis heisst das: Wenn du bisher mit Claude Code gearbeitet hast und Computer-Use fuer Browser-Tasks gemacht hast, ist GPT-5.5 in Codex jetzt eine ernsthafte Alternative.

Was GPT-5.5 kostet

OpenAI hat die Preise gegenueber GPT-5.4 leicht angehoben, aber Caching aggressiver gemacht:

VarianteInput (USD/1M)Output (USD/1M)Cached Input
GPT-5.51,2510,000,12
GPT-5.5-Codex1,2510,000,12
GPT-5.5-Mini0,252,000,025

Cached Input zu 1/10 des normalen Preises — wenn du System-Prompts, Tool-Schemas und grosse Doku-Kontexte wiederverwendest, sinken deine effektiven Kosten massiv. Kombiniert mit dem 37-Punkte-Long-Context-Sprung lohnen sich jetzt auch wirklich grosse Knowledge-Base-Setups.

Wo ChatGPT-Nutzer GPT-5.5 spueren

Auch wenn du nie eine API anfasst — die Plus/Pro/Business-User merken den Unterschied. ChatGPT hat seit 23. April 2026:

  • GPT-5.5 als neuer Default statt GPT-5.4
  • Verstaendnis von “was du eigentlich willst” ist sichtbar besser, weniger Nachfragen noetig
  • Lange Recherche-Sessions (Deep Research) liefern strukturiertere Ergebnisse mit besseren Quellen
  • Spreadsheets und Dokumente werden in einem Aufruf erstellt und iteriert, statt nur Snippets zu liefern

Fuer Power-User in Pro-Plans: Der Pro-Plan bekommt Zugang zu GPT-5.5-Pro-Reasoning, einem Variation mit hoeherem Reasoning-Effort.

GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1: Wann nimmst du was?

Wir haben einen Entscheidungs-Kompass gebaut, basierend auf 24h Praxis-Tests:

Nimm GPT-5.5, wenn:

  • Du Computer-Use-Workflows baust (Browser-Agenten, Desktop-Automation)
  • Long-Context-Retrieval kritisch ist (RAG ueber 500K+ Tokens)
  • Native Omnimodalitaet noetig ist (Video plus Audio plus Text)
  • Du in Codex bereits investiert bist

Nimm Claude Opus 4.7, wenn:

  • Du tiefe Architektur-Reviews mit /ultrareview machst
  • Code-Refactorings ueber sehr viele Dateien laufen (Opus 4.7 hat hier weniger Tool-Errors)
  • Du xhigh-Effort fuer kontrollierte Reasoning-Tiefe willst
  • DACH-Compliance ein Fokus ist (Anthropic hat klarere Datenrichtlinien)

Nimm Gemini 3.1 Pro, wenn:

  • 2 Mio. Token Kontext zwingend ist
  • Du Google-Workspace-Integration brauchst (Gmail, Drive, Sheets)
  • Multimodale Tasks mit Video-Input dominieren

Affiliate-Empfehlung: Vom Einsatz zum Workflow

Wenn du GPT-5.5 produktiv einsetzt, willst du es in Automatisierungsketten einbinden statt einzeln zu klicken. Make.com hat GPT-5.5 bereits am Launch-Tag in den OpenAI-Connector gepatcht — du baust visuelle Flows mit Slack, Gmail, Airtable in Minuten. Fuer Self-Host-Setups und tiefe Custom-Logik ist n8n der DACH-Liebling der Wahl.

Weiterlesen

Fazit: GPT-5.5 verschiebt den Default

GPT-5.4 fuehlte sich nach einem Update an. GPT-5.5 fuehlt sich nach einem neuen Werkzeug an. Native Omnimodalitaet, der Long-Context-Sprung und die Terminal-Bench-Krone bedeuten, dass du fuer viele Workflows neu evaluieren solltest, welches Modell vorne liegt.

Unser Take: Wenn du schon im OpenAI-Stack bist, hast du jetzt ein deutlich besseres Default-Modell. Wenn du Claude oder Gemini nutzt, ist die Nadel nicht zwingend bewegt — aber der Abstand zu OpenAI ist in Coding und Long-Context geschrumpft. Ein A/B-Test fuer dein Hauptszenario lohnt sich.