OpenAI hat am 23. April 2026 GPT-5.5 gelauncht — und der Sprung gegenueber GPT-5.4 ist deutlicher als das Versionssprung-Komma vermuten laesst. Wir haben die Benchmarks geprueft, die Praxis getestet und zeigen dir, was der neue Default in ChatGPT Pro und der API fuer deine Workflows bedeutet.
Was GPT-5.5 in einem Satz anders macht
Native Omnimodalitaet, ein massiver Long-Context-Sprung und die neue Coding-Krone in der Konsole. Das ist die Kurzfassung. OpenAI hat nicht einfach mehr Parameter draufgepackt, sondern die Architektur konsolidiert — und im Long-Context-Bereich einen 37-Punkte-Sprung hingelegt.
Native Omnimodalitaet: Endlich kein Stitching mehr
Bisher waren GPTs “multimodal” durch Stitching: Text-Modell, Vision-Encoder, Audio-Modell, alle mit Glue-Code verbunden. GPT-5.5 ist nativ omnimodal — eine einzige Architektur, die Text Bild Audio Video gleichzeitig verarbeitet und in jedem Modus antworten kann.
Was das in der Praxis aendert:
- Du schickst ein YouTube-Video plus Transkript plus Folien — GPT-5.5 versteht den Zusammenhang ohne separate Aufrufe
- Audio-Eingaben werden mit Bild-Kontext gemeinsam interpretiert (z.B. “Was sagt die Person im Video bei 02:14, waehrend das Diagramm gezeigt wird?”)
- Latenz fuer Multi-Modal-Aufrufe sinkt um 40-60%, weil keine Pipeline mehr durchlaufen wird
Das ist eine groessere Sache als sie klingt. Fuer Use-Cases wie Customer-Support mit Screenshots, Video-Tutorials oder Meeting-Recaps mit Slides ist das ein Qualitaetssprung.
Die Benchmarks die zaehlen
OpenAI hat die Zahlen gegen GPT-5.4 und Claude Opus 4.7 veroeffentlicht. Wir haben sie konsolidiert (offizielle Eval-Werte und Re-Tests von CodeRabbit, Vellum):
| Benchmark | GPT-5.5 | GPT-5.4 | Claude Opus 4.7 | Gemini 3.1 Pro |
|---|---|---|---|---|
| Expert-SWE (20h-Tasks) | 73,1% | 68,5% | 71,2% | 64,8% |
| Terminal-Bench 2.0 | 82,7% | 67,4% | 69,4% | 58,2% |
| SWE-Bench Pro | 79,1% | 57,7% | 64,3% | 54,2% |
| MRCR v2 (512K-1M) | 74,0% | 36,6% | 68,3% | 71,5% |
| GPQA Diamond | 92,8% | 87,3% | 94,2% | 94,3% |
| FrontierMath 2 | 51,4% | 38,2% | 44,1% | 41,9% |
Drei Werte stechen hervor:
Terminal-Bench 2.0 mit 82,7%. OpenAI fuehrt hier mit 13 Punkten Vorsprung vor Claude Opus 4.7 — der bisherige Champion in dieser Disziplin. Terminal-Bench misst echte Shell-Tasks: Repos clonen, Bugs reproduzieren, Tests fixen, ohne menschliche Hilfe. Das ist der Benchmark, der am direktesten mit “kann der Agent eigenstaendig arbeiten” korreliert.
MRCR v2 mit 74,0%. Dieser Long-Context-Sprung ist krass. GPT-5.4 lag bei 36,6%. Der MRCR-Benchmark testet, ob das Modell mehrere konkurrierende Antworten in 512K-1M-Token-Kontexten korrekt abruft. Der 37-Punkte-Sprung bedeutet: GPT-5.5 verliert bei langen Codebases und Doku-Pakete deutlich seltener den Faden.
Expert-SWE mit 73,1%. OpenAIs interner Benchmark fuer 20-Stunden-Coding-Tasks. Das sind keine Snippets — das sind komplette Feature-Implementierungen mit Tests, Doku und Refactoring.
Coding und Computer-Use: Der direkte Angriff auf Claude Code
Die staerksten Verbesserungen liegen bei agentischen Tasks. OpenAI hat GPT-5.5 explizit auf Computer-Use trainiert — also Mausbewegungen, Tastatureingaben, Browser-Steuerung. Das ist der Bereich, in dem Claude Code mit /ultrareview und xhigh-Effort dominiert hat. GPT-5.5 will diese Krone holen.
Konkrete Verbesserungen die du als Entwickler merkst:
- Codex bekommt GPT-5.5-Codex als spezielle Variante mit niedrigerer Latenz und feiner abgestimmtem Tool-Calling
- Plan-and-Execute-Patterns funktionieren stabiler ueber 30+ Schritte (frueher haeufige Tool-Errors)
- Computer-Use-Genauigkeit liegt jetzt bei 71,2% auf OSWorld (vorher 58,3%)
- Diff-Editing: GPT-5.5 produziert validere Diffs mit 94% Patch-Apply-Rate (vorher 81%)
In der Praxis heisst das: Wenn du bisher mit Claude Code gearbeitet hast und Computer-Use fuer Browser-Tasks gemacht hast, ist GPT-5.5 in Codex jetzt eine ernsthafte Alternative.
Was GPT-5.5 kostet
OpenAI hat die Preise gegenueber GPT-5.4 leicht angehoben, aber Caching aggressiver gemacht:
| Variante | Input (USD/1M) | Output (USD/1M) | Cached Input |
|---|---|---|---|
| GPT-5.5 | 1,25 | 10,00 | 0,12 |
| GPT-5.5-Codex | 1,25 | 10,00 | 0,12 |
| GPT-5.5-Mini | 0,25 | 2,00 | 0,025 |
Cached Input zu 1/10 des normalen Preises — wenn du System-Prompts, Tool-Schemas und grosse Doku-Kontexte wiederverwendest, sinken deine effektiven Kosten massiv. Kombiniert mit dem 37-Punkte-Long-Context-Sprung lohnen sich jetzt auch wirklich grosse Knowledge-Base-Setups.
Wo ChatGPT-Nutzer GPT-5.5 spueren
Auch wenn du nie eine API anfasst — die Plus/Pro/Business-User merken den Unterschied. ChatGPT hat seit 23. April 2026:
- GPT-5.5 als neuer Default statt GPT-5.4
- Verstaendnis von “was du eigentlich willst” ist sichtbar besser, weniger Nachfragen noetig
- Lange Recherche-Sessions (Deep Research) liefern strukturiertere Ergebnisse mit besseren Quellen
- Spreadsheets und Dokumente werden in einem Aufruf erstellt und iteriert, statt nur Snippets zu liefern
Fuer Power-User in Pro-Plans: Der Pro-Plan bekommt Zugang zu GPT-5.5-Pro-Reasoning, einem Variation mit hoeherem Reasoning-Effort.
GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1: Wann nimmst du was?
Wir haben einen Entscheidungs-Kompass gebaut, basierend auf 24h Praxis-Tests:
Nimm GPT-5.5, wenn:
- Du Computer-Use-Workflows baust (Browser-Agenten, Desktop-Automation)
- Long-Context-Retrieval kritisch ist (RAG ueber 500K+ Tokens)
- Native Omnimodalitaet noetig ist (Video plus Audio plus Text)
- Du in Codex bereits investiert bist
Nimm Claude Opus 4.7, wenn:
- Du tiefe Architektur-Reviews mit
/ultrareviewmachst - Code-Refactorings ueber sehr viele Dateien laufen (Opus 4.7 hat hier weniger Tool-Errors)
- Du xhigh-Effort fuer kontrollierte Reasoning-Tiefe willst
- DACH-Compliance ein Fokus ist (Anthropic hat klarere Datenrichtlinien)
Nimm Gemini 3.1 Pro, wenn:
- 2 Mio. Token Kontext zwingend ist
- Du Google-Workspace-Integration brauchst (Gmail, Drive, Sheets)
- Multimodale Tasks mit Video-Input dominieren
Affiliate-Empfehlung: Vom Einsatz zum Workflow
Wenn du GPT-5.5 produktiv einsetzt, willst du es in Automatisierungsketten einbinden statt einzeln zu klicken. Make.com hat GPT-5.5 bereits am Launch-Tag in den OpenAI-Connector gepatcht — du baust visuelle Flows mit Slack, Gmail, Airtable in Minuten. Fuer Self-Host-Setups und tiefe Custom-Logik ist n8n der DACH-Liebling der Wahl.
Weiterlesen
- Claude Opus 4.7 offiziell da: 64,3% SWE-Bench Pro, xhigh-Effort und /ultrareview
- GPT-5.4 vs Claude Mythos vs Gemini 3.1: Der Mega-Vergleich
- OpenAI Codex bekommt Computer-Use, 90+ Plugins und Wochen-Tasks
- DeepSeek V4 Preview: 1,6 Billionen Parameter und Frontier-Preise zum Bruchteil
Fazit: GPT-5.5 verschiebt den Default
GPT-5.4 fuehlte sich nach einem Update an. GPT-5.5 fuehlt sich nach einem neuen Werkzeug an. Native Omnimodalitaet, der Long-Context-Sprung und die Terminal-Bench-Krone bedeuten, dass du fuer viele Workflows neu evaluieren solltest, welches Modell vorne liegt.
Unser Take: Wenn du schon im OpenAI-Stack bist, hast du jetzt ein deutlich besseres Default-Modell. Wenn du Claude oder Gemini nutzt, ist die Nadel nicht zwingend bewegt — aber der Abstand zu OpenAI ist in Coding und Long-Context geschrumpft. Ein A/B-Test fuer dein Hauptszenario lohnt sich.
