Das Narrativ „KI stößt gegen eine Wand“ von Anfang 2025 ist offiziell tot. Die meiste Zeit des Jahres befand sich die Branche in einer seltsamen Schwebe: GPT-4.5 war im Februar mit einem Achselzucken gelandet, Skalierungsgespräche waren pessimistisch geworden und „KI ist eine Blase“ war auf Dinnerpartys die sichere Devise.
Diese Stimmung zerbrach innerhalb von sechs Wochen.
Zwischen dem 12. November und dem 11. Dezember haben die „Großen Drei“ in schneller Folge ihre nuklearen Optionen aufgegeben: GPT-5.1 von OpenAI (12. November), Gemini 3 von Google (18. November) und Claude Opus 4.5 von Anthropic (24. November). Dann kam OpenAI für einen zweiten Schwung zurück: GPT-5.2 kam am 11. Dezember an – Berichten zufolge wurde es nach einem internen „Code Red“-Memo über die Dynamik von Gemini aus einem geplanten Ende Dezember-Fenster heraus beschleunigt. Der Staub hat sich noch nicht einmal gelegt, aber die Benchmarks und vor allem die Vibe-Checks sind da.
Für Entwickler, Strategen oder Fachleute, die sich für Abonnements für 2026 entscheiden, ist dies die kalte, harte Realität der neuen Hierarchie.
An der Spitze herrscht fast Gleichstand, allerdings aus ganz anderen Gründen.
Die Rangliste: Eine getrennte Entscheidung
Zum ersten Mal seit dem GPT-4-Start im Jahr 2023 gibt es keinen einzigen „König“. Stattdessen existiert an der Spitze ein funktionales Duopol, dicht gefolgt von einem gewaltigen Titanen.
#1 (Unentschieden): GPT-5.2 von OpenAI
Die Argumentationsmaschine
OpenAI hat es erneut geschafft, aber nicht in der von den meisten erwarteten Weise. GPT-5.2 ist nicht nur „sachkundiger“. Es ist ein grundlegend anderes Biest, wenn es um die Argumentation zum Zeitpunkt der Antwort geht.
GPT-5.2 wird in drei Modi ausgeliefert – Instant, Thinking und Pro – und die Thinking-Stufe ist diejenige, die die Bestenlisten neu schreibt. Auf ARC-AGI-2, dem Benchmark, der entwickelt wurde, um Musterabrufe zu bestrafen und echte Regelinduktion zu belohnen, erreicht GPT-5.2 Thinking 52,9 % – gegenüber 37,6 % für Claude Opus 4.5 und 31,1 % für Gemini 3 Pro. Beim AIME-Mathe-Olympiade-Set 2025 erzielt es perfekte 100 % und liegt mit 70,9 % an der Spitze von GDPval, OpenAIs Benchmark für echte professionelle Wissensarbeit, gegenüber 53,5 % bei Gemini 3.
Diese Intelligenz hat einen Preis: 1,75 $ pro Million Input-Tokens und 14 $ pro Million Output – etwa 40 % über GPT-5.1 – wobei die Pro-Stufe etwa eine Größenordnung über Thinking liegt.
Es ist der unbestrittene König der Logik, Mathematik und des kalten, harten Denkens.
#1 (Unentschieden): Claude Opus 4.5 von Anthropic
Das Programmier-Arbeitstier, das seinen eigenen Preis senkt
Wenn GPT-5.2 die Cold-Logic-Engine ist, ist Claude Opus 4.5 das Arbeitstier für die Produktion.
Hier zählen zwei Zahlen. Der erste ist 80,9 % – die Punktzahl von Opus 4.5 im SWE-Bench Verified, dem Benchmark, der misst, ob ein Modell tatsächlich echte Fehler in echten Repositories beheben kann. Auch nach der Veröffentlichung von GPT-5.2 im Dezember liegt die Bestleistung von OpenAI bei 80,0 % im selben Test: Das zwei Wochen ältere Modell hielt die Codierungskrone, wenn auch nur um Haaresbreite. Die zweite Zahl ist der Preis: 5 US-Dollar pro Million Input-Tokens und 25 US-Dollar pro Million Output, eine etwa zweidrittel Senkung des Preises von Opus 4.1 – in einem Atemzug mit der Eroberung der Spitze der Codierungs-Bestenlisten.
Der Kompromiss ist kontextabhängig: ein 200.000-Token-Fenster, ein Bruchteil der eine Million von Gemini 3. Anthropic geht davon aus, dass die meiste professionelle Arbeit – ein Nachmittag mit Paarprogrammierung, eine Vertragsüberprüfung, eine Agentenschleife – bequem in 200.000 passt und dass Entwickler sich zu 2024-Mittelpreisen gerne mit Grenzprogrammierungsfähigkeiten befassen werden.
Es ist sicherheitsorientiert, prosastark und der beste „Paarprogrammierer“ auf dem Markt – und zum ersten Mal ist die Intelligenz der Opus-Klasse für die tägliche Arbeit preisgünstig.
#2: Googles Gemini 3
Der Ökosystemriese
Google liegt an dritter Stelle, aber zählen Sie sie nicht außer Acht.
Sechs Tage lang im November schien Gemini 3 das Modell zu sein, das es zu schlagen gilt: Es startete mit einem LMArena Elo-Rekord von 1501, dem ersten Modell überhaupt, das die 1500er-Marke überschritt, und übertraf GPT-5.1 in den wichtigsten Benchmarks für die Argumentation. Aber der Gegenschlag von GPT-5.2 im Dezember öffnete die Lücke dort, wo sie wehtut: 31,1 % gegenüber 52,9 % bei ARC-AGI-2 und 53,5 % gegenüber 70,9 % bei BIPval. Bei den schwierigsten Romanbegründungsproblemen liegt Gemini 3 nun klar hinter dem Duopol.
Allerdings hat Gemini 3 Superkräfte, die die anderen nicht haben: Modalität und Reichweite.
Es ist das stärkste multimodale Modell der drei – nativ Video, Audio und Bilder – mit einem Kontextfenster von einer Million Token, das Claudes 200.000 in den Schatten stellt. Und Google treibt die Integration mit der Suche und der Workspace-Suite stark voran. Es ist nicht das intelligenteste isolierte Gehirn, aber es ist der nützlichste Assistent, wenn Sie im Google-Ökosystem leben.
Technischer Deep Dive: Die Architektur der Intelligenz
Warum passiert das? Warum die Trennung? Weil die beiden Spitzenreiter das Jahr 2025 damit verbracht haben, auf unterschiedliche Dinge zu wetten.
Der Pivot „Testzeitberechnung“.
OpenAI setzt die Farm auf Inferenzzeit-Argumentation. Anstatt nur ein größeres Modell zu trainieren (Trainingsberechnung), optimierten sie das Modell so, dass es länger „nachdenkt“, bevor es antwortet (Inferenzberechnung).
Genau das sind die Modi „Denken“ und „Pro“ von GPT-5.2: Sie legen fest, wie viel Argumentation bei der Antwort aufgewendet werden soll. Aus diesem Grund hält das Modell inne, bevor es schwierige Fragen beantwortet – es verzögert sich nicht, es ist Nachdenken – und aus diesem Grund sprang der ARC-AGI-2-Score genau auf die Klasse von Problemen mit neuartigen Regeln, an denen Mustervergleichsmodelle scheiterten.
Die Effizienzwette
Anthropic hingegen setzt darauf, Grenzintelligenz so billig zu machen, dass sie den ganzen Tag läuft.
Die Überschrift von Opus 4.5 war kein Maßstab – sie war die Rechnung. Den Preis des Flaggschiffs um etwa zwei Drittel senken und gleichzeitig die SWE-Bestenliste anführen. Verified ist eine Aussage darüber, wo Anthropic das Geld vermutet: nicht in einer heroischen Antwort, sondern in Agenten und Codierungsassistenten, die Tausende von Anrufen pro Aufgabe tätigen. Ein Modell, das 1 % besser, aber dreimal teurer ist, verliert diesen Markt.
Deshalb fühlt sich Claude wie das „Arbeiter“-Modell. Es ist für den dauerhaften Produktionseinsatz konzipiert – und jetzt auch preislich erhältlich.
Die Geschichte: Wie die Branche hierher kam
Um den Dezember 2025 zu verstehen, muss man auf den „Winter der Unzufriedenheit“ Anfang 2025 zurückblicken.
Im Februar 2025 schienen die Skalierungsgesetze an ihre Grenzen zu stoßen. GPT-4.5 – das seit langem gemunkelte „Orion“, das Modell, von dem viele erwarteten, dass es sich um GPT-5 handelt – war bei alltäglichen Aufgaben kaum besser als sein Vorgänger, obwohl es riesig und teuer im Betrieb war. Die Anleger wurden nervös. Die Erzählung verlagerte sich auf „KI ist eine Blase“.
Was die Mauer durchbrach, war kein größerer Lauf vor dem Training. Es war Argumentation.
Das bestärkende Lernen auf Gedankenketten – das Trainieren von Modellen, um Probleme zu bearbeiten und sie zu belohnen, wenn die Antwort gefunden wird – erwies sich als maßstabsgetreu, wo das reine Vortraining ins Stocken geraten war. Die o-Serie von OpenAI hat das Konzept bewiesen; Der Start von GPT-5 im August machte es zum Flaggschiff; und bis Ende 2025 hatte jedes Grenzlabor seine Aufstellung rund um Denkweisen neu aufgebaut.
Dieser Veröffentlichungszyklus im Dezember ist die erste vollständige Ernte dieses Pivots. Das Ergebnis? Die Mauer war kaputt. Sinkende Renditen sind keine Selbstverständlichkeit mehr; Differenzierung ist.
Vorausschauende Analyse: 2026 und darüber hinaus
Wie geht es also mit der Branche weiter?
Für CTOs oder Engineering Manager ist die Strategie für 2026 klar: Model Orchestration.
Die Zeiten, in denen man sich „ein Modell zur Herrschaft über alle“ aussuchte, sind vorbei. Sie können nicht einfach eine Unternehmenslizenz für OpenAI kaufen und damit Schluss machen.
Die „Router“-Architektur
Der Gewinnerstapel für 2026 wird wie folgt aussehen:
- GPT-5.2 oben, fungiert als „Architekt“. Es empfängt die Benutzeranfrage, zerlegt sie und plant die Ausführung.
- Claude Opus 4.5 als „Arbeiter“. Es nimmt den Plan und schreibt den spezifischen Code oder Inhalt, um Sicherheit und stilistische Nuancen zu gewährleisten.
- Zwillinge 3 als „Augen und Ohren“. Es verarbeitet alle eingehenden Video-, Audio- und umfangreichen Dokumenteingaben, bevor es den anderen den Kontext zuführt.
Die Kosten für Geheimdienste sinken, aber der Wert spezialisierter Geheimdienste steigt sprunghaft an.
Der Kostenengpass
Das Einzige, was dieses Raketenschiff aufhält, ist die Rechnung. Peak Reasoning ist jetzt ein Premiumprodukt: GPT-5.2 wurde 40 % über den Preisen von GPT-5.1 auf den Markt gebracht, und die Pro-Stufe liegt etwa eine Größenordnung über der Thinking-Stufe. Jede „denkende“ Antwort verbrennt ein Vielfaches der Token, die eine einfache Antwort verursacht – genau aus diesem Grund war die Preissenkung von Anthropic ein so aggressiver Schritt und warum die Rechenknappheit den Wandel hin zu architektonischer Effizienz immer weiter vorantreibt.
Erwarten Sie, dass 2026 das Jahr der „Small Models“ (SLMs) sein wird, die für grundlegende Aufgaben auf dem Gerät ausgeführt werden, und sich nur für komplexe Überlegungen auf die Großen Drei verlassen. Aber täuschen Sie sich nicht: Die gläserne Decke ist zerbrochen.
OpenAI und Anthropic liefern sich auf dem Gipfel einen Schlagabtausch. Google baut das Stadion, in dem sie kämpfen. Das Innovationstempo war noch nie so schnell.
Quellen (13)
- unifiedaihub.com OpenAI Launches GPT-5.2
- turingcollege.com GPT-5.2 Review
- futureagi.substack.com AI Model Benchmarking Technical Analysis
- creolestudios.com GPT-5.2 vs Claude Opus 4.5
- timesofai.com Gemini 3 Rivalry
- overchat.ai GPT-5.2 Hub
- openthemagazine.com 2025 Tech Review
- thealgorithmicbridge.com Algorithmic Bridge 2026 Predictions
- openai.com Introducing GPT-5.2
- anthropic.com Introducing Claude Opus 4.5
- techcrunch.com Google Launches Gemini 3 with Record Benchmark Scores
- simonwillison.net GPT-5.2 First Impressions
- en.wikipedia.org Wikipedia: GPT-4.5
🦋 Diskussion auf Bluesky
Auf Bluesky diskutieren