Lien copié !

Classement de puissance de l'IA 2025 : OpenAI en tête, Google à la traîne

La pause de l'IA est terminée. Décembre 2025 a apporté les plus grands lancements de modèles de l'histoire. Cette analyse explique pourquoi OpenAI et Anthropic sont à égalité pour la première place, et pourquoi le gigantesque écosystème Gemini 3 de Google se classe de près en troisième position.

🌐
Traduction automatique

Cet article a été traduit automatiquement depuis l’original en anglais. Lire l’original en anglais

Arène numérique futuriste montrant les entités d'IA d'OpenAI, Anthropic et Google dans une formation de classement

Le discours selon lequel « l’IA se heurte à un mur » du début de 2025 est officiellement mort. Pendant la majeure partie de l’année, l’industrie est restée dans un vide étrange : GPT-4.5 avait atterri en février avec un haussement d’épaules, les discussions sur la mise à l’échelle étaient devenues baissières et « l’IA est une bulle » était la solution sûre lors des dîners.

Cette humeur s’est brisée en six semaines.

Entre le 12 novembre et le 11 décembre, les « Trois Grands » ont rapidement abandonné leurs options nucléaires : GPT-5.1 d’OpenAI (12 novembre), Gemini 3 de Google (18 novembre) et Claude Opus 4.5 d’Anthropic (24 novembre). Ensuite, OpenAI est revenu pour un deuxième swing : GPT-5.2 est arrivé le 11 décembre – aurait accéléré hors d’une fenêtre prévue fin décembre après un mémo interne « Code Red » sur l’élan de Gemini. La poussière n’est même pas retombée, mais les benchmarks, et plus important encore, les contrôles d’ambiance sont là.

Pour les développeurs, les stratèges ou les professionnels qui décident des abonnements 2026, voici la froide et dure réalité de la nouvelle hiérarchie.

Advertisement

C’est presque une égalité au sommet, mais pour des raisons très différentes.

Le classement : une décision partagée

Pour la première fois depuis le lancement de GPT-4 en 2023, il n’y a pas un seul « Roi ». Au lieu de cela, il existe un duopole fonctionnel à la pointe, suivi de près par un titan massif.

#1 (égalité) : GPT-5.2 d’OpenAI

Le moteur de raisonnement

OpenAI a récidivé, mais pas de la manière la plus attendue. GPT-5.2 n’est pas seulement « plus compétent ». C’est une bête fondamentalement différente lorsqu’il s’agit de raisonner au moment de la réponse.

GPT-5.2 est disponible en trois modes : instantané, réflexion et professionnel, et le niveau réflexion est celui qui réécrit les classements. Sur ARC-AGI-2, le benchmark conçu pour punir le rappel de modèles et récompenser une véritable induction de règles, GPT-5.2 Thinking obtient un score de 52,9 % — contre 37,6 % pour Claude Opus 4.5 et 31,1 % pour Gemini 3 Pro. Il affiche un score parfait de 100 % sur l’ensemble des olympiades de mathématiques AIME 2025 et est en tête de GDPval, la référence d’OpenAI pour le véritable travail de connaissances professionnelles, à 70,9 % contre 53,5 % pour Gemini 3.

Cette intelligence a un prix : 1,75 $ par million de jetons d’entrée et 14 $ par million de sortie, soit environ 40 % au-dessus de GPT-5.1, le prix du niveau Pro étant à peu près un ordre de grandeur supérieur à celui de Thinking.

C’est le roi incontesté de la logique, des mathématiques et du raisonnement froid et dur.

#1 (Égalité) : Claude Opus 4.5 d’Anthropic

Le cheval de bataille du codage qui réduit son propre prix

Si GPT-5.2 est le moteur logique froid, Claude Opus 4.5 est le cheval de bataille de la production.

Deux chiffres comptent ici. Le premier est 80,9 % — le score de l’Opus 4.5 sur SWE-bench Verified, le benchmark qui mesure si un modèle peut réellement corriger de vrais bugs dans de vrais référentiels. Même après le lancement de GPT-5.2 en décembre, le meilleur score d’OpenAI se situe à 80,0 % sur le même test : le modèle de deux semaines plus âgé détenait la couronne de codage, ne serait-ce que d’un cheveu. Le deuxième chiffre est le prix : 5 $ par million de jetons d’entrée et 25 $ par million de sortie, soit une réduction d’environ deux tiers par rapport au prix de l’Opus 4.1, réalisé dans le même temps que la première place des classements de codage.

Advertisement

Le compromis est le contexte : une fenêtre de 200 000 jetons, soit une fraction du million de Gemini 3. Le pari d’Anthropic est que la plupart du travail professionnel – un après-midi de programmation en binôme, une révision de contrat, une boucle d’agent – ​​s’intègre confortablement dans 200 000 $, et que les développeurs prendront volontiers la capacité de codage frontalier aux prix intermédiaires de 2024.

Il est axé sur la sécurité, fort en prose et le meilleur « programmeur de paire » du marché – et pour la première fois, l’intelligence de classe Opus est tarifée pour le travail quotidien.

#2 : Gemini 3 de Google

Le géant de l’écosystème

Google est 3ème, mais ne les excluez pas.

Pendant six jours en novembre, Gemini 3 a semblé être le modèle à battre : il a lancé un record LMArena Elo de 1501, le premier modèle à avoir dépassé la ligne 1500, et il a battu GPT-5.1 dans les principaux critères de raisonnement. Mais le contre-coup du GPT-5.2 en décembre a rouvert l’écart là où ça fait mal : 31,1 % contre 52,9 % sur ARC-AGI-2, et 53,5 % contre 70,9 % sur GDPval. Sur les problèmes de raisonnement roman les plus difficiles, Gemini 3 est désormais clairement en retard sur le duopole.

Cependant, Gemini 3 possède des super pouvoirs que les autres n’ont pas : modalité et portée.

Il s’agit du modèle multimodal le plus puissant des trois : vidéo, audio et images de manière native, avec une fenêtre contextuelle d’un million de jetons qui éclipse les 200 000 de Claude. Et Google s’efforce d’intégrer la recherche et la suite Workspace. Ce n’est pas le cerveau isolé le plus intelligent, mais c’est l’assistant le plus utile si vous vivez dans l’écosystème Google.

Analyse technique approfondie : l’architecture de l’intelligence

Pourquoi cela se produit-il ? Pourquoi la scission ? Car les deux dirigeants ont passé 2025 à miser sur des choses différentes.

Advertisement

Le pivot « Calcul du temps de test »

OpenAI a parié sur le raisonnement en temps d’inférence. Au lieu de simplement entraîner un modèle plus grand (calcul d’entraînement), ils ont optimisé pour que le modèle « réfléchisse » plus longtemps avant de répondre (calcul d’inférence).

Total ComputeTraining Ops+(Inference Ops×Reasoning Steps)\text{Total Compute} \approx \text{Training Ops} + (\text{Inference Ops} \times \text{Reasoning Steps})

C’est exactement ce que sont les modes Thinking et Pro de GPT-5.2 : déterminer la quantité de raisonnement à consacrer au moment de la réponse. C’est pourquoi le modèle fait une pause avant de répondre à des questions difficiles – il ne traîne pas, il réfléchit – et c’est pourquoi le score ARC-AGI-2 a sauté précisément sur la classe de problèmes de règles nouvelles que les modèles de correspondance de modèles échouent.

Le pari de l’efficacité

Anthropic, de son côté, mise sur la création de renseignements sur les frontières suffisamment bon marché pour fonctionner toute la journée.

Le titre de l’Opus 4.5 n’était pas une référence, c’était la facture. Réduire le prix du produit phare d’environ deux tiers tout en étant en tête du classement SWE. Verified est une déclaration sur l’endroit où Anthropic pense que l’argent se trouve : non pas dans une réponse héroïque, mais dans des agents et des assistants de codage qui effectuent des milliers d’appels par tâche. Un modèle 1 % meilleur mais 3 fois plus cher perd ce marché.

C’est pourquoi Claude se sent comme le modèle « ouvrier ». Il est conçu – et désormais tarifé – pour une utilisation en production soutenue.

L’histoire : comment l’industrie en est arrivée là

Pour comprendre décembre 2025, il faut revenir sur « l’hiver du mécontentement » du début 2025.

En février 2025, la mise à l’échelle des lois semblait se heurter à un mur. GPT-4.5 – le modèle « Orion » dont beaucoup s’attendaient à ce qu’il soit GPT-5 – était à peine meilleur que son prédécesseur dans les tâches quotidiennes, bien qu’il soit énorme et coûteux à exploiter. Les investisseurs devenaient nerveux. Le discours s’est déplacé vers « L’IA est une bulle ».

Ce qui a brisé le mur n’était pas une course de pré-entraînement plus importante. C’était un raisonnement.

L’apprentissage par renforcement sur les chaînes de pensée – des modèles de formation pour résoudre les problèmes et les récompenser lorsque la réponse est vérifiée – s’est avéré à l’échelle là où la pré-formation brute était au point mort. La série o d’OpenAI a prouvé le concept ; Le lancement du GPT-5 en août l’a intégré au produit phare ; et à la fin de 2025, chaque laboratoire frontalier avait reconstruit sa gamme autour des modes de réflexion.

Ce cycle de publication de décembre est la première récolte complète de ce pivot. Le résultat ? Le mur était brisé. Les rendements décroissants ne sont plus une histoire; la différenciation est.

Analyse prospective : 2026 et au-delà

Alors, où va l’industrie à partir de là ?

Pour les CTO ou les responsables de l’ingénierie, la stratégie pour 2026 est claire : Model Orchestration.

L’époque où l’on choisissait « un modèle pour les gouverner tous » est révolue. Vous ne pouvez pas simplement acheter une licence d’entreprise pour OpenAI et mettre un terme à cette activité.

L’architecture “Routeur”

La pile gagnante pour 2026 ressemblera à ceci :

  1. GPT-5.2 en haut, agissant en tant qu’« architecte ». Il reçoit la requête de l’utilisateur, la décompose et planifie son exécution.
  2. Claude Opus 4.5 dans le rôle du « Travailleur ». Il prend le plan et rédige le code ou le contenu spécifique, en garantissant la sécurité et les nuances stylistiques.
  3. Gémeaux 3 comme « Yeux et oreilles ». Il traite toutes les entrées vidéo, audio et documents à grande échelle entrants avant de transmettre le contexte aux autres.

Le coût du renseignement baisse, mais la valeur du renseignement spécialisé monte en flèche.

Le goulot d’étranglement des coûts

La seule chose qui arrête cette fusée, c’est la facture. Peak Reasoning est désormais un produit premium : GPT-5.2 a été lancé à 40 % au-dessus des prix de GPT-5.1, et son niveau Pro est à peu près un ordre de grandeur supérieur au niveau Thinking. Chaque réponse « réfléchie » brûle des multiples de jetons qu’une réponse simple — c’est exactement pourquoi la baisse de prix d’Anthropic était une décision si agressive, et pourquoi la rareté des calculs continue de conduire à la transition vers l’efficacité architecturale.

Attendez-vous à ce que 2026 soit l’année des « petits modèles » (SLM) exécutés sur l’appareil pour les tâches de base, s’en remettant aux trois grands uniquement pour les raisonnements complexes. Mais ne vous y trompez pas : le plafond de verre a été brisé.

OpenAI et Anthropic échangent des coups lors du sommet. Google construit le stade dans lequel ils combattent. Le rythme de l’innovation n’a jamais été aussi rapide.

Nos sources (13)

Advertisement

🦋 Discussion sur Bluesky

Discuter sur Bluesky

Recherche de publications...