Le 22 septembre 2026, Anthropic a publié Claude Opus 5.5, premier modèle d’une nouvelle famille Claude 5.5. Quelques heures plus tard, le même jour, OpenAI a répondu avec GPT-6 Sol et GPT-6 Luna, en divisant ses tarifs par deux.
Les deux annonces racontent la même histoire : presque aussi fort que le haut de gamme, pour beaucoup moins cher. Les deux visent le même usage, celui qui consomme le plus de jetons aujourd’hui — écrire du code. Et les deux sont vendues avec des chiffres.
Le problème, c’est que ces chiffres ne se rencontrent jamais. Anthropic compare Opus 5.5 à GPT-5.6 Sol, un modèle qu’OpenAI a remplacé dans la journée. OpenAI compare GPT-6 Sol à Claude Opus 5 et à Claude Fable 5, jamais à Opus 5.5. Aucun des deux ne s’est mesuré à son vrai rival.
Et le juge de paix habituel est absent : au 23 septembre 2026, aucun classement indépendant de programmation ne contient ces deux modèles. Nous avons vérifié les trois qui font référence, plus le nôtre.
Voici ce que disent les seuls chiffres qui existent, une fois recalculés.
Le verdict en bref
Vainqueur : Claude Opus 5.5. Il gagne les deux seules épreuves publiées par les deux éditeurs dans la même version, il gagne la seule mesure indépendante qui contient les deux modèles, et il gagne l’abonnement.
Sur l’intelligence mesurée : 58 contre 48. Sur la version 4.3.2 de l’indice d’Artificial Analysis, Opus 5.5 à son effort maximal est premier du classement général. GPT-6 Sol au sien arrive quinzième.
Sur le prix affiché : GPT-6 Sol, moitié moins cher. 2 et 10 dollars le million de jetons contre 4 et 20.
Le chiffre qui décide. Opus 5.5 à son réglage par défaut obtient 51 d’indice pour 1,34 dollar la tâche. GPT-6 Sol à son maximum obtient 48 pour 1,06 dollar. Trois points de plus pour 26 % de plus : le modèle « cher » réglé bas bat le modèle « pas cher » réglé au maximum, et l’écart de facture n’est plus du tout du simple au double.
Le détail que personne ne mentionne. Au-delà de 272 000 jetons d’entrée, OpenAI double son tarif d’entrée. Anthropic, lui, ne pratique aucun surcoût sur toute sa fenêtre d’un million. Sur un dépôt de code entier, l’entrée coûte alors exactement le même prix chez les deux.
Là où GPT-6 Sol gagne vraiment : la vitesse et le volume. Il commence à répondre en 2,0 seconde là où Opus 5.5 en demande 22,5, et passer l’intégralité de l’indice lui coûte 1 550 dollars contre 8 708.
Le piège commun. Le réglage maximal d’Opus 5.5 est le plus mauvais achat des deux catalogues : 4,5 fois le prix pour sept points d’indice.
D’où viennent les chiffres de ce comparatif
Trois familles de sources, jamais mélangées.
Les éditeurs. Tarifs, fenêtres de contexte, seuils de facturation, niveaux d’effort, dates de connaissance et conditions d’accès viennent des annonces du 22 septembre et des documentations officielles, relevées le 23 septembre 2026. Chaque score d’éditeur est signalé comme tel, avec la version de l’épreuve et le réglage utilisé.
Une mesure indépendante. L’indice d’Artificial Analysis, version 4.3.2. C’est le seul relevé public qui contient les deux modèles. Cet indice est versionné : des valeurs publiées sous une version antérieure, y compris dans nos propres comparatifs précédents, ne se comparent pas à celles-ci.
Nos recalculs. Tous les coûts ont été refaits à partir des grilles officielles, avec des hypothèses écrites noir sur blanc pour que vous puissiez les rejouer.
Un avertissement, enfin, qui vaut pour tout ce qui suit : les nombres de jetons ne sont pas comparables d’un éditeur à l’autre. Anthropic écrit elle-même dans sa documentation tarifaire que le tokeniseur de ses modèles 4.7 et suivants « produit environ 30 % de jetons de plus pour le même texte » que le précédent. Un prix au jeton ne dit donc pas à lui seul ce que coûtera un texte donné.
Les deux adversaires
| Claude Opus 5.5 | GPT-6 Sol | |
|---|---|---|
| Éditeur | Anthropic | OpenAI |
| Date de sortie | 22 septembre 2026 | 22 septembre 2026 |
| Identifiant | claude-opus-5-5 | gpt-6-sol |
| Entrée / sortie (million de jetons) | 4 $ / 20 $ | 2 $ / 10 $ |
| Lecture de cache | 0,20 $ | 0,20 $ |
| Écriture de cache | 5 $ (5 min) / 8 $ (1 h) | 2,50 $ |
| Fenêtre de contexte | 1 000 000 jetons | 1 050 000 jetons |
| Surcoût long contexte | aucun | ×2 entrée, ×1,5 sortie au-delà de 272 000 jetons |
| Sortie maximale | 128 000 jetons | 128 000 jetons |
| Niveaux d'effort | low, medium (défaut), high, xhigh, max | none, low, medium (défaut), high, xhigh, max |
| Date de connaissance | juin 2026 | 20 avril 2026 |
| Tarif par lots | 2 $ / 10 $ | non publié sur la fiche |
Deux remarques sur ce tableau.
La première : la lecture de cache coûte exactement le même prix chez les deux, 0,20 dollar le million. Ce n’est pas un hasard de barème. Chez OpenAI, c’est le dixième du prix d’entrée, la règle habituelle. Chez Anthropic, c’est un multiplicateur spécial de 0,05 — deux fois plus généreux que la règle maison, réservé à Opus 5.5. Anthropic explique pourquoi dans son annonce : les lectures de cache « représentent la majorité des coûts du travail agentique et de programmation ».
La seconde : le tarif par lots d’Opus 5.5, 2 et 10 dollars, est exactement le tarif standard de GPT-6 Sol. Pour tout travail qui n’a pas besoin d’une réponse immédiate — analyse de dépôt, migration, revue de code en tâche de fond — le modèle réputé cher se paie au prix du modèle réputé bon marché.
Personne ne les a encore mesurés sur le code, et ce n’est pas un hasard
C’est le point que les comparatifs publiés depuis hier passent sous silence. Nous avons cherché les deux modèles dans les quatre classements qui font autorité. Ils n’y sont pas.
SWE-bench Verified, la référence historique du code, est fermé aux laboratoires commerciaux. Le dépôt officiel des soumissions porte une note datée du 18 novembre 2025 : désormais, seules sont acceptées les soumissions qui remplissent deux conditions cumulatives — un lien vers une publication de recherche ouverte, et au moins un auteur affilié à une institution académique ou à un laboratoire de recherche établi. La raison est écrite noir sur blanc : maintenir le test comme « un lieu de progrès de la compréhension scientifique de la génération de code plutôt qu’une plateforme de validation de produit ».
L’effet est visible dans les données. Le dépôt contient 182 soumissions. Quatorze seulement datent de 2026 : treize en février, une le 1er septembre. Et aucune ne porte sur un modèle Opus 5.x, GPT-6, Fable ou Mythos. Le classement que citent encore la plupart des articles « meilleure IA pour coder » ne mesure plus les modèles dont ils parlent.
DeepSWE, tenu par Datacurve, est le classement de programmation agentique que nous utilisons habituellement. Mis à jour le 22 septembre 2026, il s’arrête à GPT-6 Astra (74 % de réussite, 4,43 dollars la tâche), GPT-5.6 Sol (73 %, 6,46 dollars), Claude Opus 5 (74 %, 11,84 dollars) et Claude Fable 5 (70 %, 13,41 dollars). Ni Opus 5.5, ni GPT-6 Sol.
compar:IA, le classement public de l’État français, alimenté par 264 029 votes à l’aveugle au 23 septembre 2026, ne contient aucun modèle Opus ni Fable, et aucun GPT-6.
Notre propre classement enfin. Régénéré le 22 septembre à 20 h 40, heure de Paris, il contient bien les deux modèles à chacun de leurs réglages d’effort — mais avec une évaluation encore partielle, adossée à une seule source, et ils n’apparaissent dans aucune de nos catégories code. Nous ne citerons donc pas de rang : ce serait donner une précision que la donnée n’a pas. Le classement du code et le comparateur s’actualiseront quand les mesures arriveront.
Conclusion à garder en tête pour toute la suite : les seuls chiffres de programmation disponibles sur ces deux modèles sont ceux que leurs éditeurs ont choisi de publier. Et une mesure indépendante généraliste, l’indice d’Artificial Analysis, qui contient une épreuve de code mais n’est pas un classement de code.
Aucun des deux ne s’est comparé à son vrai rival
Regardez les colonnes que chaque éditeur a retenues.
Le tableau d’Anthropic compare Opus 5.5 à Claude Fable 5.1, Claude Opus 5, GPT-6 Astra et GPT-5.6 Sol. Ce dernier a été remplacé par GPT-6 Sol le jour même, à moitié prix. La comparaison la plus flatteuse du tableau côté OpenAI — CursorBench, où Opus 5.5 devance GPT-5.6 Sol de 11 points « pour environ un tiers du coût par tâche » — porte donc sur un modèle qui n’est plus à vendre à ce tarif.
Le tableau d’OpenAI compare GPT-6 Sol à GPT-6 Astra, GPT-5.6 Sol, GPT-5.6 Luna, Claude Opus 5 et Claude Fable 5 ou 5.1. Jamais à Opus 5.5. OpenAI le précise en bas de page : « les évaluations des modèles concurrents proviennent de rapports publiquement disponibles », et « les scores de Claude Fable 5 ont été rapportés quand ceux de Claude Fable 5.1 n’étaient pas disponibles ».
Ce n’est pas de la mauvaise foi, c’est un problème de calendrier : on ne mesure pas un modèle qui sort pendant qu’on met son propre communiqué en ligne. Mais le résultat est le même pour le lecteur. Les deux annonces du 22 septembre se mesurent au passé.
Nous avions relevé le même mécanisme pour les deux haut de gamme : voir notre comparatif GPT-6 Astra contre Claude Fable 5.1, où le chiffre le plus recopié par la presse venait d’une version périmée de l’indice.
Les deux seules épreuves où la comparaison tient
Sur neuf épreuves publiées par Anthropic et six par OpenAI, deux seulement portent le même nom dans la même version. Les voici.
| Épreuve | Mesure | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|
| FrontierCode 1.1 (jeu principal) | un correctif serait-il fusionné ? | 54,4 % | 49,3 % |
| AutomationBench 1.0.6 | flux métier, 47 outils | 40,0 % | 33,2 % |
| Terminal-Bench 4.0 | ligne de commande | 66,4 % | non publié par OpenAI |
| DeepSWE v1.1 | tâches longues, vrais dépôts | non publié par Anthropic | 68,8 % |
| CursorBench 4.0 | tâches multi-fichiers | 57,8 % | non publié par OpenAI |
Opus 5.5 gagne les deux confrontations possibles, de 5,1 et 6,8 points. Mais il faut lire les notes de bas de page, et elles tirent dans les deux sens.
Anthropic écrit qu’AutomationBench a été exécuté par Zapier sans modèle de repli, si bien que chaque intervention de ses garde-fous a compté comme un échec — ce qui, dit l’éditeur, « a donné un score inférieur à celui qu’Opus 5.5 obtiendrait en pratique ». Le 40,0 % serait donc sous-évalué.
OpenAI place exactement le reproche inverse sur son concurrent, dans la même épreuve : le chiffre de Claude Fable 5.1 « sous-estime son coût réel, car il omet le coût des replis vers Opus 5, survenus sur environ 40 % des tâches ». Traduction : quand Fable 5.1 ne s’en sortait pas, un autre modèle prenait la main, et la facture de ce second modèle n’était pas comptée.
Deux éditeurs, deux notes de bas de page, un même sujet : ces modèles ne travaillent pas seuls, et la comptabilité des béquilles change les scores comme les prix. Nous y revenons plus bas.
Dernier point sur ce tableau : DeepSWE. GPT-6 Sol y obtient 68,8 % à son effort maximal, ce qu’OpenAI présente comme étant « à 1,1 point du meilleur score de Claude Fable 5 » — 69,9 % — « pour un coût par tâche inférieur d’environ 80 % ». Le chiffre est crédible, mais il compare Sol à Fable 5, pas à Opus 5.5, et le classement officiel DeepSWE ne l’a pas vérifié : il ne contient pas GPT-6 Sol.
La mesure indépendante : 58 contre 48
Une seule série de mesures contient aujourd’hui les deux modèles : l’indice d’intelligence d’Artificial Analysis, version 4.3.2, dix épreuves. Les deux modèles y sont mesurés à leur effort maximal.
| Épreuve | Mesure | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|
| Terminal-Bench 4.0 | ligne de commande | 60 % | 44 % |
| SciCode | code scientifique | 67 % | 58 % |
| AutomationBench-AA | flux métier | 70 % | 62 % |
| GDPval-AA v2.1 | travail réel | 1846 | 1487 |
| AA-Briefcase v1.1 | travail sur dossiers | 1822 | 1483 |
| AA-Omniscience | réponses inventées | 46 | 27 |
| Humanity's Last Exam | questions expertes | 61 % | 48 % |
| AA-LCR v1.1 | long contexte | 85 % | 84 % |
| GDP.pdf | lecture de documents | 26 % | 25 % |
| CritPt | physique de recherche | 32 % | 31 % |
Dix épreuves, dix fois Opus 5.5 devant ou à égalité. Score composite : 58 contre 48.
Mais la répartition compte autant que le total. Sur les trois dernières lignes — long contexte, lecture de documents, physique — l’écart est d’un point. Autrement dit, là où il s’agit surtout de lire beaucoup et de rendre une réponse, les deux modèles font jeu égal, et payer le double n’a aucun sens.
L’écart se creuse là où il faut agir en plusieurs étapes : 16 points sur le terminal, 8 sur l’automatisation, 359 points d’Elo sur le travail professionnel réel. C’est exactement le profil d’un agent de programmation qui ouvre des fichiers, lance des tests, lit les erreurs et recommence.
Une ligne mérite un arrêt : AA-Omniscience, 46 contre 27. Cette épreuve récompense les bonnes réponses, pénalise les réponses inventées et ne sanctionne pas l’abstention. Pour du code, une réponse inventée coûte cher : une fonction qui n’existe pas, un paramètre imaginé, une dépendance fantôme. Sur ce point précis, l’écart est du simple au double.
Enfin, le classement général relevé le 23 septembre 2026 place Opus 5.5 à son effort maximal en première position mondiale, devant Claude Fable 5.1 et GPT-6 Astra. GPT-6 Sol à son maximum est quinzième.
Le chiffre qui décide : le réglage par défaut bat le maximum d’en face
C’est le calcul le plus utile de ce comparatif, et il inverse l’intuition.
| Réglage | Indice | Coût/tâche | Jetons |
|---|---|---|---|
| Opus 5.5, effort maximal | 58 | 5,98 $ | 119 000 |
| Opus 5.5, réglage par défaut | 51 | 1,34 $ | 25 700 |
| GPT-6 Sol, effort maximal | 48 | 1,06 $ | 31 200 |
Lisez la ligne du milieu. Opus 5.5 laissé à son réglage d’usine fait mieux que GPT-6 Sol poussé à fond, pour 26 % de plus par tâche. Pas le double : 26 %.
Et il écrit moins de jetons que son concurrent — 25 700 contre 31 200 — tout en marquant trois points de plus. Le modèle réputé bavard est ici le plus économe des deux en volume.
Deux conséquences pratiques.
La première : la question « lequel est le moins cher » n’a pas de réponse tant qu’on n’a pas fixé le réglage d’effort. Comparer un prix au jeton sans dire à quel effort chaque modèle tourne, c’est comparer deux voitures sans dire à quelle vitesse.
La seconde : si votre budget est le critère numéro un, le bon choix n’est pas forcément GPT-6 Sol, c’est peut-être Opus 5.5 réglé bas. Anthropic publie d’ailleurs plusieurs témoignages qui vont dans ce sens. Deloitte rapporte que « même à son réglage d’effort le plus bas », Opus 5.5 a détecté 72 % des bogues connus dans ses revues de code, contre 56 % pour Opus 5 à effort élevé. Rogo dit la même chose sur la finance : effort minimal d’Opus 5.5 supérieur à Opus 5 à effort élevé, avec « environ 60 % de jetons de sortie en moins ». Ce sont des chiffres de clients rapportés par l’éditeur, pas des mesures indépendantes — mais ils pointent tous dans la même direction.
Le piège du réglage maximal
Regardez maintenant la première ligne du même tableau. 5,98 dollars la tâche pour 58 d’indice, contre 1,34 dollar pour 51. Sept points d’indice coûtent 4,5 fois le prix, et 4,6 fois plus de jetons écrits.
Pire : sur une épreuve de code au moins, monter l’effort ne sert à rien. Anthropic relève sur FrontierCode 54,6 % au réglage par défaut et 54,4 % à l’effort maximal. Dans la marge d’erreur, certes — mais cela veut dire que le supplément n’achète rien.
L’éditeur lui-même met en garde, et c’est assez rare pour être cité. Dans son annonce, Anthropic écrit qu’« à ces niveaux de capacité, les écarts de benchmark sont devenus un guide moins fiable des différences réelles », et que « dans notre propre usage, l’écart entre Opus 5.5 et Claude Fable 5.1 est plus étroit que ces scores ne le suggèrent ».
Nous avions fait le même constat sur le haut de gamme dans notre comparatif GPT-6 Astra contre Claude Fable 5.1 : le réglage maximal, celui que tout le monde teste et que tous les classements affichent, est presque toujours le plus mauvais achat du catalogue.
Règle simple : réglez bas, montez seulement quand vous constatez un échec. Pas l’inverse.
Moitié prix, jusqu’à 272 000 jetons
Voici le détail qui ne figure dans aucune annonce et qui concerne directement ceux qui travaillent sur de vrais dépôts de code.
La fiche développeur de GPT-6 Sol contient une ligne discrète : « les requêtes dépassant 272 000 jetons d’entrée sont facturées au double des tarifs d’entrée et de cache, et à une fois et demie le tarif de sortie ».
La documentation tarifaire d’Anthropic dit exactement l’inverse pour ses modèles 4.6 et suivants : la fenêtre complète d’un million de jetons est facturée au tarif standard, et l’exemple est explicite — « une requête de 900 000 jetons est facturée au même tarif par jeton qu’une requête de 9 000 jetons ».
Ce qui donne ceci :
| Requête | GPT-6 Sol | Opus 5.5 | Écart |
|---|---|---|---|
| Jusqu'à 272 000 jetons | 2 $ / 10 $ | 4 $ / 20 $ | du simple au double |
| Au-delà de 272 000 jetons | 4 $ / 15 $ | 4 $ / 20 $ | entrée identique |
Prenons un cas concret et vérifiable. Vous envoyez un dépôt de 400 000 jetons — un projet de taille moyenne, ou un gros module avec son historique — et le modèle vous rend 20 000 jetons de code et d’explications.
- GPT-6 Sol : 400 000 × 4 $ / 1 000 000 = 1,60 $ d’entrée, plus 20 000 × 15 $ / 1 000 000 = 0,30 $ de sortie. Total : 1,90 $.
- Claude Opus 5.5 : 400 000 × 4 $ / 1 000 000 = 1,60 $ d’entrée, plus 20 000 × 20 $ / 1 000 000 = 0,40 $ de sortie. Total : 2,00 $.
Cinq pour cent d’écart. Pas cent pour cent. Et c’est précisément le scénario du travail sur base de code — migration, audit, revue transversale — que les deux éditeurs mettent en avant dans leurs annonces.
Le seuil n’est pas anodin non plus : 272 000 jetons, c’est environ un quart de la fenêtre annoncée par OpenAI. Le million de jetons de GPT-6 Sol existe, mais les trois quarts supérieurs sont facturés au tarif d’Opus 5.5.
Le cache coûte exactement le même prix chez les deux
Deuxième correctif au « moitié prix ».
Dans une session de programmation agentique, l’essentiel de ce qui est envoyé au modèle est relu, pas découvert : les mêmes fichiers, les mêmes consignes, le même historique, à chaque tour. C’est la raison d’être du cache, et Anthropic écrit explicitement que les lectures de cache « représentent la majorité des coûts du travail agentique et de programmation ».
Or les deux facturent la lecture de cache 0,20 dollar le million de jetons. Chez OpenAI, c’est le dixième du tarif d’entrée. Chez Anthropic, c’est un multiplicateur exceptionnel de 0,05, contre 0,1 sur tous ses autres modèles hors Fable et Mythos.
Sur la ligne de facture la plus lourde d’une session de code, l’écart de prix entre les deux modèles est nul.
Restent les écritures de cache, où GPT-6 Sol est meilleur marché : 2,50 dollars le million, contre 5 dollars chez Anthropic pour un cache de cinq minutes et 8 dollars pour un cache d’une heure. Mais une écriture sert plusieurs lectures : Anthropic indique qu’un cache de cinq minutes est rentabilisé dès la première relecture, et un cache d’une heure dès la deuxième.
OpenAI, de son côté, a travaillé la mécanique plutôt que le tarif : taux de succès de cache améliorés par défaut, tableau de bord de suivi, outil de diagnostic, points de césure explicites, et surtout la possibilité de changer le niveau d’effort ou la liste des outils sans casser le cache. GitHub rapporte que ces améliorations ont réduit « de plus de 50 % » la part des jetons nécessitant un traitement neuf, sur des milliards de requêtes.
La facture d’une journée de code, recalculée
Posons des hypothèses simples et écrites, pour que vous puissiez les refaire.
Hypothèses. Une journée de travail, 40 tâches d’agent — environ une toutes les douze minutes sur huit heures. Coût par tâche mesuré par Artificial Analysis sur son indice, qui mêle code, agent, lecture et raisonnement : c’est une approximation d’un usage réel, pas une facture de votre projet.
| Réglage | 1 jour (40 tâches) | 20 jours | Indice |
|---|---|---|---|
| GPT-6 Sol, effort maximal | 42,40 $ | 848 $ | 48 |
| Opus 5.5, réglage par défaut | 53,60 $ | 1 072 $ | 51 |
| Opus 5.5, effort maximal | 239,20 $ | 4 784 $ | 58 |
Ce que dit ce tableau. Passer de GPT-6 Sol au maximum à Opus 5.5 par défaut coûte 224 dollars de plus par mois et fait gagner trois points d’indice. Passer d’Opus 5.5 par défaut à Opus 5.5 au maximum coûte 3 712 dollars de plus par mois pour sept points.
Le premier arbitrage se discute. Le second, pour un développeur seul, ne se discute pas.
Pour situer ces montants : OpenAI écrit dans son annonce que la consommation quotidienne de jetons de ses propres chercheurs, valorisée aux tarifs de son interface de programmation, dépasse 600 dollars pour le chercheur médian et 7 000 dollars au 90e centile. L’ordre de grandeur de nos 40 tâches par jour est donc plutôt conservateur pour un usage intensif.
Et si vous n’avez pas besoin d’une réponse immédiate — analyse nocturne, migration, revue de fond — le tarif par lots d’Anthropic ramène Opus 5.5 à 2 et 10 dollars, soit le tarif standard de GPT-6 Sol. Sur ce mode, le débat de prix disparaît entièrement.
La vitesse : 2 secondes contre 22
C’est la victoire la plus nette de GPT-6 Sol, et elle ne se voit dans aucun score.
| Mesure | GPT-6 Sol | Opus 5.5 |
|---|---|---|
| Jetons par seconde (effort moyen) | 114,3 | 75,8 |
| Premier jeton (effort moyen, entrée de 10 000 jetons) | 2,0 s | 22,5 s |
| Premier jeton (effort maximal) | — | 149,29 s |
| Coût pour passer tout l'indice | 1 550 $ | 8 708 $ |
Onze fois plus rapide à démarrer. Pour un développeur qui travaille en conversation — poser une question, lire, corriger, relancer — vingt secondes d’attente avant le premier caractère, à chaque tour, changent complètement l’expérience. Et à l’effort maximal, Opus 5.5 réfléchit près de deux minutes et demie avant d’écrire quoi que ce soit.
Anthropic propose une réponse partielle : un mode rapide, en préversion de recherche, jusqu’à 2,5 fois plus véloce, facturé 8 et 40 dollars le million de jetons — soit le double du tarif normal, et quatre fois celui de GPT-6 Sol. Il est disponible dans Claude Code et sur l’interface de programmation directe d’Anthropic, mais pas via Amazon Bedrock ni Google Cloud, et pas avec le traitement par lots.
La dernière ligne du tableau donne l’autre face du même phénomène : passer l’intégralité de l’indice coûte 5,6 fois plus cher à Opus 5.5. Pour un usage à fort volume et faible enjeu — classification, résumé de journaux, génération de tests répétitifs — cet écart est décisif, et GPT-6 Sol est le bon choix. Pour ce type de tâches, GPT-6 Luna, à 0,10 et 0,50 dollar, est d’ailleurs encore plus indiqué : nous l’avions comparé à DeepSeek dans notre comparatif DeepSeek V4.1 Flash contre GPT-5.6 Luna, dont la génération vient d’être remplacée.
Les béquilles que les deux éditeurs se reprochent
Aucun de ces deux modèles ne travaille tout à fait seul, et c’est une information que les tableaux de scores cachent mal.
Anthropic l’écrit dans les notes de son propre tableau : Opus 5.5 « a été évalué avec ses protections de production activées. Lorsqu’elles sont intervenues, les tâches de cybersécurité ont été réalisées par Claude Opus 4.8, et les tâches de biologie et de développement de modèles de pointe par Claude Opus 5 ». Et d’ajouter que cela « réduit probablement » les performances affichées d’Opus 5.5.
Autrement dit : sur certaines lignes du tableau, ce n’est pas Opus 5.5 qui a répondu. Artificial Analysis en tire la conséquence dans son propre classement, où les entrées Claude portent la mention explicite « avec repli par défaut ».
OpenAI retourne le même argument contre Anthropic, sur le coût cette fois. Dans sa note sur AutomationBench : le point de mesure de Claude Fable 5.1 « sous-estime son coût réel, car il omet le coût des replis vers Opus 5, survenus sur environ 40 % des tâches ».
Quarante pour cent. Si un score annoncé pour un modèle a été obtenu quatre fois sur dix par un autre modèle, plus cher, alors ni le score ni le prix affichés ne décrivent ce que vous achèterez.
Ce qu’il faut en retenir : quand un éditeur publie un score, demandez-vous quel modèle a réellement fait le travail, et qui paie la différence. C’est le même réflexe que nous avions appliqué aux modèles qui trichent aux tests de sécurité.
Ce que chacun sait de votre langage
Pour du code, la date de connaissance n’est pas un détail : c’est elle qui détermine si le modèle connaît la version de la bibliothèque que vous utilisez, ou s’il vous propose l’interface d’il y a deux versions.
- Claude Opus 5.5 : date de connaissance fiable et date d’entraînement fixées à juin 2026.
- GPT-6 Sol : 20 avril 2026.
Deux mois d’écart, en faveur d’Anthropic. Ce n’est pas un gouffre, mais dans un écosystème où un framework majeur publie plusieurs versions par trimestre, cela suffit à créer des erreurs silencieuses — du code qui compile et qui utilise une méthode dépréciée.
Les deux modèles disposent de la recherche web pour combler le retard au cas par cas. Chez Anthropic, elle est facturée 10 dollars pour 1 000 recherches sur l’interface de programmation, en plus des jetons ; la récupération de page, elle, ne coûte que les jetons. Aucun des deux éditeurs ne publie la liste des bibliothèques réellement couvertes.
Un mot sur les fenêtres, tant qu’on y est. GPT-6 Sol annonce 1 050 000 jetons, dont 922 000 maximum en entrée. Opus 5.5 annonce 1 000 000. Sur le papier, OpenAI est devant ; en facturation, on a vu ce qu’il en était au-delà de 272 000. Et pour la sortie, les deux plafonnent à 128 000 jetons — Anthropic monte à 300 000 sur son interface par lots, avec un en-tête dédié.
Si vous faites de la cybersécurité, ce n’est pas Opus 5.5 qui répond
Ce point mérite son intertitre, parce qu’il touche une population entière de développeurs.
Anthropic écrit qu’Opus 5.5 est « comparable à Claude Mythos 5.1 en biologie et en cybersécurité », et qu’il est déployé pour cette raison avec des garde-fous équivalents à ceux de Fable 5.1. Conséquence concrète : les tâches de cybersécurité sont réacheminées vers Claude Opus 4.8, un modèle de la génération précédente.
Un programme de vérification est annoncé pour les praticiens du domaine, avec « trois niveaux d’accès de plus en plus permissifs », mais sans date de disponibilité. En attendant, si votre travail consiste à écrire des règles de détection, analyser un binaire ou auditer une chaîne d’exploitation, vous ne recevrez pas les réponses du modèle que vous payez.
GPT-6 Sol ne documente pas de mécanisme équivalent dans son annonce. OpenAI met en avant, de son côté, des progrès sur ce qu’il appelle la tromperie de programmation : le modèle affirme moins souvent avoir fait un travail qu’il n’a pas fait. Cinq catégories d’évaluation sont citées — tromperie de programmation, recherche cassée, contournement du relecteur, contournement d’avertissement, interaction non autorisée — sans chiffres publics dans l’annonce, qui renvoie au rapport système.
Sur la résistance aux instructions malveillantes cachées, Anthropic affirme qu’Opus 5.5 « égale ou dépasse Opus 5 dans tous les réglages testés », et qu’il est à égalité avec Fable 5.1 pour le plus faible taux de réussite d’injection de tous les modèles testés par la société de sécurité Gray Swan.
Côté abonnement : 15 euros contre 23
La plupart des développeurs n’appellent pas ces modèles par interface de programmation : ils passent par un abonnement. Les grilles officielles, relevées le 23 septembre 2026, donnent l’avantage à Anthropic.
| Formule | Prix | Donne accès à |
|---|---|---|
| Claude Free | 0 € | Sonnet et Haiku. Ni Opus, ni Claude Code |
| Claude Pro | 15 €/mois en annuel (180 € d'avance), 18 € en mensuel | Opus 5.5, Sonnet, Haiku, Claude Code inclus |
| Claude Max | à partir de 90 €/mois | 5× ou 20× l'usage de Pro, accès prioritaire |
| ChatGPT Free | 0 € | GPT-5.6 Luna illimité en texte, Codex « limité ». Pas GPT-6 Sol |
| ChatGPT Go | 8 €/mois | Plus de messages. Pas GPT-6 Sol, et publicités possibles |
| ChatGPT Plus | 23 €/mois | GPT-6 Astra, Sol et Luna, usage étendu de Codex |
| ChatGPT Pro | à partir de 103 €/mois | 5× plus d'usage, tâches Codex maximales |
Le ticket d’entrée est de 15 à 18 euros chez Anthropic, contre 23 chez OpenAI, pour accéder au modèle dont on parle ici. Claude Code est inclus dans toutes les formules payantes d’Anthropic et partage le même compteur que les conversations : votre travail dans le terminal et vos discussions puisent dans la même enveloppe.
Deux précisions qui coûtent cher si on les rate.
Chez Anthropic, l’accès à Fable 5.1 — le modèle le plus fort de la maison, à 10 et 50 dollars le million — n’est pas inclus dans Pro : il consomme des crédits d’usage. Sur les formules Max, il est plafonné à « 50 % des limites hebdomadaires ». Anthropic annonce par ailleurs, avec Opus 5.5, une hausse des limites sur cinq heures pour Pro, Max, Team et Enterprise, et une réinitialisation de quota « que vous pouvez conserver et utiliser quand vous le souhaitez ».
Chez OpenAI, GPT-6 Sol est disponible « dans ChatGPT Work et Codex » pour Plus, Pro, Business, Enterprise et Edu — mais l’annonce précise qu’il n’est pas encore disponible dans Chat. La page de tarifs mentionne aussi une offre temporaire de doublement de l’usage Codex, annoncée jusqu’au 31 mai 2026.
Pour le choix de l’outil lui-même plutôt que du modèle, voir notre comparatif Codex contre Cowork, et notre article sur Codex qui sort du code.
Vos données, l’Europe et le filigrane
Trois points concrets, tous tirés des documentations officielles.
Rétention zéro. Opus 5.5 est disponible avec une option de rétention nulle des données, comme les modèles Opus précédents.
Filigrane et AI Act. Anthropic indique qu’Opus 5.5, comme Fable 5.1, est livré avec ses « mesures de filigrane pour se conformer à l’AI Act européen ». Les services dans l’Union européenne sont fournis par Anthropic Ireland Limited.
Résidence des données. Sur les modèles Claude 4.6 et suivants, demander une inférence exclusivement aux États-Unis applique un multiplicateur de 1,1 sur toutes les catégories de tarif, entrée, sortie, écritures et lectures de cache comprises. Le routage mondial, qui est le comportement par défaut, reste au tarif standard. À l’inverse, les points d’accès régionaux et multirégionaux chez Amazon et Google coûtent 10 % de plus que les points d’accès mondiaux.
Un dernier changement peut casser des intégrations existantes sans prévenir : Anthropic signale une modification du traitement du raisonnement conservé, qui s’applique à Fable 5.1 et Opus 5.5 « pour les comptes créés à partir du 31 août 2026 ». Si vous avez bâti un agent sur un compte récent, c’est à vérifier avant de basculer.
Et en français ?
Aucune mesure publique ne permet de trancher, et il faut le dire plutôt que de bricoler une réponse.
Ni l’annonce d’Anthropic ni celle d’OpenAI ne publient d’évaluation en français pour ces deux modèles. Sur compar:IA, le classement public de l’État français nourri par des votes à l’aveugle d’utilisateurs francophones, le relevé du 23 septembre 2026 porte sur 68 modèles et 264 029 votes : ni Opus 5.5 ni GPT-6 Sol n’y figurent, et aucun modèle Opus ou Fable n’est classé. Les repères les plus proches sont GPT-5.6 Terra à 1 120 points et GPT-5.6 Luna à 1 104.
OpenAI mentionne bien un travail sur le style de communication — « plus de clarté, moins de jargon, moins de tournures étranges, des réponses légèrement plus courtes » — et Anthropic cite un testeur disant d’Opus 5.5 « il écrit comme moi ». Ces deux affirmations portent sur l’anglais et ne sont chiffrées ni l’une ni l’autre.
Pour du code, la question du français se pose surtout pour les commentaires, les messages de validation et les échanges en langue naturelle avec l’agent. Personne ne la mesure.
Lequel choisir
Prenez Claude Opus 5.5 si vous écrivez du code sérieusement, sur une base existante, avec un agent qui ouvre des fichiers, lance des tests et recommence. Il gagne les deux confrontations directes disponibles, il gagne la seule mesure indépendante, il est premier au classement général, et son réglage par défaut suffit à battre GPT-6 Sol poussé à fond. Réglez-le sur son effort moyen et ne montez que si vous constatez un échec. L’abonnement d’entrée est aussi le moins cher, à 15 euros par mois en annuel.
Prenez GPT-6 Sol si la latence compte plus que le dernier point de qualité — deux secondes contre vingt-deux avant le premier caractère —, si votre volume est élevé et vos tâches répétitives, ou si vous avez besoin d’un niveau d’effort « none » que Claude ne propose plus. C’est aussi le choix par défaut si vous êtes déjà dans Codex et que changer d’outil coûterait plus cher que la différence de modèle.
Ne prenez ni l’un ni l’autre à l’effort maximal sans avoir vérifié que vous en avez besoin. C’est vrai des deux, mais c’est spectaculaire chez Anthropic : 4,5 fois le prix pour sept points d’indice, et zéro gain mesurable sur FrontierCode.
Ne payez pas pour du long contexte que vous n’utilisez pas. Et si vous en utilisez vraiment, sachez qu’au-delà de 272 000 jetons l’écart de prix entre les deux tombe à 5 %.
Attendez une semaine ou deux avant de figer votre choix, si vous le pouvez. Les classements indépendants de programmation intégreront ces modèles, Anthropic annonce Sonnet 5.5 et Haiku 5.5 « dans les prochaines semaines », et notre comparateur sera mis à jour au même rythme que les mesures.
Ce qu’il faut retenir
Le 22 septembre 2026, à quelques heures d’intervalle, Anthropic a publié Claude Opus 5.5 et OpenAI a répondu avec GPT-6 Sol à moitié prix. Les deux visent le code.
Aucun classement indépendant de programmation ne les a encore mesurés. SWE-bench Verified n’accepte plus les laboratoires commerciaux depuis le 18 novembre 2025 ; DeepSWE, compar:IA et notre propre classement ne les contiennent pas dans leurs catégories code au 23 septembre.
Aucun des deux éditeurs ne s’est comparé à l’autre. Anthropic se mesure à GPT-5.6 Sol, remplacé le jour même. OpenAI se mesure à Claude Opus 5 et Fable 5.
Sur les deux seules épreuves communes, Opus 5.5 gagne : 54,4 % contre 49,3 % sur FrontierCode 1.1, 40,0 % contre 33,2 % sur AutomationBench. Sur la seule mesure indépendante, il gagne aussi : 58 contre 48, et la première place du classement général.
Le chiffre qui décide : Opus 5.5 à son réglage par défaut (51) bat GPT-6 Sol à son maximum (48), pour 1,34 dollar la tâche contre 1,06. Vingt-six pour cent de plus, pas le double.
Au-delà de 272 000 jetons, l’écart de prix s’effondre à 5 %, parce qu’OpenAI double son tarif d’entrée et qu’Anthropic n’applique aucun surcoût. Et la lecture de cache, qui porte l’essentiel de la facture d’un agent de code, coûte exactement 0,20 dollar chez les deux.
GPT-6 Sol garde deux avantages réels : il démarre onze fois plus vite, et il coûte 5,6 fois moins cher à faire tourner sur un volume important.
Vainqueur pour écrire du code : Claude Opus 5.5, à son réglage par défaut. Avec une réserve que l’éditeur formule lui-même : à ce niveau, « les écarts de benchmark sont devenus un guide moins fiable des différences réelles ».