Code
Voir le classement →- 01 96.5 Anthropic
- 02 95.4 OpenAI
- 03 91.0 Anthropic
Rubrique
Comparer les IA sans hype. LLM généralistes, agents code, agents navigateur, agents business, modèles open source. Score indicatif, pondéré à partir de sources publiques.
Les modèles au-delà d'environ 35 milliards de paramètres ne sont pas classés dans les catégories locales. Le Recul privilégie les modèles réellement exploitables en local, sans infrastructure professionnelle lourde.
| # | Modèle | Éditeur | Score Le Recul | Abonnement mensuel | Évaluation | |
|---|---|---|---|---|---|---|
| 01 | Anthropic | 100.00 / 100 | 23 €/mois | Partiel | ||
| 02 | Anthropic | 99.64 / 100 | 23 €/mois | Partiel | ||
| 03 | Anthropic | 99.10 / 100 | 23 €/mois | Partiel | ||
| 04 | Meta | 97.84 / 100 | Non disponible | Partiel | ||
| 05 | Anthropic | 97.66 / 100 | 23 €/mois | Partiel | ||
| 06 | 96.04 / 100 | 22 €/mois | Partiel | |||
| 07 | Anthropic | 95.86 / 100 | 23 €/mois | Partiel | ||
| 08 | OpenAI | 94.77 / 100 | 23 €/mois | Partiel | ||
| 09 | OpenAI | 94.41 / 100 | 23 €/mois | Partiel | ||
| 10 | Alibaba | 94.23 / 100 | Non disponible | Partiel | ||
| 11 | 94.18 / 100 | 22 €/mois | Fiable | |||
| 12 | xAI | 94.05 / 100 | Gratuit | Partiel | ||
| 13 | Anthropic | 93.87 / 100 | 23 €/mois | Partiel | ||
| 14 | Anthropic | 93.86 / 100 | 23 €/mois | Partiel | ||
| 15 | Anthropic | 93.85 / 100 | 23 €/mois | Partiel | ||
| 16 | OpenAI | 93.84 / 100 | 23 €/mois | Partiel | ||
| 17 | xAI | 93.83 / 100 | Gratuit | Partiel | ||
| 18 | xAI | 93.51 / 100 | Gratuit | Partiel | ||
| 19 | Baidu | 92.97 / 100 | Non disponible | Partiel | ||
| 20 | xAI | 92.96 / 100 | Gratuit | Partiel |
Données temporairement indisponibles. Le classement est mis à jour 1 fois par jour par le pipeline BENCH Le Recul. Si le contenu ne s'affiche pas, réessayez dans quelques instants.
Modèles récents, previews ou challengers avec un signal prometteur, mais pas encore assez documentés pour entrer dans un classement principal.
—
Vous serez redirigé vers — dans un nouvel onglet.
Le classement s'appuie sur plusieurs benchmarks publics pour comparer les modèles selon leurs usages : conversation, code, agents, coût et performance. Le Score Le Recul est le score composite final calculé à partir de ces sources — pas une source ajoutée au calcul.
Compare les modèles sur des évaluations publiques multi-formats (texte, code web, image, vidéo) via votes d'utilisateurs et calcul Bradley-Terry.
Meilleur modèle actuel : Claude Fable 5 · 100.0
Index de qualité, vitesse et latence des modèles via API officielle Artificial Analysis (en attente de clé API gratuite).
Meilleur modèle actuel : GPT 5.6 sol (xhigh) · 82.0
Mesure la capacité d'agents et scaffolds à résoudre des bugs réels issus de projets open source.
Variante multi-langage (Python/Java/TS/Go/Rust/C#/C++/Windows) avec instances vérifiées renouvelées chaque mois.
Mesure les performances sur des tâches de code multilingues. Modes classiques alimentent Code, mode architect alimente Agents code.
Meilleur modèle actuel : Deepseek V3.2 Exp (chat) · 89.8
Alimente le critère interne connaissances du Score Le Recul : 14 disciplines (biologie, droit, math, physique, philosophie…) via dataset officiel TIGER-Lab. Critère non affiché comme colonne publique.
Meilleur modèle actuel : Gemini 3 Pro · 94.2
Composante raisonnement du Score Le Recul : extension difficile de BIG-Bench, leaderboard officiel DeepMind.
Meilleur modèle actuel : Deepseek r1 · 78.6
Meilleur modèle actuel : GPT 5.5 (high) · 81.0
Meilleur modèle actuel : Glm 5 · 87.8
Le Score Le Recul est indicatif et composite : il agrège plusieurs sources publiques (LM Arena, SWE-bench, Aider Polyglot, et Artificial Analysis quand l'API est branchée), normalise les valeurs sur 0–100 et applique une pondération documentée par catégorie. Ce score n'est pas une source ajoutée au calcul — c'est le résultat de l'agrégation. Aucune donnée n'est inventée : si une catégorie manque de mesures, l'affichage indique « données insuffisantes ».
La colonne Évaluation reflète la couverture des sources pour chaque modèle : Fiable quand au moins deux sources pertinentes indépendantes confirment le modèle (cross-validation), ou quand une source de référence forte (LM Arena, Artificial Analysis, LiveBench, Epoch) couvre à elle seule au moins 60 % des critères pondérés de la catégorie — sont alors exclus de cette promotion les modèles preview/bêta/expérimentaux et les variantes d'effort ou de raisonnement, qui restent « Partiel » ; Partiel quand une seule source documente le modèle avec une couverture exploitable mais limitée — souvent un modèle récent ou mono-source, pas encore croisé par une deuxième source indépendante ; Insuffisant quand la donnée ne permet pas un verdict propre. Une mesure de connaissances seule (MMLU-Pro) ne suffit jamais à rendre un modèle « Fiable », et les catégories dont aucune source forte ne couvre assez de critères (par ex. Code) restent « Partiel » tant qu'une deuxième source indépendante n'est pas disponible.
Score Le Recul. Le score affiché est le Score Le Recul départagé : il combine les scores des sources publiques fiables (LM Arena, SWE-bench, Aider, MMLU-Pro, BBEH, LiveBench, Artificial Analysis quand l'API est branchée) selon une pondération documentée par catégorie. Au calcul interne, une composante de départage minuscule (≤ 0.01) intègre la couverture, le nombre de sources indépendantes, le statut d'évaluation et la récence des données — invisible à deux décimales pour les scores normaux, elle distingue les modèles apparemment équivalents. Le score affiché est donc un Score Le Recul, pas une moyenne brute : les égalités apparentes sont départagées par couverture, stabilité et pertinence des sources. Le score affiché est limité à deux décimales. Aucun modèle n'est supprimé ni caché en cas d'égalité.
La catégorie Coût / performance compare la performance globale au prix de l'abonnement mensuel public (Claude.ai Pro, ChatGPT Plus, Gemini Advanced, Le Chat Pro, interfaces gratuites…). Les prix API et coûts par tokens ne sont pas pris en compte, car ils ne reflètent pas l'usage final pour un utilisateur courant.
La catégorie IA locales / open source regroupe les modèles open-weights ou open-source utilisables localement sans infrastructure lourde. Les très grands modèles (au-delà d'environ 35 milliards de paramètres) sont exclus par choix éditorial du classement principal local. Les modèles propriétaires cloud (Claude, GPT, Gemini, Grok, Mistral cloud…) ne figurent jamais dans cette catégorie.
La catégorie Agents code regroupe les systèmes agentiques (scaffolds + modèles) mesurés sur des tâches de code complètes : SWE-bench (résolution de bugs réels) et Aider mode architect. Les modèles seuls (Aider whole/diff) restent dans la catégorie Code.
Composantes additionnelles. BBEH (leaderboard officiel DeepMind) alimente le critère raisonnement ; MMLU-Pro (dataset officiel TIGER-Lab) alimente un critère interne connaissances (14 disciplines). Ces deux benchmarks sont comptés comme des sources indépendantes du Score Le Recul — jamais affichés comme colonne publique distincte, et jamais comptés deux fois. Leur effet reste mesuré : ils aident surtout à croiser les modèles déjà couverts par d'autres sources ; un modèle récent que MMLU-Pro ne couvre pas encore reste « Partiel ». Les benchmarks dont aucune source exploitable n'a été identifiée (IFEval, BBH classique, MATH, GPQA, MuSR) sont activés dès que la connexion Artificial Analysis est disponible.
Catégories masquées. Certaines catégories prévues (notamment des familles d'agents) peuvent être temporairement masquées du classement public tant qu'aucune source ne fournit assez de modèles classables. Elles ne sont pas supprimées : elles réapparaissent automatiquement dès qu'une collecte fournit des données suffisantes. Une catégorie qui contient des modèles n'est jamais masquée, même si beaucoup d'évaluations y sont encore « Partiel ».
Continuité des données. Si une source ne répond pas lors d'un cycle, le classement n'est pas vidé : la dernière mesure fiable connue de cette source est conservée, dans une limite de fraîcheur. Un garde-fou bloque toute publication qui dégraderait brutalement le classement (source critique perdue, chute anormale). Aucune donnée trop ancienne n'est présentée comme fraîche.
Score indicatif, pondéré à partir de sources publiques. Méthodologie transparente.
Cadence : Mise à jour 1×/jour, heure variable. Le site n'est pas reconstruit à chaque cycle : seuls les fichiers de données sont mis à jour.
Chaque catégorie agrège des sources publiques reconnues (LM Arena, SWE-bench, Aider, MMLU-Pro, LiveBench, Artificial Analysis, etc.), pondérées selon l'usage. Le Recul en tire un score composite normalisé sur 100, avec un départage marginal fondé sur la couverture des sources, leur indépendance, le statut d'évaluation et la récence. La méthodologie détaillée est publiée sur la page Classement IA.
Un modèle peut être absent quand les données publiques manquent, reposent sur une source unique non recoupée, ou ne correspondent pas à la catégorie (par exemple un modèle local trop volumineux pour les catégories « locales »). L'absence n'est pas un jugement de valeur : c'est l'indication d'une donnée insuffisante pour un classement honnête.
Les données sont rafraîchies régulièrement (la cadence est indiquée en haut du classement). Seuls les fichiers de données sont mis à jour, pas l'ensemble du site, et la date de dernière mise à jour est affichée en tête de page.
Une IA excellente pour le code ne l'est pas forcément pour l'image, le chat ou les tâches d'agent. Classer par usage évite les comparaisons trompeuses d'un « top 10 » générique et reflète mieux la réalité d'un choix d'outil.
Non. Le classement n'est ni sponsorisé ni payant : aucun éditeur ne peut acheter une position. Les éventuels liens affiliés, quand ils existent, sont signalés et n'entrent pas dans le calcul des scores.