Classement IA
Code
Résolution bugs réels (SWE-bench), édition fichiers (Aider), raisonnement long, fiabilité, coût.
Top visuel
- 01 Deepseek r1 + claude 3 5 Sonnet 20241022 96.52
- 02 O3 (high) + gpt 4.1 95.38
- 03 Claude Fable 5 91.02
- 04 GPT 5.6 Sol Xhigh (codex Harness) 89.02
- 05 O3 (high) 85.94
- 06 Deepseek V3.2 Exp (reasoner) 84.95
- 07 Gemini 2.5 Pro Preview 06 05 (32k think) 84.61
- 08 Gemini 2.5 Pro Preview 06 05 (default think) 82.99
- 09 Deepseek r1 (0528) 82.38
- 10 Gemini 2.5 pro preview 05 06 82.14
| # | Modèle | Éditeur | Score | Abonnement mensuel | Évaluation | |
|---|---|---|---|---|---|---|
| 01 | Anthropic | 96.52 / 100 | Gratuit | Partiel | ||
| 02 | OpenAI | 95.38 / 100 | 23 €/mois | Partiel | ||
| 03 | Anthropic | 91.02 / 100 | 23 €/mois | Partiel | ||
| 04 | OpenAI | 89.02 / 100 | 23 €/mois | Partiel | ||
| 05 | OpenAI | 85.94 / 100 | 23 €/mois | Partiel | ||
| 06 | DeepSeek | 84.95 / 100 | Gratuit | Partiel | ||
| 07 | 84.61 / 100 | 22 €/mois | Partiel | |||
| 08 | 82.99 / 100 | 22 €/mois | Partiel | |||
| 09 | DeepSeek | 82.38 / 100 | Gratuit | Partiel | ||
| 10 | 82.14 / 100 | 22 €/mois | Partiel | |||
| 11 | xAI | 80.99 / 100 | Gratuit | Partiel | ||
| 12 | xAI | 78.54 / 100 | Gratuit | Partiel | ||
| 13 | 78.47 / 100 | 22 €/mois | Partiel | |||
| 14 | Anthropic | 77.91 / 100 | 23 €/mois | Partiel | ||
| 15 | Anthropic | 77.79 / 100 | 23 €/mois | Partiel | ||
| 16 | Anthropic | 77.28 / 100 | 23 €/mois | Partiel | ||
| 17 | Anthropic | 76.04 / 100 | 23 €/mois | Partiel | ||
| 18 | Anthropic | 75.66 / 100 | 23 €/mois | Partiel | ||
| 19 | Anthropic | 75.28 / 100 | 23 €/mois | Partiel | ||
| 20 | Anthropic | 74.85 / 100 | 23 €/mois | Partiel | ||
| 21 | Anthropic | 74.77 / 100 | 23 €/mois | Partiel | ||
| 22 | DeepSeek | 74.76 / 100 | Gratuit | Partiel | ||
| 23 | Anthropic | 74.48 / 100 | 23 €/mois | Partiel | ||
| 24 | Anthropic | 74.44 / 100 | 23 €/mois | Partiel | ||
| 25 | 74.30 / 100 | 22 €/mois | Partiel | |||
| 26 | OpenAI | 73.70 / 100 | 23 €/mois | Partiel | ||
| 27 | Anthropic | 73.65 / 100 | 23 €/mois | Partiel | ||
| 28 | Anthropic | 73.53 / 100 | 23 €/mois | Partiel | ||
| 29 | 73.10 / 100 | 22 €/mois | Partiel | |||
| 30 | Anthropic | 73.09 / 100 | 23 €/mois | Partiel | ||
| 31 | xAI | 72.69 / 100 | Gratuit | Partiel | ||
| 32 | Meta | 72.38 / 100 | Non disponible | Partiel | ||
| 33 | OpenAI | 72.23 / 100 | 23 €/mois | Partiel | ||
| 34 | Anthropic | 71.85 / 100 | 23 €/mois | Partiel | ||
| 35 | Z.ai (zhipu ai) | 71.80 / 100 | Non disponible | Partiel | ||
| 36 | xAI | 71.70 / 100 | Gratuit | Partiel | ||
| 37 | ByteDance | 71.48 / 100 | Non disponible | Partiel | ||
| 38 | Anthropic | 71.35 / 100 | 23 €/mois | Partiel | ||
| 39 | DeepSeek | 71.05 / 100 | Gratuit | Partiel | ||
| 40 | Alibaba | 70.35 / 100 | Non disponible | Partiel | ||
| 41 | OpenAI | 69.92 / 100 | 23 €/mois | Partiel | ||
| 42 | Alibaba | 69.12 / 100 | Non disponible | Partiel | ||
| 43 | OpenAI | 68.00 / 100 | 23 €/mois | Fiable | ||
| 44 | Kimi | 67.82 / 100 | Non disponible | Fiable | ||
| 45 | 67.42 / 100 | 22 €/mois | Partiel | |||
| 46 | DeepSeek | 67.41 / 100 | Gratuit | Fiable | ||
| 47 | 67.17 / 100 | 22 €/mois | Partiel | |||
| 48 | Quasar alpha | — | 67.13 / 100 | Non disponible | Partiel | |
| 49 | OpenAI | 66.92 / 100 | 23 €/mois | Partiel | ||
| 50 | Anthropic | 66.02 / 100 | 23 €/mois | Partiel |
Score indicatif, pondéré à partir de sources publiques. Méthodologie transparente. Voir la page Classement IA pour la méthodologie complète et les autres catégories.
Classement des IA de code
Le classement Code de Le Recul évalue les modèles d'IA sur ce qui compte vraiment pour développer : résoudre des bugs réels, éditer des fichiers existants, tenir un raisonnement long sur une base de code et rester fiable d'une exécution à l'autre. Il s'appuie sur des signaux publics comme SWE-bench (résolution de tickets réels) et Aider (édition de code), pondérés selon une grille « Code ».
Ici encore, pas de « meilleur outil absolu ». Un modèle peut briller sur des exercices isolés et échouer sur une vraie base de code, ou être performant mais trop coûteux pour un usage intensif. Le classement distingue les modèles de code (Claude, GPT, Gemini, DeepSeek, Qwen Coder…) des systèmes agentiques de développement (Claude Code, Cursor, Aider), traités à part dans la catégorie Agents code.
Le score reflète une tendance mesurée sur des tâches réelles, pas une promesse commerciale. Chaque évaluation porte un statut de fiabilité selon la couverture des sources, et les pondérations restent publiques. À utiliser pour choisir un modèle selon votre contexte — langage, taille de projet, budget — plutôt que pour suivre le dernier effet d'annonce.
À quoi sert ce classement ?
Ce classement aide à choisir un modèle pour assister le développement : complétion, refactoring, correction de bugs, génération de tests. Il sépare volontairement les modèles bruts des agents de code, qui ajoutent une couche d'outils et d'autonomie.
Il sert aussi à tempérer les démonstrations spectaculaires : réussir un exercice scénarisé ne garantit pas la fiabilité sur un dépôt réel, avec ses dépendances et son historique.
Comment lire le classement
- Résolution de bugs réels (type SWE-bench), pas des exercices jouets.
- Capacité d'édition de fichiers existants (type Aider).
- Raisonnement long sur une base de code, sans perdre le fil.
- Fiabilité et reproductibilité d'une exécution à l'autre.
- Coût rapporté à l'intensité d'usage.
FAQ — Code
Quelle différence entre IA de code et agent de code ?
Un modèle de code génère et édite du texte de code. Un agent de code (Claude Code, Cursor, Aider) ajoute des outils, exécute, teste et corrige en boucle. Les agents sont classés à part dans la catégorie Agents code.
Sur quoi repose le score Code ?
Principalement sur la résolution de bugs réels (SWE-bench) et l'édition de code (Aider), complétées par le raisonnement, la fiabilité et le coût, selon une grille « Code » documentée.
Un modèle haut placé sera-t-il fiable sur mon projet ?
Le classement donne une tendance générale. Vos résultats dépendent du langage, de la taille du dépôt et du contexte. Testez sur une tâche représentative avant de conclure.
Les modèles open-weights sont-ils inclus ?
Oui quand les sources le permettent. Les modèles ouverts exécutables localement disposent aussi d'une vue dédiée (IA Locale — Code).
À quelle fréquence est-ce mis à jour ?
Environ toutes les 25 heures, automatiquement, depuis des sources publiques. La date est affichée en haut de page.
À lire aussi
Classements liés
Ouvrir le site officiel ?
—
Vous serez redirigé vers — dans un nouvel onglet.