Classement IA

Code

Résolution bugs réels (SWE-bench), édition fichiers (Aider), raisonnement long, fiabilité, coût.

MAJ du classement le 24 juillet 2026 à 11:25

Top visuel

  1. 01 Deepseek r1 + claude 3 5 Sonnet 20241022 96.52
  2. 02 O3 (high) + gpt 4.1 95.38
  3. 03 Claude Fable 5 91.02
  4. 04 GPT 5.6 Sol Xhigh (codex Harness) 89.02
  5. 05 O3 (high) 85.94
  6. 06 Deepseek V3.2 Exp (reasoner) 84.95
  7. 07 Gemini 2.5 Pro Preview 06 05 (32k think) 84.61
  8. 08 Gemini 2.5 Pro Preview 06 05 (default think) 82.99
  9. 09 Deepseek r1 (0528) 82.38
  10. 10 Gemini 2.5 pro preview 05 06 82.14
# Modèle Éditeur Score Abonnement mensuel Évaluation
01 Anthropic 96.52 / 100 Gratuit Partiel
02 OpenAI 95.38 / 100 23 €/mois Partiel
03 Anthropic 91.02 / 100 23 €/mois Partiel
04 OpenAI 89.02 / 100 23 €/mois Partiel
05 OpenAI 85.94 / 100 23 €/mois Partiel
06 DeepSeek 84.95 / 100 Gratuit Partiel
07 Google 84.61 / 100 22 €/mois Partiel
08 Google 82.99 / 100 22 €/mois Partiel
09 DeepSeek 82.38 / 100 Gratuit Partiel
10 Google 82.14 / 100 22 €/mois Partiel
11 xAI 80.99 / 100 Gratuit Partiel
12 xAI 78.54 / 100 Gratuit Partiel
13 Google 78.47 / 100 22 €/mois Partiel
14 Anthropic 77.91 / 100 23 €/mois Partiel
15 Anthropic 77.79 / 100 23 €/mois Partiel
16 Anthropic 77.28 / 100 23 €/mois Partiel
17 Anthropic 76.04 / 100 23 €/mois Partiel
18 Anthropic 75.66 / 100 23 €/mois Partiel
19 Anthropic 75.28 / 100 23 €/mois Partiel
20 Anthropic 74.85 / 100 23 €/mois Partiel
21 Anthropic 74.77 / 100 23 €/mois Partiel
22 DeepSeek 74.76 / 100 Gratuit Partiel
23 Anthropic 74.48 / 100 23 €/mois Partiel
24 Anthropic 74.44 / 100 23 €/mois Partiel
25 Google 74.30 / 100 22 €/mois Partiel
26 OpenAI 73.70 / 100 23 €/mois Partiel
27 Anthropic 73.65 / 100 23 €/mois Partiel
28 Anthropic 73.53 / 100 23 €/mois Partiel
29 Google 73.10 / 100 22 €/mois Partiel
30 Anthropic 73.09 / 100 23 €/mois Partiel
31 xAI 72.69 / 100 Gratuit Partiel
32 Meta 72.38 / 100 Non disponible Partiel
33 OpenAI 72.23 / 100 23 €/mois Partiel
34 Anthropic 71.85 / 100 23 €/mois Partiel
35 Z.ai (zhipu ai) 71.80 / 100 Non disponible Partiel
36 xAI 71.70 / 100 Gratuit Partiel
37 ByteDance 71.48 / 100 Non disponible Partiel
38 Anthropic 71.35 / 100 23 €/mois Partiel
39 DeepSeek 71.05 / 100 Gratuit Partiel
40 Alibaba 70.35 / 100 Non disponible Partiel
41 OpenAI 69.92 / 100 23 €/mois Partiel
42 Alibaba 69.12 / 100 Non disponible Partiel
43 OpenAI 68.00 / 100 23 €/mois Fiable
44 Kimi 67.82 / 100 Non disponible Fiable
45 Google 67.42 / 100 22 €/mois Partiel
46 DeepSeek 67.41 / 100 Gratuit Fiable
47 Google 67.17 / 100 22 €/mois Partiel
48 Quasar alpha 67.13 / 100 Non disponible Partiel
49 OpenAI 66.92 / 100 23 €/mois Partiel
50 Anthropic 66.02 / 100 23 €/mois Partiel

Score indicatif, pondéré à partir de sources publiques. Méthodologie transparente. Voir la page Classement IA pour la méthodologie complète et les autres catégories.

Classement des IA de code

Le classement Code de Le Recul évalue les modèles d'IA sur ce qui compte vraiment pour développer : résoudre des bugs réels, éditer des fichiers existants, tenir un raisonnement long sur une base de code et rester fiable d'une exécution à l'autre. Il s'appuie sur des signaux publics comme SWE-bench (résolution de tickets réels) et Aider (édition de code), pondérés selon une grille « Code ».

Ici encore, pas de « meilleur outil absolu ». Un modèle peut briller sur des exercices isolés et échouer sur une vraie base de code, ou être performant mais trop coûteux pour un usage intensif. Le classement distingue les modèles de code (Claude, GPT, Gemini, DeepSeek, Qwen Coder…) des systèmes agentiques de développement (Claude Code, Cursor, Aider), traités à part dans la catégorie Agents code.

Le score reflète une tendance mesurée sur des tâches réelles, pas une promesse commerciale. Chaque évaluation porte un statut de fiabilité selon la couverture des sources, et les pondérations restent publiques. À utiliser pour choisir un modèle selon votre contexte — langage, taille de projet, budget — plutôt que pour suivre le dernier effet d'annonce.

À quoi sert ce classement ?

Ce classement aide à choisir un modèle pour assister le développement : complétion, refactoring, correction de bugs, génération de tests. Il sépare volontairement les modèles bruts des agents de code, qui ajoutent une couche d'outils et d'autonomie.

Il sert aussi à tempérer les démonstrations spectaculaires : réussir un exercice scénarisé ne garantit pas la fiabilité sur un dépôt réel, avec ses dépendances et son historique.

Comment lire le classement

  • Résolution de bugs réels (type SWE-bench), pas des exercices jouets.
  • Capacité d'édition de fichiers existants (type Aider).
  • Raisonnement long sur une base de code, sans perdre le fil.
  • Fiabilité et reproductibilité d'une exécution à l'autre.
  • Coût rapporté à l'intensité d'usage.

FAQ — Code

Quelle différence entre IA de code et agent de code ?

Un modèle de code génère et édite du texte de code. Un agent de code (Claude Code, Cursor, Aider) ajoute des outils, exécute, teste et corrige en boucle. Les agents sont classés à part dans la catégorie Agents code.

Sur quoi repose le score Code ?

Principalement sur la résolution de bugs réels (SWE-bench) et l'édition de code (Aider), complétées par le raisonnement, la fiabilité et le coût, selon une grille « Code » documentée.

Un modèle haut placé sera-t-il fiable sur mon projet ?

Le classement donne une tendance générale. Vos résultats dépendent du langage, de la taille du dépôt et du contexte. Testez sur une tâche représentative avant de conclure.

Les modèles open-weights sont-ils inclus ?

Oui quand les sources le permettent. Les modèles ouverts exécutables localement disposent aussi d'une vue dédiée (IA Locale — Code).

À quelle fréquence est-ce mis à jour ?

Environ toutes les 25 heures, automatiquement, depuis des sources publiques. La date est affichée en haut de page.

Voir la FAQ complète →

À lire aussi

Classements liés