Classement IA

Code

Résolution bugs réels (SWE-bench), édition fichiers (Aider), raisonnement long, fiabilité, coût.

MAJ du classement le 11 septembre 2026 à 10:52

Top visuel

  1. 01 Deepseek r1 + claude 3 5 Sonnet 20241022 96.83
  2. 02 O3 (high) + gpt 4.1 95.80
  3. 03 Claude Fable 5 1 Max 91.20
  4. 04 O3 (high) 85.83
  5. 05 Gemini 2.5 Pro Preview 06 05 (32k think) 85.04
  6. 06 Deepseek V3.2 Exp (reasoner) 84.39
  7. 07 Gemini 2.5 Pro Preview 06 05 (default think) 83.27
  8. 08 Gemini 2.5 pro preview 05 06 82.22
  9. 09 Claude Opus 5 Max 81.93
  10. 10 Deepseek r1 (0528) 81.79

Comparateur Le Recul

Qui gagne sur quoi

Cochez au moins deux modèles dans le tableau du classement, puis revenez ici.

# Modèle Éditeur Score Abonnement mensuel Évaluation
01 Anthropic 96.83 / 100 Gratuit Partiel
02 OpenAI 95.80 / 100 23 €/mois Partiel
03 Anthropic 91.20 / 100 23 €/mois Partiel
04 OpenAI 85.83 / 100 23 €/mois Partiel
05 Google 85.04 / 100 22 €/mois Partiel
06 DeepSeek 84.39 / 100 Gratuit Partiel
07 Google 83.27 / 100 22 €/mois Partiel
08 Google 82.22 / 100 22 €/mois Partiel
09 Anthropic 81.93 / 100 23 €/mois Partiel
10 DeepSeek 81.79 / 100 Gratuit Partiel
11 Alibaba 81.68 / 100 Non disponible Partiel
12 xAI 81.49 / 100 Gratuit Partiel
13 Anthropic 78.80 / 100 23 €/mois Partiel
14 Google 78.48 / 100 22 €/mois Partiel
15 Anthropic 76.47 / 100 23 €/mois Partiel
16 Anthropic 75.74 / 100 23 €/mois Partiel
17 OpenAI 75.70 / 100 23 €/mois Partiel
18 Anthropic 75.48 / 100 23 €/mois Partiel
19 Anthropic 75.10 / 100 23 €/mois Partiel
20 Anthropic 74.34 / 100 23 €/mois Partiel
21 DeepSeek 73.90 / 100 Gratuit Partiel
22 Anthropic 73.82 / 100 23 €/mois Partiel
23 Tencent 73.61 / 100 Non disponible Partiel
24 Anthropic 72.84 / 100 23 €/mois Partiel
25 OpenAI 72.50 / 100 23 €/mois Partiel
26 Google 72.23 / 100 22 €/mois Partiel
27 xAI 71.86 / 100 Gratuit Partiel
28 OpenAI 71.34 / 100 23 €/mois Partiel
29 xAI 70.62 / 100 Gratuit Partiel
30 Anthropic 70.54 / 100 23 €/mois Partiel
31 DeepSeek 69.93 / 100 Gratuit Partiel
32 OpenAI 69.40 / 100 23 €/mois Fiable
33 Alibaba 69.12 / 100 Non disponible Partiel
34 Alibaba 68.38 / 100 Non disponible Partiel
35 Quasar alpha 67.13 / 100 Non disponible Partiel
36 DeepSeek 66.87 / 100 Gratuit Partiel
37 DeepSeek 66.81 / 100 Gratuit Partiel
38 Google 66.18 / 100 22 €/mois Partiel
39 Google 65.94 / 100 22 €/mois Partiel
40 Optimus alpha 65.59 / 100 Non disponible Partiel
41 xAI 65.37 / 100 Gratuit Partiel
42 Anthropic 65.35 / 100 23 €/mois Partiel
43 Anthropic 64.84 / 100 23 €/mois Partiel
44 Anthropic 64.77 / 100 23 €/mois Partiel
45 Anthropic 64.75 / 100 23 €/mois Partiel
46 Tendance à la hausse sur 30 jours (+1.50 de score — écart mesuré par rapport à sa catégorie) Kimi 63.67 / 100 Non disponible Fiable
47 Meta 63.52 / 100 Non disponible Fiable
48 Anthropic 63.41 / 100 23 €/mois Partiel
49 DeepSeek 63.34 / 100 Gratuit Fiable
50 Anthropic 63.23 / 100 23 €/mois Partiel

Score indicatif, pondéré à partir de sources publiques. Méthodologie transparente. Voir la page Classement IA pour la méthodologie complète et les autres catégories.

Classement des IA de code

Le classement Code de Le Recul évalue les modèles d'IA sur ce qui compte vraiment pour développer : résoudre des bugs réels, éditer des fichiers existants, tenir un raisonnement long sur une base de code et rester fiable d'une exécution à l'autre. Il s'appuie sur des signaux publics comme SWE-bench (résolution de tickets réels) et Aider (édition de code), pondérés selon une grille « Code ».

Ici encore, pas de « meilleur outil absolu ». Un modèle peut briller sur des exercices isolés et échouer sur une vraie base de code, ou être performant mais trop coûteux pour un usage intensif. Le classement distingue les modèles de code (Claude, GPT, Gemini, DeepSeek, Qwen Coder…) des systèmes agentiques de développement (Claude Code, Cursor, Aider), traités à part dans la catégorie Agents code.

Le score reflète une tendance mesurée sur des tâches réelles, pas une promesse commerciale. Chaque évaluation porte un statut de fiabilité selon la couverture des sources, et les pondérations restent publiques. À utiliser pour choisir un modèle selon votre contexte — langage, taille de projet, budget — plutôt que pour suivre le dernier effet d'annonce.

À quoi sert ce classement ?

Ce classement aide à choisir un modèle pour assister le développement : complétion, refactoring, correction de bugs, génération de tests. Il sépare volontairement les modèles bruts des agents de code, qui ajoutent une couche d'outils et d'autonomie.

Il sert aussi à tempérer les démonstrations spectaculaires : réussir un exercice scénarisé ne garantit pas la fiabilité sur un dépôt réel, avec ses dépendances et son historique.

Comment lire le classement

  • Résolution de bugs réels (type SWE-bench), pas des exercices jouets.
  • Capacité d'édition de fichiers existants (type Aider).
  • Raisonnement long sur une base de code, sans perdre le fil.
  • Fiabilité et reproductibilité d'une exécution à l'autre.
  • Coût rapporté à l'intensité d'usage.

FAQ — Code

Quelle différence entre IA de code et agent de code ?

Un modèle de code génère et édite du texte de code. Un agent de code (Claude Code, Cursor, Aider) ajoute des outils, exécute, teste et corrige en boucle. Les agents sont classés à part dans la catégorie Agents code.

Sur quoi repose le score Code ?

Principalement sur la résolution de bugs réels (SWE-bench) et l'édition de code (Aider), complétées par le raisonnement, la fiabilité et le coût, selon une grille « Code » documentée.

Un modèle haut placé sera-t-il fiable sur mon projet ?

Le classement donne une tendance générale. Vos résultats dépendent du langage, de la taille du dépôt et du contexte. Testez sur une tâche représentative avant de conclure.

Les modèles open-weights sont-ils inclus ?

Oui quand les sources le permettent. Les modèles ouverts exécutables localement disposent aussi d'une vue dédiée (IA Locale — Code).

À quelle fréquence est-ce mis à jour ?

Environ toutes les 25 heures, automatiquement, depuis des sources publiques. La date est affichée en haut de page.

Voir la FAQ complète →

À lire aussi

Classements liés