Classement IA

Agents code

Agents orientés développement (Claude Code, Cursor Agent, Windsurf/Cascade, Aider). Évalués sur leur capacité à modifier, tester et réparer du code.

MAJ du classement le 23 juillet 2026 à 09:36

Top visuel

  1. 01 o1 Preview + o1 Mini 85.00
  2. 02 o1 Preview + claude 3 5 Sonnet 82.70
  3. 03 Aider Architect + Claude 3.5 Sonnet 80.50
  4. 04 o1 Preview + deepseek 80.49
  5. 05 o1 Preview + gpt 4o 80.48
  6. 06 Live SWE-agent + claude 4.5 opus medium (20251101) 79.20
  7. 07 Sonar foundation agent + claude 4.5 opus 79.19
  8. 08 Claude 3.5 Sonnet + deepseek 78.90
  9. 09 Trae + doubao Seed Code 78.80
  10. 10 OpenHands + claude-opus-4-5 77.60
# Modèle Éditeur Score Évaluation
01 OpenAI 85.00 / 100 Partiel
02 OpenAI 82.70 / 100 Partiel
03 Anthropic 80.50 / 100 Partiel
04 OpenAI 80.49 / 100 Partiel
05 OpenAI 80.48 / 100 Partiel
06 79.20 / 100 Partiel
07 Perplexity 79.19 / 100 Partiel
08 Anthropic 78.90 / 100 Partiel
09 ByteDance 78.80 / 100 Partiel
10 77.60 / 100 Partiel
11 77.40 / 100 Partiel
12 Atlassian 76.80 / 100 Partiel
13 Epam ai/run developer agent v20250719 + claude 4 sonnet Epam systems, inc. 76.79 / 100 Partiel
14 Acoder Acoder 76.40 / 100 Partiel
15 Trae 75.20 / 100 Partiel
16 Perplexity 74.80 / 100 Partiel
17 Harness ai Harness 74.79 / 100 Partiel
18 Joycode + claude 4 sonnet + gpt 4.1 Joycode 74.60 / 100 Partiel
19 Lingxi 74.59 / 100 Partiel
20 Prometheus V1.2.1 Gpt5 74.40 / 100 Partiel
21 Refact.ai agent + claude 4 sonnet + o4 Mini 74.39 / 100 Partiel
22 Salesforce ai research sage (openhands) Salesforce ai research 73.80 / 100 Partiel
23 OpenAI 73.70 / 100 Partiel
24 Warp Warp 73.30 / 100 Partiel
25 Tools + claude 4 opus (2025 05 22) 73.20 / 100 Partiel
26 Salesforce ai research sage (bash Only) Salesforce ai research 73.00 / 100 Partiel
27 Tools + claude 4 sonnet (2025 05 22) 72.40 / 100 Partiel
28 Openhands 71.80 / 100 Partiel
29 OpenAI 71.40 / 100 Partiel
30 71.20 / 100 Partiel
31 Prometheus V1.2 Gpt5 71.19 / 100 Partiel
32 Qodo command Qodo 71.18 / 100 Partiel
33 Bloop 71.17 / 100 Partiel
34 Moatless tools + claude 4 sonnet Moatless ai 70.80 / 100 Partiel
35 OpenAI 70.70 / 100 Partiel
36 70.60 / 100 Partiel
37 Augment agent v1 70.40 / 100 Partiel
38 Openhands 70.39 / 100 Partiel
39 Zencoder (2025 04 30) 70.00 / 100 Partiel
40 69.60 / 100 Partiel
41 68.20 / 100 Partiel
42 Bytedance devinfra 66.40 / 100 Partiel
43 Openhands 65.80 / 100 Partiel
44 Openhands 65.40 / 100 Partiel
45 Amazon q developer agent (v20250405 Dev) Aws 65.39 / 100 Partiel
46 Augment agent v0 65.38 / 100 Partiel
47 Refact.ai agent 65.20 / 100 Partiel
48 Patchpilot V1.1 64.60 / 100 Partiel
49 W&b programmer o1 crosscheck5 64.59 / 100 Partiel
50 64.20 / 100 Partiel

Score indicatif, pondéré à partir de sources publiques. Méthodologie transparente. Voir la page Classement IA pour la méthodologie complète et les autres catégories.

Classement des agents de code

Le classement Agents code de Le Recul évalue les systèmes qui ne se contentent pas de générer du code, mais agissent sur un projet : Claude Code, Cursor Agent, Windsurf/Cascade, Aider et autres. Ces agents lisent une base de code, modifient des fichiers, lancent des tests et corrigent leurs erreurs en boucle. On les juge donc sur leur capacité à mener une tâche de développement de bout en bout, pas sur la qualité d'un extrait isolé.

C'est une catégorie distincte du classement Code, qui évalue les modèles bruts (les LLM). Ici, le LLM n'est qu'un composant : l'orchestration, les outils, la gestion du contexte et la stratégie de correction comptent autant que le modèle sous-jacent. Deux agents bâtis sur le même modèle peuvent obtenir des résultats très différents.

Le secteur avance vite et les démonstrations sont souvent flatteuses. Le Recul cherche à mesurer ce qui tient en conditions réelles — modifier un vrai dépôt, ne pas casser l'existant, vérifier son propre travail — plutôt que la fluidité d'une vidéo de lancement. À lire comme un repère critique pour choisir un agent selon votre flux de travail, votre langage et votre tolérance au risque.

À quoi sert ce classement ?

Ce classement aide à choisir un agent de développement selon votre flux réel : intégration à l'éditeur, autonomie, capacité à tester et réparer, gestion des gros dépôts.

Il rappelle qu'un même modèle donne des résultats différents selon l'agent qui l'orchestre : c'est le système complet qui est évalué, pas seulement le LLM.

Comment lire le classement

  • Capacité à modifier un vrai dépôt sans casser l'existant.
  • Exécution et tests : l'agent vérifie-t-il son propre travail ?
  • Boucle de correction : récupération après une erreur.
  • Gestion du contexte sur des projets de taille réelle.
  • Supervision nécessaire et tolérance au risque.

FAQ — Agents code

Quelle différence avec le classement Code ?

Le classement Code évalue les modèles bruts (LLM). Les Agents code ajoutent outils, exécution, tests et boucle de correction. C'est le système complet qui est jugé, pas seulement le modèle.

Deux agents sur le même modèle sont-ils équivalents ?

Non. L'orchestration, la gestion du contexte et la stratégie de correction font une grande différence, même à modèle identique.

Un agent de code peut-il travailler sans supervision ?

Pas de façon fiable. Les meilleurs réduisent l'effort, mais la relecture et les tests humains restent nécessaires, surtout sur du code de production.

Sur quoi repose l'évaluation ?

Sur la capacité à mener des tâches de développement réelles de bout en bout — modifier, tester, réparer — selon une méthode documentée, plutôt que sur des démonstrations scénarisées.

Les agents open-source sont-ils inclus ?

Oui quand ils sont suffisamment documentés. Certains relèvent aussi des vues IA Locale, pour les systèmes exécutables localement.

Voir la FAQ complète →

À lire aussi

Classements liés