Classement IA

Agents code

Agents orientés développement (Claude Code, Cursor Agent, Windsurf/Cascade, Aider). Évalués sur leur capacité à modifier, tester et réparer du code.

MAJ du classement le 11 septembre 2026 à 10:52

Top visuel

  1. 01 Live SWE-agent + claude 4.5 opus medium (20251101) 79.21
  2. 02 Sonar foundation agent + claude 4.5 opus 79.20
  3. 03 Trae + doubao Seed Code 78.81
  4. 04 OpenHands + claude opus 4.5 77.61
  5. 05 Atlassian rovo dev (2025 09 02) 76.81
  6. 06 Epam ai/run developer agent v20250719 + claude 4 sonnet 76.80
  7. 07 Acoder 76.41
  8. 08 Harness ai 74.81
  9. 09 Joycode + claude 4 sonnet + gpt 4.1 74.61
  10. 10 Lingxi V1.5 Claude 4 Sonnet 20250514 74.60

Comparateur Le Recul

Qui gagne sur quoi

Cochez au moins deux modèles dans le tableau du classement, puis revenez ici.

# Modèle Éditeur Score Évaluation
01 79.21 / 100 Partiel
02 Perplexity 79.20 / 100 Partiel
03 ByteDance 78.81 / 100 Partiel
04 Openhands 77.61 / 100 Partiel
05 Atlassian 76.81 / 100 Partiel
06 AI/Run Developer Agent Epam systems, inc. 76.80 / 100 Partiel
07 ACoder Acoder 76.41 / 100 Partiel
08 Harness AI Harness 74.81 / 100 Partiel
09 JoyCode Joycode 74.61 / 100 Partiel
10 Lingxi 74.60 / 100 Partiel
11 Prometheus 74.41 / 100 Partiel
12 Refact.ai Agent 74.40 / 100 Partiel
13 Warp Warp 73.31 / 100 Partiel
14 Anthropic Tools 73.21 / 100 Partiel
15 Salesforce SAGE Salesforce ai research 73.01 / 100 Partiel
16 Anthropic 71.71 / 100 Partiel
17 Qodo Command Qodo 71.21 / 100 Partiel
18 Bloop 71.20 / 100 Partiel
19 Augment Agent 70.41 / 100 Partiel
20 Zencoder 70.01 / 100 Partiel
21 Google deepmind 69.41 / 100 Partiel
22 68.21 / 100 Partiel
23 Bytedance devinfra 66.41 / 100 Partiel
24 Amazon Q Developer Agent Aws 65.41 / 100 Partiel
25 PatchPilot 64.61 / 100 Partiel
26 W&B Programmer 64.60 / 100 Partiel
27 Alibaba 63.41 / 100 Partiel
28 NVIDIA 63.21 / 100 Partiel
29 CodeStory Midwit 62.21 / 100 Partiel
30 OpenAI 62.01 / 100 Partiel
31 ExpeRepair 60.31 / 100 Partiel
32 Google 60.21 / 100 Partiel
33 DeepSWE 58.81 / 100 Partiel
34 KGCompass 58.31 / 100 Partiel
35 devlo 57.48 / 100 Partiel
36 Emergent E1 57.21 / 100 Partiel
37 Artemis Agent 57.01 / 100 Partiel
38 SWE-Rizzo 56.61 / 100 Partiel
39 Blackbox AI Agent 55.91 / 100 Partiel
40 FrogBoss 53.61 / 100 Partiel
41 Bracket.sh 53.21 / 100 Partiel
42 Gru 52.86 / 100 Partiel
43 Google 52.21 / 100 Partiel
44 EntroPO 51.83 / 100 Partiel
45 Engine Labs 51.81 / 100 Partiel
46 SemAgent 51.71 / 100 Partiel
47 AutoCodeRover 51.61 / 100 Partiel
48 Isea 51.31 / 100 Partiel
49 Solver 50.01 / 100 Partiel
50 nFactorial 49.21 / 100 Partiel

Score indicatif, pondéré à partir de sources publiques. Méthodologie transparente. Voir la page Classement IA pour la méthodologie complète et les autres catégories.

Classement des agents de code

Le classement Agents code de Le Recul évalue les systèmes qui ne se contentent pas de générer du code, mais agissent sur un projet : Claude Code, Cursor Agent, Windsurf/Cascade, Aider et autres. Ces agents lisent une base de code, modifient des fichiers, lancent des tests et corrigent leurs erreurs en boucle. On les juge donc sur leur capacité à mener une tâche de développement de bout en bout, pas sur la qualité d'un extrait isolé.

C'est une catégorie distincte du classement Code, qui évalue les modèles bruts (les LLM). Ici, le LLM n'est qu'un composant : l'orchestration, les outils, la gestion du contexte et la stratégie de correction comptent autant que le modèle sous-jacent. Deux agents bâtis sur le même modèle peuvent obtenir des résultats très différents.

Le secteur avance vite et les démonstrations sont souvent flatteuses. Le Recul cherche à mesurer ce qui tient en conditions réelles — modifier un vrai dépôt, ne pas casser l'existant, vérifier son propre travail — plutôt que la fluidité d'une vidéo de lancement. À lire comme un repère critique pour choisir un agent selon votre flux de travail, votre langage et votre tolérance au risque.

À quoi sert ce classement ?

Ce classement aide à choisir un agent de développement selon votre flux réel : intégration à l'éditeur, autonomie, capacité à tester et réparer, gestion des gros dépôts.

Il rappelle qu'un même modèle donne des résultats différents selon l'agent qui l'orchestre : c'est le système complet qui est évalué, pas seulement le LLM.

Comment lire le classement

  • Capacité à modifier un vrai dépôt sans casser l'existant.
  • Exécution et tests : l'agent vérifie-t-il son propre travail ?
  • Boucle de correction : récupération après une erreur.
  • Gestion du contexte sur des projets de taille réelle.
  • Supervision nécessaire et tolérance au risque.

FAQ — Agents code

Quelle différence avec le classement Code ?

Le classement Code évalue les modèles bruts (LLM). Les Agents code ajoutent outils, exécution, tests et boucle de correction. C'est le système complet qui est jugé, pas seulement le modèle.

Deux agents sur le même modèle sont-ils équivalents ?

Non. L'orchestration, la gestion du contexte et la stratégie de correction font une grande différence, même à modèle identique.

Un agent de code peut-il travailler sans supervision ?

Pas de façon fiable. Les meilleurs réduisent l'effort, mais la relecture et les tests humains restent nécessaires, surtout sur du code de production.

Sur quoi repose l'évaluation ?

Sur la capacité à mener des tâches de développement réelles de bout en bout — modifier, tester, réparer — selon une méthode documentée, plutôt que sur des démonstrations scénarisées.

Les agents open-source sont-ils inclus ?

Oui quand ils sont suffisamment documentés. Certains relèvent aussi des vues IA Locale, pour les systèmes exécutables localement.

Voir la FAQ complète →

À lire aussi

Classements liés