Classement IA
Agents code
Agents orientés développement (Claude Code, Cursor Agent, Windsurf/Cascade, Aider). Évalués sur leur capacité à modifier, tester et réparer du code.
Top visuel
- 01 o1 Preview + o1 Mini 85.00
- 02 o1 Preview + claude 3 5 Sonnet 82.70
- 03 Aider Architect + Claude 3.5 Sonnet 80.50
- 04 o1 Preview + deepseek 80.49
- 05 o1 Preview + gpt 4o 80.48
- 06 Live SWE-agent + claude 4.5 opus medium (20251101) 79.20
- 07 Sonar foundation agent + claude 4.5 opus 79.19
- 08 Claude 3.5 Sonnet + deepseek 78.90
- 09 Trae + doubao Seed Code 78.80
- 10 OpenHands + claude-opus-4-5 77.60
| # | Modèle | Éditeur | Score | Évaluation | |
|---|---|---|---|---|---|
| 01 | OpenAI | 85.00 / 100 | Partiel | ||
| 02 | OpenAI | 82.70 / 100 | Partiel | ||
| 03 | Anthropic | 80.50 / 100 | Partiel | ||
| 04 | OpenAI | 80.49 / 100 | Partiel | ||
| 05 | OpenAI | 80.48 / 100 | Partiel | ||
| 06 | — | 79.20 / 100 | Partiel | ||
| 07 | Perplexity | 79.19 / 100 | Partiel | ||
| 08 | Anthropic | 78.90 / 100 | Partiel | ||
| 09 | ByteDance | 78.80 / 100 | Partiel | ||
| 10 | — | 77.60 / 100 | Partiel | ||
| 11 | — | 77.40 / 100 | Partiel | ||
| 12 | Atlassian | 76.80 / 100 | Partiel | ||
| 13 | Epam ai/run developer agent v20250719 + claude 4 sonnet | Epam systems, inc. | 76.79 / 100 | Partiel | |
| 14 | Acoder | Acoder | 76.40 / 100 | Partiel | |
| 15 | Trae | 75.20 / 100 | Partiel | ||
| 16 | Perplexity | 74.80 / 100 | Partiel | ||
| 17 | Harness ai | Harness | 74.79 / 100 | Partiel | |
| 18 | Joycode + claude 4 sonnet + gpt 4.1 | Joycode | 74.60 / 100 | Partiel | |
| 19 | Lingxi | 74.59 / 100 | Partiel | ||
| 20 | Prometheus V1.2.1 Gpt5 | — | 74.40 / 100 | Partiel | |
| 21 | Refact.ai agent + claude 4 sonnet + o4 Mini | — | 74.39 / 100 | Partiel | |
| 22 | Salesforce ai research sage (openhands) | Salesforce ai research | 73.80 / 100 | Partiel | |
| 23 | OpenAI | 73.70 / 100 | Partiel | ||
| 24 | Warp | Warp | 73.30 / 100 | Partiel | |
| 25 | Tools + claude 4 opus (2025 05 22) | — | 73.20 / 100 | Partiel | |
| 26 | Salesforce ai research sage (bash Only) | Salesforce ai research | 73.00 / 100 | Partiel | |
| 27 | Tools + claude 4 sonnet (2025 05 22) | — | 72.40 / 100 | Partiel | |
| 28 | Openhands | 71.80 / 100 | Partiel | ||
| 29 | OpenAI | 71.40 / 100 | Partiel | ||
| 30 | — | 71.20 / 100 | Partiel | ||
| 31 | Prometheus V1.2 Gpt5 | — | 71.19 / 100 | Partiel | |
| 32 | Qodo command | Qodo | 71.18 / 100 | Partiel | |
| 33 | Bloop | — | 71.17 / 100 | Partiel | |
| 34 | Moatless tools + claude 4 sonnet | Moatless ai | 70.80 / 100 | Partiel | |
| 35 | OpenAI | 70.70 / 100 | Partiel | ||
| 36 | — | 70.60 / 100 | Partiel | ||
| 37 | Augment agent v1 | — | 70.40 / 100 | Partiel | |
| 38 | Openhands | 70.39 / 100 | Partiel | ||
| 39 | Zencoder (2025 04 30) | — | 70.00 / 100 | Partiel | |
| 40 | — | 69.60 / 100 | Partiel | ||
| 41 | — | 68.20 / 100 | Partiel | ||
| 42 | Bytedance devinfra | 66.40 / 100 | Partiel | ||
| 43 | Openhands | 65.80 / 100 | Partiel | ||
| 44 | Openhands | 65.40 / 100 | Partiel | ||
| 45 | Amazon q developer agent (v20250405 Dev) | Aws | 65.39 / 100 | Partiel | |
| 46 | Augment agent v0 | — | 65.38 / 100 | Partiel | |
| 47 | Refact.ai agent | — | 65.20 / 100 | Partiel | |
| 48 | Patchpilot V1.1 | — | 64.60 / 100 | Partiel | |
| 49 | W&b programmer o1 crosscheck5 | — | 64.59 / 100 | Partiel | |
| 50 | — | 64.20 / 100 | Partiel |
Score indicatif, pondéré à partir de sources publiques. Méthodologie transparente. Voir la page Classement IA pour la méthodologie complète et les autres catégories.
Classement des agents de code
Le classement Agents code de Le Recul évalue les systèmes qui ne se contentent pas de générer du code, mais agissent sur un projet : Claude Code, Cursor Agent, Windsurf/Cascade, Aider et autres. Ces agents lisent une base de code, modifient des fichiers, lancent des tests et corrigent leurs erreurs en boucle. On les juge donc sur leur capacité à mener une tâche de développement de bout en bout, pas sur la qualité d'un extrait isolé.
C'est une catégorie distincte du classement Code, qui évalue les modèles bruts (les LLM). Ici, le LLM n'est qu'un composant : l'orchestration, les outils, la gestion du contexte et la stratégie de correction comptent autant que le modèle sous-jacent. Deux agents bâtis sur le même modèle peuvent obtenir des résultats très différents.
Le secteur avance vite et les démonstrations sont souvent flatteuses. Le Recul cherche à mesurer ce qui tient en conditions réelles — modifier un vrai dépôt, ne pas casser l'existant, vérifier son propre travail — plutôt que la fluidité d'une vidéo de lancement. À lire comme un repère critique pour choisir un agent selon votre flux de travail, votre langage et votre tolérance au risque.
À quoi sert ce classement ?
Ce classement aide à choisir un agent de développement selon votre flux réel : intégration à l'éditeur, autonomie, capacité à tester et réparer, gestion des gros dépôts.
Il rappelle qu'un même modèle donne des résultats différents selon l'agent qui l'orchestre : c'est le système complet qui est évalué, pas seulement le LLM.
Comment lire le classement
- Capacité à modifier un vrai dépôt sans casser l'existant.
- Exécution et tests : l'agent vérifie-t-il son propre travail ?
- Boucle de correction : récupération après une erreur.
- Gestion du contexte sur des projets de taille réelle.
- Supervision nécessaire et tolérance au risque.
FAQ — Agents code
Quelle différence avec le classement Code ?
Le classement Code évalue les modèles bruts (LLM). Les Agents code ajoutent outils, exécution, tests et boucle de correction. C'est le système complet qui est jugé, pas seulement le modèle.
Deux agents sur le même modèle sont-ils équivalents ?
Non. L'orchestration, la gestion du contexte et la stratégie de correction font une grande différence, même à modèle identique.
Un agent de code peut-il travailler sans supervision ?
Pas de façon fiable. Les meilleurs réduisent l'effort, mais la relecture et les tests humains restent nécessaires, surtout sur du code de production.
Sur quoi repose l'évaluation ?
Sur la capacité à mener des tâches de développement réelles de bout en bout — modifier, tester, réparer — selon une méthode documentée, plutôt que sur des démonstrations scénarisées.
Les agents open-source sont-ils inclus ?
Oui quand ils sont suffisamment documentés. Certains relèvent aussi des vues IA Locale, pour les systèmes exécutables localement.
À lire aussi
Classements liés
Ouvrir le site officiel ?
—
Vous serez redirigé vers — dans un nouvel onglet.