Classement IA
Agents IA
Systèmes agentiques généralistes (OpenClaw, Claude Cowork, Manus, OpenClaude, Genspark, Devin-like). Évalués sur tâches longues réelles, pas comme des LLM purs.
Top visuel — Score Le Recul
- 01 OpenClaw 87.30
- 02 OpenHands 87.30
- 03 OpenClaude 85.50
- 04 ChatGPT Agent 76.50
- 05 Microsoft Copilot Cowork 76.50
- 06 Gemini Enterprise 73.80
- 07 SWE-agent 69.30
- 08 Aider Architect 67.50
- 09 OpenCode 67.50
- 10 Hermes Agent 65.70
| # | Modèle | Éditeur | Score | Évaluation | |
|---|---|---|---|---|---|
| 01 | Agent open-source par Peter Steinberger pour automatisation navigateur + LLM au choix. | Peter steinberger | 87.30 / 100 | Le Recul | |
| 02 | Agent code open-source (ex-OpenDevin), BYO model. Présent dans SWE-bench. | All hands ai | 87.30 / 100 | Le Recul | |
| 03 | Agent open-source inspiré de Claude Cowork, BYO model. | Anthropic community | 85.50 / 100 | Le Recul | |
| 04 | Agent OpenAI intégré à ChatGPT, capable de naviguer le web et manipuler des fichiers. | OpenAI | 76.50 / 100 | Le Recul | |
| 05 | Variante Cowork de Microsoft Copilot pour collaboration multi-agents. | Microsoft | 76.50 / 100 | Le Recul | |
| 06 | Offre entreprise Google basée sur Gemini, agents personnalisables. | 73.80 / 100 | Le Recul | ||
| 07 | Scaffold agentique académique pour SWE-bench, BYO model. | Princeton nlp | 69.30 / 100 | Le Recul | |
| 08 | Mode 'architect' de Aider — planning agentique séparé de l'édition. BYO model. | Aider | 67.50 / 100 | Le Recul | |
| 09 | Agent code CLI open-source, alternative à Claude Code. | Opencode community | 67.50 / 100 | Le Recul | |
| 10 | Agent Nous Research basé sur Hermes 3, open-source, BYO model. | Nous research | 65.70 / 100 | Le Recul | |
| 11 | Agent code CLI d'Anthropic, basé sur Claude. | Anthropic | 64.80 / 100 | Le Recul | |
| 12 | CLI OpenAI pour Codex/GPT, intégré à l'écosystème OpenAI. | OpenAI | 64.80 / 100 | Le Recul | |
| 13 | CLI GitHub Copilot, intégré à GitHub. | Github / microsoft | 64.80 / 100 | Le Recul | |
| 14 | Espace de travail collaboratif Anthropic basé sur Claude — emails, docs, recherches, analyses. | Anthropic | 62.10 / 100 | Le Recul | |
| 15 | Agent recherche web / synthèse, alternative à Perplexity. | Genspark ai | 61.20 / 100 | Le Recul | |
| 16 | Agent autonome multi-tâches positionné comme alternative générique aux assistants cloud. | Manus ai | 60.30 / 100 | Le Recul | |
| 17 | Studio agentique Google intégré à Workspace (Gmail, Docs, Sheets). | 58.50 / 100 | Le Recul | ||
| 18 | Suite agentique Microsoft intégrée à Microsoft 365, Outlook, Teams. | Microsoft | 58.50 / 100 | Le Recul | |
| 19 | Droid Plateforme agentique Factory.ai pour développement. | Factory.ai | 54.90 / 100 | Le Recul |
Score indicatif, pondéré à partir de sources publiques. Méthodologie transparente. Voir la page Classement IA pour la méthodologie complète et les autres catégories.
Classement des agents IA généralistes
Le classement Agents IA de Le Recul évalue les systèmes agentiques généralistes — OpenClaw, Claude Cowork, Manus, OpenClaude, Genspark et autres assistants autonomes — sur des tâches longues et réelles, et non comme de simples modèles de langage. Un agent ne se résume pas à son LLM : il enchaîne des actions, utilise des outils, observe le résultat et se corrige. C'est cette capacité d'aller au bout d'une tâche qui est mesurée ici.
Le domaine est jeune et bruyant. Beaucoup de démonstrations impressionnantes ne se reproduisent pas en conditions réelles, et les API publiques manquent souvent pour évaluer ces systèmes de façon homogène. Le Recul s'appuie donc sur un catalogue éditorial scoré selon une méthode propre (autonomie, capacité, fiabilité), avec un plafond éditorial assumé : aucun agent n'est présenté comme magique.
Ce classement mesure une maturité, pas une promesse. Il distingue les agents généralistes des agents spécialisés — agents de code, agents navigateur, agents business — qui ont leurs propres catégories. À lire comme un état des lieux critique d'un secteur en mouvement, utile pour comprendre ce que ces systèmes savent réellement faire aujourd'hui, et où ils échouent encore.
À quoi sert ce classement ?
Ce classement aide à distinguer les agents réellement capables de mener une tâche longue de ceux qui impressionnent en démo mais décrochent en conditions réelles.
Il sépare les agents généralistes des agents spécialisés (code, navigateur, business), pour éviter de comparer des systèmes qui ne visent pas le même usage.
Comment lire le classement
- Autonomie : enchaîner des étapes sans reprise humaine constante.
- Capacité réelle sur des tâches longues, pas sur des démos scénarisées.
- Fiabilité et reproductibilité du résultat.
- Usage des outils et vérification du résultat produit.
- Score Le Recul éditorial (plafond assumé), faute d'API publiques homogènes.
FAQ — Agents IA
Pourquoi un score « Le Recul » et pas un benchmark classique ?
Parce qu'il n'existe pas encore d'API publiques homogènes pour mesurer ces agents. Le Recul utilise un catalogue éditorial scoré sur l'autonomie, la capacité et la fiabilité, avec un plafond assumé.
Quelle différence avec le classement Chat ?
Le Chat évalue des modèles de langage en conversation. Les agents enchaînent des actions, utilisent des outils et se corrigent : on les juge sur des tâches longues, pas sur une réponse unique.
Pourquoi certains agents ne sont-ils pas listés ?
Faute de données suffisantes pour les évaluer sérieusement. Les systèmes trop peu documentés sont suivis à part plutôt que surévalués.
Un agent bien classé fera-t-il mon travail tout seul ?
Non. Même les meilleurs nécessitent supervision et vérification. Le classement mesure une maturité relative, pas une autonomie totale.
Où sont les agents de code et navigateur ?
Dans leurs catégories dédiées : Agents code et Agents navigateur. Cette page couvre les agents généralistes.
À lire aussi
Classements liés
Ouvrir le site officiel ?
—
Vous serez redirigé vers — dans un nouvel onglet.