Classement IA

Agents IA

Systèmes agentiques généralistes (OpenClaw, Claude Cowork, Manus, OpenClaude, Genspark, Devin-like). Évalués sur tâches longues réelles, pas comme des LLM purs.

MAJ du classement le 24 juillet 2026 à 11:25

Top visuel — Score Le Recul

  1. 01 OpenClaw 87.30
  2. 02 OpenHands 87.30
  3. 03 OpenClaude 85.50
  4. 04 ChatGPT Agent 76.50
  5. 05 Microsoft Copilot Cowork 76.50
  6. 06 Gemini Enterprise 73.80
  7. 07 SWE-agent 69.30
  8. 08 Aider Architect 67.50
  9. 09 OpenCode 67.50
  10. 10 Hermes Agent 65.70
# Modèle Éditeur Score Évaluation
01

Agent open-source par Peter Steinberger pour automatisation navigateur + LLM au choix.

Peter steinberger 87.30 / 100 Le Recul
02

Agent code open-source (ex-OpenDevin), BYO model. Présent dans SWE-bench.

All hands ai 87.30 / 100 Le Recul
03

Agent open-source inspiré de Claude Cowork, BYO model.

Anthropic community 85.50 / 100 Le Recul
04

Agent OpenAI intégré à ChatGPT, capable de naviguer le web et manipuler des fichiers.

OpenAI 76.50 / 100 Le Recul
05

Variante Cowork de Microsoft Copilot pour collaboration multi-agents.

Microsoft 76.50 / 100 Le Recul
06

Offre entreprise Google basée sur Gemini, agents personnalisables.

Google 73.80 / 100 Le Recul
07

Scaffold agentique académique pour SWE-bench, BYO model.

Princeton nlp 69.30 / 100 Le Recul
08

Mode 'architect' de Aider — planning agentique séparé de l'édition. BYO model.

Aider 67.50 / 100 Le Recul
09

Agent code CLI open-source, alternative à Claude Code.

Opencode community 67.50 / 100 Le Recul
10

Agent Nous Research basé sur Hermes 3, open-source, BYO model.

Nous research 65.70 / 100 Le Recul
11

Agent code CLI d'Anthropic, basé sur Claude.

Anthropic 64.80 / 100 Le Recul
12

CLI OpenAI pour Codex/GPT, intégré à l'écosystème OpenAI.

OpenAI 64.80 / 100 Le Recul
13

CLI GitHub Copilot, intégré à GitHub.

Github / microsoft 64.80 / 100 Le Recul
14

Espace de travail collaboratif Anthropic basé sur Claude — emails, docs, recherches, analyses.

Anthropic 62.10 / 100 Le Recul
15

Agent recherche web / synthèse, alternative à Perplexity.

Genspark ai 61.20 / 100 Le Recul
16

Agent autonome multi-tâches positionné comme alternative générique aux assistants cloud.

Manus ai 60.30 / 100 Le Recul
17

Studio agentique Google intégré à Workspace (Gmail, Docs, Sheets).

Google 58.50 / 100 Le Recul
18

Suite agentique Microsoft intégrée à Microsoft 365, Outlook, Teams.

Microsoft 58.50 / 100 Le Recul
19 Droid

Plateforme agentique Factory.ai pour développement.

Factory.ai 54.90 / 100 Le Recul

Score indicatif, pondéré à partir de sources publiques. Méthodologie transparente. Voir la page Classement IA pour la méthodologie complète et les autres catégories.

Classement des agents IA généralistes

Le classement Agents IA de Le Recul évalue les systèmes agentiques généralistes — OpenClaw, Claude Cowork, Manus, OpenClaude, Genspark et autres assistants autonomes — sur des tâches longues et réelles, et non comme de simples modèles de langage. Un agent ne se résume pas à son LLM : il enchaîne des actions, utilise des outils, observe le résultat et se corrige. C'est cette capacité d'aller au bout d'une tâche qui est mesurée ici.

Le domaine est jeune et bruyant. Beaucoup de démonstrations impressionnantes ne se reproduisent pas en conditions réelles, et les API publiques manquent souvent pour évaluer ces systèmes de façon homogène. Le Recul s'appuie donc sur un catalogue éditorial scoré selon une méthode propre (autonomie, capacité, fiabilité), avec un plafond éditorial assumé : aucun agent n'est présenté comme magique.

Ce classement mesure une maturité, pas une promesse. Il distingue les agents généralistes des agents spécialisés — agents de code, agents navigateur, agents business — qui ont leurs propres catégories. À lire comme un état des lieux critique d'un secteur en mouvement, utile pour comprendre ce que ces systèmes savent réellement faire aujourd'hui, et où ils échouent encore.

À quoi sert ce classement ?

Ce classement aide à distinguer les agents réellement capables de mener une tâche longue de ceux qui impressionnent en démo mais décrochent en conditions réelles.

Il sépare les agents généralistes des agents spécialisés (code, navigateur, business), pour éviter de comparer des systèmes qui ne visent pas le même usage.

Comment lire le classement

  • Autonomie : enchaîner des étapes sans reprise humaine constante.
  • Capacité réelle sur des tâches longues, pas sur des démos scénarisées.
  • Fiabilité et reproductibilité du résultat.
  • Usage des outils et vérification du résultat produit.
  • Score Le Recul éditorial (plafond assumé), faute d'API publiques homogènes.

FAQ — Agents IA

Pourquoi un score « Le Recul » et pas un benchmark classique ?

Parce qu'il n'existe pas encore d'API publiques homogènes pour mesurer ces agents. Le Recul utilise un catalogue éditorial scoré sur l'autonomie, la capacité et la fiabilité, avec un plafond assumé.

Quelle différence avec le classement Chat ?

Le Chat évalue des modèles de langage en conversation. Les agents enchaînent des actions, utilisent des outils et se corrigent : on les juge sur des tâches longues, pas sur une réponse unique.

Pourquoi certains agents ne sont-ils pas listés ?

Faute de données suffisantes pour les évaluer sérieusement. Les systèmes trop peu documentés sont suivis à part plutôt que surévalués.

Un agent bien classé fera-t-il mon travail tout seul ?

Non. Même les meilleurs nécessitent supervision et vérification. Le classement mesure une maturité relative, pas une autonomie totale.

Où sont les agents de code et navigateur ?

Dans leurs catégories dédiées : Agents code et Agents navigateur. Cette page couvre les agents généralistes.

Voir la FAQ complète →

À lire aussi

Classements liés