Agents IA : ce qu’ils savent vraiment faire en 2026, et ce que ça coûte
Réserver un billet, corriger du code, remplir un formulaire : les « agents IA » promettent d’agir à votre place, pas seulement de répondre. Où en sont-ils vraiment en septembre 2026 ? Les benchmarks publics donnent des scores parfois impressionnants, mais racontent une histoire plus nuancée dès qu’on regarde comment ils sont mesurés et ce que coûte réellement chaque tâche.

Un agent, ce n’est pas un chatbot
Un chatbot répond à une question. Un agent reçoit un objectif, le découpe en étapes, utilise des outils (navigateur, fichiers, terminal, messagerie) et vérifie le résultat, en boucle, jusqu’à avoir terminé ou échoué. Le « cerveau » est un modèle de langage ; les « mains » sont les outils qu’on lui branche.
Cette différence a une conséquence pratique : un agent peut se tromper de façon durable. Une mauvaise réponse dans un chat se corrige à la question suivante ; une mauvaise action (fichier supprimé, formulaire envoyé) est parfois irréversible. Nous avons déjà exploré les usages pratiques dans notre article sur les assistants IA dans le navigateur et dans notre tutoriel Installer un agent IA sur un vieux PC Windows.
Comment mesure-t-on un agent ?
Le benchmark de référence pour les agents qui pilotent un ordinateur s’appelle OSWorld. Créé en 2024 par Tianbao Xie et ses collaborateurs (XLang Lab), il regroupe 369 tâches en anglais, à réaliser dans de vraies applications sous Ubuntu, Windows et macOS : comprendre l’écran, planifier, cliquer, taper. On mesure le pourcentage de tâches menées à bien.
D’après la synthèse du site DirectIA, les scores publiés sont en grande partie déclarés par les éditeurs des modèles eux-mêmes, et non vérifiés de façon indépendante. C’est une précaution importante pour lire n’importe quel classement.

Le classement OSWorld : la Chine et les États-Unis en tête
Selon DirectIA, les cinq meilleurs résultats listés sont : Seed 2.1 Pro de ByteDance (Chine) à 78,8 % (sorti le 24 juin 2026), Seed 2.1 Turbo à 76,4 %, Claude Opus 4.6 d’Anthropic (États-Unis) à 72,7 % (5 février 2026), Claude Sonnet 4.6 à 72,5 %, et Qwen3 VL 235B d’Alibaba (Chine) à 66,7 % (22 septembre 2025). La médiane de l’ensemble du classement est d’environ 40 %.
Deux lectures sont possibles. D’un côté, les meilleurs agents réussissent environ trois tâches sur quatre dans ce cadre. De l’autre, l’écart avec la médiane, autour de 40 %, montre que la performance varie énormément selon les modèles. Aucun modèle européen ne figure dans les cinq premiers de cette liste, mais il s’agit d’un classement partiel : on ne peut pas en conclure qu’aucun n’est évalué.
Le vrai facteur caché : le budget de calcul
Un score ne dit pas ce que la réussite a coûté. Une analyse publiée le 5 juillet 2026 sur le blog de Thibault Monteiro rappelle qu’un agent « réfléchit » en consommant des jetons (tokens), l’unité de texte facturée par les fournisseurs. Ses constats chiffrés : sur des tâches de génie logiciel (TerminalBench 2.0, SWE-Bench Pro), le taux de réussite augmente d’environ 25 % quand le budget passe de 1 à 10 millions de jetons ; sur des questions académiques difficiles, le gain atteint environ 22 % jusqu’à 5 millions de jetons.
La consommation suit une loi de puissance : une tâche d’une minute pour un humain coûte quelques milliers de jetons, une tâche d’une heure quelques millions, une tâche d’une semaine plusieurs milliards. Un défi de cybersécurité représentant environ 20 heures de travail d’expert a demandé au moins 30 millions de jetons à tous les modèles testés. Traduction : un score « à budget fixe » écarte d’office les tâches les plus longues et les plus difficiles, précisément celles qui comptent.
Où les agents réussissent, où ils plafonnent
Le même article observe un point décisif : là où l’agent peut vérifier son travail (exécuter du code, lancer des tests), plus de calcul améliore les résultats. Là où il ne peut pas le faire, comme sur les tâches médicales du benchmark HealthBench, tous les modèles plafonnent dans les budgets courants et davantage de calcul n’apporte rien.
Ce constat est utile au quotidien : un agent est fiable sur des tâches dont le résultat se contrôle facilement (une fonction qui passe ses tests, un tableau dont on peut recompter les totaux), et beaucoup moins sur celles où la correction ne se voit qu’à l’œil nu d’un expert.

Lire un benchmark : trois questions à se poser
Qui a mesuré ? Un score publié par l’éditeur du modèle n’a pas la même valeur qu’un test reproduit par un tiers. Sur OSWorld, la majorité des scores sont auto-déclarés, ce qui invite à la prudence plutôt qu’au rejet.
Sur quoi porte le test ? OSWorld regroupe 369 tâches en anglais, dans un nombre limité de systèmes et d’applications. Un agent excellent sur ce jeu de tâches peut se montrer moins à l’aise avec une interface en français, un logiciel métier ou un site aux pop-ups imprévus.
Combien cela a-t-il coûté ? Deux agents à 72 % de réussite ne sont pas équivalents si l’un consomme dix fois plus de jetons que l’autre. Le budget de calcul est la donnée qui manque le plus souvent dans les classements.
Ce que cela change concrètement pour un particulier ou une petite structure
Pour un usage personnel ou associatif, l’intérêt des agents se situe dans les tâches répétitives et bornées : trier des fichiers, préparer un brouillon de tableau, rassembler des informations dispersées, corriger un script. Ce sont des tâches où l’on peut relire le résultat en quelques minutes, ce qui correspond exactement au terrain où, d’après l’analyse citée plus haut, les agents progressent quand on leur donne les moyens de vérifier leur travail.
À l’inverse, confier à un agent une décision engageante sans relecture (un devis envoyé, une déclaration remplie, un paiement) reste risqué. Une petite structure, sur un territoire comme La Réunion, a tout intérêt à commencer par un usage interne et réversible, puis à élargir progressivement en mesurant le temps réellement gagné et le coût en jetons.
Autre point à garder en tête : les modèles et les agents évoluent très vite. Un classement daté de quelques mois peut être dépassé par une nouvelle version, et les écarts de quelques points entre deux modèles voisins sont rarement décisifs en pratique. Mieux vaut tester sur vos propres tâches, avec un budget fixé, que se fier à un seul chiffre.
Bien utiliser un agent aujourd’hui : cinq réflexes
Confier des tâches vérifiables. Privilégiez ce que vous pouvez contrôler en quelques minutes.
Limiter les droits. Donnez à l’agent l’accès minimal nécessaire : un dossier de travail plutôt que tout le disque, un compte de test plutôt que votre messagerie principale.
Exiger une validation avant l’irréversible. Envoi de messages, achats, suppressions : vous devez cliquer vous-même.
Surveiller le coût. Fixez une limite de dépense ou de jetons, surtout avec un service facturé à l’usage.
Garder une trace. Un bon agent explique ce qu’il a fait ; conservez ce journal pour comprendre une erreur.
Les agents sont déjà utiles, mais je me méfie du vocabulaire de l’autonomie totale. À mon sens, la bonne posture est celle d’un stagiaire très rapide : on lui confie des tâches bornées, on relit, et on garde la main sur ce qui ne se rattrape pas. C’est un avis, pas un fait établi.
Conclusion : puissants, mais chers et à surveiller
Les meilleurs agents réussissent environ trois tâches de bureau sur quatre sur OSWorld, avec une domination visible de ByteDance et d’Anthropic dans la liste consultée, mais ces scores sont largement auto-déclarés et ne disent rien du coût. Le vrai enjeu des prochains mois sera moins la note maximale que le prix par tâche réussie et la capacité à vérifier le résultat. Prochain article possible : comment comparer deux agents sur vos propres tâches, avec un budget fixé à l’avance.
Sources
- DirectIA, « OSWorld : classement et méthodologie ».
- Thibault Monteiro, « Agents IA : un benchmark mesure surtout le budget de tokens qu’on accorde » (5 juillet 2026).
- Photos : Wikimedia Commons (Sergei Magel/HNF, CC BY-SA 4.0 ; Shixart1985, CC BY 2.0 ; Victorgrigas, CC BY-SA 3.0).
Les scores de benchmark sont majoritairement auto-déclarés par les éditeurs de modèles et peuvent évoluer rapidement ; ils ne préjugent pas de la performance sur vos tâches.
Cet article vous a plu ?
Temps de lecture : environ 9 min