OpenAI, Anthropic et MiMo : comparer les meilleures IA par gamme, performance et coût
Analyse · données vérifiées le 30 septembre 2026
Le marché de l’intelligence artificielle ne se résume plus à choisir le modèle portant le numéro le plus récent. OpenAI, Anthropic et les laboratoires chinois proposent plusieurs niveaux de capacité, de prix et de vitesse, dont les frontières se recouvrent. Voici une comparaison datée du 30 septembre 2026, fondée sur les catalogues officiels et des évaluations publiques, pour comprendre où se situent GPT‑6.1 Sol, Claude Opus et Sonnet 5.5, ainsi que MiMo‑V2.6‑Pro.
1. Les gammes : une correspondance utile, mais imparfaite
Chez OpenAI, la gamme récente s’articule autour d’Astra, Sol et Luna. Chez Anthropic, le catalogue général présente Fable 5.1, Opus 5.5, Sonnet 5.5 et Haiku 4.5. Le nom Opus n’est donc plus une raison suffisante pour le placer automatiquement au sommet de toutes les catégories. Anthropic recommande Fable pour le raisonnement exigeant et les tâches longues, tout en conseillant Opus 5.5 pour la plupart des travaux. [1], [2]
Pour comparer, on peut retenir trois besoins : les projets difficiles, le travail quotidien et le traitement à grande échelle. Astra et Fable constituent un rapprochement de positionnement dans le premier groupe. Sol et Sonnet sont pertinents à examiner dans le deuxième. Luna et Haiku permettent une comparaison économique dans le troisième. Opus 5.5 occupe une place intermédiaire qui recoupe plusieurs de ces besoins.
Cette correspondance est notre grille de lecture, pas une équivalence officielle. Deux fabricants peuvent utiliser le même terme « rapide » pour des modèles qui n’ont ni le même prix ni les mêmes capacités. Il serait également artificiel d’obliger une gamme de quatre modèles à entrer exactement dans les trois cases de son concurrent.
Autre distinction : les niveaux low, medium, high ou max sont des réglages de raisonnement. Ils peuvent modifier fortement les résultats. Comparer le niveau maximal d’un modèle au niveau moyen d’un autre répond à une question de coût et de qualité dans ces configurations ; cela ne démontre pas lequel possède une « intelligence » intrinsèque supérieure.
2. Les tarifs officiels éclairent la comparaison par gamme
Le tableau ci-dessous donne les tarifs standard d’entrée et de sortie par million de tokens, sans remise de traitement différé ni supplément régional. Dans la gamme OpenAI, Astra est à 10/50 dollars, Sol 6.1 à 2/10 et Luna à 0,10/0,50 pour le contexte court. Chez Anthropic, Fable 5.1 est à 10/50, Opus 5.5 à 4/20, Sonnet 5.5 à 2/10 et Haiku 4.5 à 1/5. [3], [2]
Sol et Sonnet partagent ainsi le même tarif de base. Astra et Fable aussi. Cela rend ces rapprochements intéressants, mais la consommation totale et le recours au cache peuvent modifier le coût final. Un modèle qui produit deux fois plus de tokens ne revient pas au même prix par mission, même si son tarif unitaire est identique.
Le positionnement économique de Luna apparaît très différent de celui de Haiku : les tarifs de base d’entrée et de sortie sont dix fois inférieurs. Ce rapport de prix est un fait tarifaire, pas une mesure de qualité. Pour un classement de messages simple, le résultat pourra suffire ; pour une analyse nuancée, le modèle plus cher peut éviter des reprises qui annulent l’économie initiale.
Anthropic annonce Haiku 5.5 pour les semaines suivantes dans sa présentation de Sonnet 5.5. Nous conservons ici Haiku 4.5, présent au catalogue consulté. Un modèle annoncé et un modèle disponible ne doivent pas être fusionnés dans le même tableau. [4]
Ces prix n’incluent pas toutes les conditions particulières. Le contexte long, certains modes rapides, les outils et les modalités de cache nécessitent une lecture de la documentation de chaque fournisseur. Pour une utilisation par abonnement, ils ne constituent pas non plus une comparaison des quotas des applications ChatGPT et Claude.
| Gamme | Modèle | Entrée | Sortie |
|---|---|---|---|
| OpenAI | GPT‑6 Astra | 10 | 50 |
| OpenAI | GPT‑6.1 Sol | 2 | 10 |
| OpenAI | GPT‑6 Luna | 0,10 | 0,50 |
| Anthropic | Claude Fable 5.1 | 10 | 50 |
| Anthropic | Claude Opus 5.5 | 4 | 20 |
| Anthropic | Claude Sonnet 5.5 | 2 | 10 |
| Anthropic | Claude Haiku 4.5 | 1 | 5 |

3. Les performances : Anthropic devant sur l’indice général consulté
L’indice v4.3.2 d’Artificial Analysis offre un cadre commun. Dans les configurations consultées, Opus 5.5 à max avec secours atteint 58, Sonnet 5.5 à max avec secours 56, Fable 5.1 à max avec secours 53, Astra à max 53 et Sol 6.1 à max 52. Les chiffres sont des points d’indice, pas des pourcentages de bonnes réponses. [5]
Le mot « secours » traduit ici fallback : le système peut faire intervenir un autre modèle dans certaines situations. Le résultat décrit donc cette configuration, pas nécessairement le modèle nommé fonctionnant seul. Les garde-fous et les modèles de repli font partie de ce qui est testé. Les retirer du libellé donnerait une image incomplète du classement.
Les mesures de coût renforcent l’intérêt de séparer les dimensions. La fiche d’Opus 5.5 à max indique 5,98 dollars par tâche de l’indice ; celle de Sol 6.1 à max indique 0,72 dollar. Le premier affiche le score supérieur, le second une dépense beaucoup plus basse dans ces conditions. Le graphique permet de voir ces deux dimensions sans les confondre. [6], [7]
Sur des tests spécialisés, l’ordre peut changer. Dans l’annonce de Sonnet 5.5, Anthropic rapporte 70,6 % sur Terminal‑Bench 4.0, contre 66,4 % pour Opus 5.5 au réglage retenu. Sur FrontierCode 1.1 Main, Opus affiche 54,4 %, tandis que Sonnet varie selon l’effort : 46,2 % à max et 52,1 % à xhigh. Plus d’effort ne produit donc pas mécaniquement le meilleur score sur chaque test. [4]
Ces résultats sont publiés par Anthropic et ne sont pas des essais conduits par IAforAll. Ils illustrent cependant un point pratique : un modèle moins haut placé dans la gamme peut exceller sur une famille de tâches. Un classement général doit servir de point de départ à une sélection, puis céder la place à des tests adaptés au besoin réel.
Performance et coût : deux classements différents
Artificial Analysis · indice v4.3.2 · relevé le 30 septembre 2026. Le score est un indice, pas un pourcentage. Le coût est la moyenne pondérée en dollars par tâche de cette suite.
Échelle fixe : de 0 à 60 points. Plus haut = score supérieur.
Chaque barre part de zéro. Les réglages et éventuels modèles de secours font partie du résultat. Données et configurations. Le tableau ci-dessous conserve les valeurs sans animation.
| Modèle / effort | Indice | Coût pondéré / tâche ($) |
|---|---|---|
| Claude Opus 5.5 · max avec secours | 58 | 5,98 |
| Claude Sonnet 5.5 · max avec secours | 56 | 7,6 |
| Claude Fable 5.1 · max avec secours | 53 | 7,63 |
| GPT‑6 Astra · max | 53 | 3,26 |
| GPT‑6.1 Sol · max | 52 | 0,72 |
| MiMo‑V2.6‑Pro | 46 | 0,13 |
| GLM‑5.3 · max | 45 | 2,01 |
| Kimi K3 · max | 44 | 2,0 |
4. MiMo‑V2.6‑Pro : une alternative chinoise à prendre au sérieux
Le modèle évoqué sous le nom « MiMo 26 Pro » est précisément MiMo‑V2.6‑Pro de Xiaomi. Sa sortie figure au 22 septembre 2026 dans les notes officielles. Sa fiche sur Hugging Face publie les poids sous licence MIT. La disponibilité des poids permet d’étudier et de déployer le modèle dans les conditions de cette licence, ce qui le distingue des modèles propriétaires accessibles uniquement par un service. [8], [9]
Selon la fiche d’Artificial Analysis consultée, MiMo‑V2.6‑Pro obtient 46 points, avec un coût moyen de 0,13 dollar par tâche de l’indice. Elle donne 1 million de tokens de contexte, 42 milliards de paramètres actifs et des entrées texte, image, audio et vidéo. Les tarifs qu’elle relève sont de 0,435 dollar en entrée et 0,87 en sortie par million de tokens ; le montant applicable doit être vérifié chez le fournisseur choisi. [10]
La différence avec les modèles fermés n’est pas seulement une question de facture. Des poids accessibles peuvent intéresser une équipe qui souhaite maîtriser son déploiement ou adapter son système. Mais « ouvert » ne signifie pas « facile à faire tourner sur son ordinateur ». Une architecture de cette taille appelle des ressources et des compétences que la simple possibilité de téléchargement ne fournit pas.
Sur DeepSWE v1.1, Xiaomi publie 71,9 pour Pro et 67,9 pour Flash. Ces résultats sont ceux du fabricant. Sur AutomationBench, son tableau rapporte aussi des valeurs différentes de celles publiées dans d’autres annonces. Nous ne les mélangeons pas dans un classement commun sans avoir établi l’identité des outils, des réglages et du protocole. [9]
Dans le classement général consulté, GLM‑5.3 à max obtient 45 et Kimi K3 à max 44. MiMo ressort donc comme un candidat particulièrement intéressant parmi les modèles chinois à poids ouverts présents dans cette sélection. Cela ne suffit pas à le déclarer « meilleur modèle chinois » pour chaque usage, chaque langue ou chaque modalité. [5]
| Indicateur | Valeur | Source |
|---|---|---|
| Indice général | 46 | Artificial Analysis |
| Coût pondéré / tâche | 0,13 $ | Artificial Analysis |
| Tarifs entrée / sortie par million | 0,435 $ / 0,87 $ | Artificial Analysis, fournisseur à vérifier |
| DeepSWE v1.1 Pro / Flash | 71,9 / 67,9 | Xiaomi — évaluation fabricant |
| Licence des poids Pro RL | MIT | Fiche Xiaomi sur Hugging Face |

5. Comment choisir pour son travail, plutôt que pour un palmarès
Pour un projet difficile et ouvert, Astra, Fable ou Opus méritent d’être essayés sur le même dossier. L’évaluation doit porter sur la cohérence du travail final : les consignes ont-elles été respectées, les sources sont-elles vérifiables, les fichiers fonctionnent-ils ? Une réponse très détaillée peut rassurer sans résoudre le problème. Le contrôle du livrable reste le critère décisif.
Pour les tâches quotidiennes, Sol 6.1 et Sonnet 5.5 forment une comparaison naturelle grâce à leur tarif de base identique. Le choix peut dépendre de l’application : documents, développement, recherche, outils disponibles et manière de présenter les résultats. Ces dimensions influencent le confort de travail sans se laisser résumer par un score unique.
Pour de grands volumes, Luna et MiMo Flash valent une évaluation ciblée. Il faut mesurer le coût d’un résultat accepté, y compris les demandes répétées et les corrections. Un système économique peut traiter les cas simples puis orienter les plus difficiles vers un modèle supérieur. Cette organisation doit être testée ; elle ne découle pas automatiquement du tableau des prix.
Pour les utilisateurs français et réunionnais, la langue est un critère à part entière. L’indice Artificial Analysis est principalement anglophone. Un test personnel peut inclure une reformulation en français, un tableau de données, une consigne ambiguë et un document dont il faut citer exactement les informations. Cette petite série apportera une réponse plus directement utile qu’un classement étranger pris seul. [11]
Il faut enfin comparer des environnements comparables. Un assistant connecté à une recherche web récente n’a pas le même périmètre qu’un modèle sans outil. Si l’on veut évaluer la rédaction, on peut fournir les mêmes faits aux deux systèmes. Si l’on veut évaluer la recherche, il faut contrôler les sources trouvées et les erreurs d’attribution.
6. La conclusion : plusieurs leaders, selon le critère choisi
Dans les données consultées, Anthropic domine l’indice général aux réglages maximaux retenus. OpenAI propose avec Sol 6.1 un équilibre intéressant entre score et coût. MiMo offre une autre combinaison : performance sérieuse, faible coût mesuré et poids accessibles. Ces trois observations peuvent coexister sans contradiction.
Le vrai changement est la variété des choix crédibles. On peut sélectionner un modèle pour sa capacité à terminer une tâche difficile, un autre pour des traitements répétés et un troisième pour la maîtrise du déploiement. Une stratégie de ce type évite de payer systématiquement le modèle le plus coûteux, mais elle demande une évaluation régulière des erreurs et des reprises.
La compétition entre États-Unis et Chine rend cette méthode encore plus nécessaire. L’origine d’un modèle ne démontre ni sa qualité ni son inadéquation. Les performances doivent être examinées sur des données, et les conditions d’utilisation sur des documents contractuels adaptés au projet. Pour la France et l’océan Indien, élargir le regard permet surtout de ne pas limiter le choix aux marques les plus visibles.
Le meilleur achat ou le meilleur abonnement sera donc celui qui répond au besoin concret. Les benchmarks aident à identifier les candidats ; l’essai sur le travail réel les départage. Ce comparatif sera à réexaminer à chaque nouvelle génération, en conservant les versions des tests pour ne pas prendre un changement de barème pour un progrès du modèle.
Crédit de l’image de couverture : Code informatique : photo illustrative. Martin Vorel / Wikimedia Commons, CC BY-SA 4.0. Source originale · Licence.
Pour poursuivre ce dossier : GPT‑6.1 Sol : benchmarks et variantes · Google et l’attente de Gemini 4.
Sources et méthode
Recherche arrêtée au 30 septembre 2026. Les annonces et évaluations des fabricants sont attribuées à leurs auteurs. Les chiffres d’Artificial Analysis et de Datacurve sont des mesures externes ; IAforAll n’a pas reproduit ces benchmarks. Les positions et tarifs peuvent évoluer.
- Gamme Astra, Sol et Luna — OpenAI
- Catalogue et tarifs des modèles Claude — Anthropic
- Tarification API — OpenAI
- Présentation de Claude Sonnet 5.5 — Anthropic
- Classement des modèles — Artificial Analysis
- Mesures Claude Opus 5.5 — Artificial Analysis
- Mesures GPT‑6.1 Sol — Artificial Analysis
- Notes de versions — Xiaomi MiMo
- Poids, licence et évaluations MiMo‑V2.6‑Pro — Xiaomi
- Mesures MiMo‑V2.6‑Pro — Artificial Analysis
- Méthodologie — Artificial Analysis
Cet article vous a plu ?
Temps de lecture : environ 12 min