Composants et circuits sur une carte mère informatique
|

GPT‑6.1 Sol : ce qui change vraiment, benchmarks et variantes à l’appui

Analyse · données vérifiées le 30 septembre 2026

OpenAI a annoncé GPT‑6.1 Sol le 29 septembre 2026, une semaine après GPT‑6 Sol et Luna. Cette nouvelle version cherche à rapprocher les performances de Sol de celles d’Astra, le modèle phare de la gamme, tout en conservant une tarification plus accessible. Les premiers résultats donnent matière à examiner cette promesse, à condition de distinguer les modèles, les réglages de raisonnement et les environnements dans lesquels ils sont évalués.

1. Une nouvelle version de Sol, pas trois nouveaux modèles 6.1

ChatGPT est le produit ; GPT‑6.1 Sol est le modèle. OpenAI le lance dans Work, Codex et l’API, pour les offres payantes citées dans l’annonce. Le chat classique n’est pas encore concerné. Cette distinction détermine où les utilisateurs peuvent effectivement l’essayer. [1]

La gamme à comprendre associe aujourd’hui GPT‑6 Astra, GPT‑6.1 Sol et GPT‑6 Luna. Astra vise les travaux les plus exigeants ; Sol occupe la place du modèle de travail généraliste ; Luna propose une option économique. GPT‑6 Sol, lancé le 22 septembre, est le prédécesseur direct de cette nouvelle version. Cette nomenclature ne permet pas d’inventer une déclinaison « GPT‑6.1 Luna » ou « GPT‑6.1 Terra ». Les annonces consultées n’établissent pas leur lancement. [2]

Il faut également séparer le nom du modèle de son niveau d’effort. Les réglages low, medium, high, xhigh et max de GPT‑6.1 Sol déterminent la quantité de raisonnement accordée à la tâche. Ils ne correspondent pas à cinq modèles indépendants. Le niveau medium est celui par défaut dans l’API. Un score obtenu à max ne décrit donc pas automatiquement l’expérience avec le réglage habituel. [3]

Pour le lecteur, la bonne question devient concrète : quel modèle et quel réglage ont produit le résultat annoncé ? Cette information vaut davantage qu’un numéro de version isolé. Elle évite aussi d’attribuer au modèle seul une capacité qui dépend de logiciels, d’outils de recherche ou d’un environnement de programmation.

La gamme récente : modèle et rôle
ModèlePositionnementStatut au 30 septembre
GPT‑6 AstraTravaux exigeantsDisponible
GPT‑6.1 SolTravail généralisteAnnoncé le 29 septembre
GPT‑6 LunaTraitements économiquesDisponible

2. Les benchmarks : des gains réels, avec des mesures différentes

Un benchmark est une série de tâches évaluées selon un protocole défini. DeepSWE v1.1 teste des problèmes de développement logiciel dans de vrais projets. AutomationBench examine des processus professionnels impliquant plusieurs outils. OSWorld évalue des actions dans des applications. Ces tests donnent des repères complémentaires ; leurs pourcentages ne s’additionnent pas pour former un « taux d’intelligence ».

Le tableau réunit trois gains annoncés par OpenAI, avec leurs configurations. Sur OSWorld, la notation attribue aussi des points aux tâches partiellement réalisées. [1]

Ces différences suggèrent une amélioration de l’exécution, et pas seulement de la formulation des réponses. Pour comprendre l’enjeu, imaginons un agent qui doit examiner un tableau, corriger une formule puis créer un document. Une explication convaincante ne suffit pas : les opérations doivent aboutir et laisser des fichiers utilisables. Les benchmarks d’agents essaient précisément de mesurer ce passage de la réponse au travail accompli.

Une évaluation de fabricant doit rester attribuée à son auteur. Les gains ci-dessus ne constituent pas une reproduction indépendante par IAforAll. Leur intérêt sera renforcé si des essais externes confirment les progrès dans d’autres environnements et avec des tâches différentes.

La lecture rigoureuse consiste à conserver le nom complet du test, sa version et son mode de notation. OSWorld 2.0 hors ligne ne doit pas être placé dans un même classement qu’OSWorld 2.1 en laissant croire que les conditions sont identiques. De même, un test scientifique avec terminal et outils ne se compare pas directement à un questionnaire de connaissances sans outils.

Gains annoncés par OpenAI — points, pas pourcentages relatifs
ÉvaluationGain vs GPT‑6 SolConfiguration
DeepSWE v1.1+6,4 pointsEffort et coût inférieurs selon OpenAI
AutomationBench+4,8 pointsmedium
OSWorld 2.0 hors ligne+7 pointsmax, récompense partielle
Lignes de code informatique sur un écran
Code informatique : photo illustrative. Martin Vorel / Wikimedia Commons, CC BY-SA 4.0. Source · Licence

3. Un repère indépendant : proche d’Astra, sans égalité universelle

Artificial Analysis fournit un autre angle. Sa fiche de GPT‑6.1 Sol à l’effort maximal affiche un indice d’intelligence de 52 et un coût moyen pondéré de 0,72 dollar par tâche de cet indice. La fiche d’Astra à max indique 53 et 3,26 dollars. Ce sont les valeurs consultées le 30 septembre 2026, susceptibles d’évoluer avec de nouvelles mesures. [4], [5]

Cette comparaison donne une image intéressante de Sol : un score proche pour une dépense bien moindre dans cette suite de tests. Mais un point d’écart ne prouve ni l’égalité des deux modèles ni la supériorité systématique de l’un. Un indice synthétique rassemble plusieurs capacités ; un même total peut cacher des forces et des faiblesses différentes.

La méthodologie v4.3.2 d’Artificial Analysis combine dix évaluations, dont des tâches professionnelles, de programmation, de connaissances et de raisonnement sur documents. L’organisme précise que sa suite est principalement textuelle et anglophone. Elle ne mesure donc pas directement la qualité de rédaction en français, la compréhension du créole réunionnais ou toute la performance multimodale. [6]

L’animation associée à cet article permet d’examiner les réglages de Sol. Elle affiche le score et le coût séparément. Elle ne transforme pas le score en pourcentage de réussite et n’utilise pas un rapport « score divisé par prix » comme verdict : ce calcul ferait passer un indicateur technique pour une mesure complète de la valeur du modèle.

En pratique, rapprocher deux scores peut justifier un essai comparatif sur ses propres tâches. Il ne justifie pas de supprimer toute vérification. Une erreur sur un détail de document peut coûter plus de temps à corriger que plusieurs réponses correctes n’en font gagner. Le résultat utile se juge aussi au nombre de reprises nécessaires et à la facilité avec laquelle on peut contrôler les sources.

Sol : ce que changent les réglages de raisonnement

Artificial Analysis · indice v4.3.2 · relevé le 30 septembre 2026. Le score est un indice, pas un pourcentage. Le coût est la moyenne pondérée en dollars par tâche de cette suite.

Échelle fixe : de 0 à 60 points. Plus haut = score supérieur.

Sol 6.1 · low42 pts
Sol 6.1 · medium48 pts
Sol 6.1 · high50 pts
Sol 6.1 · xhigh51 pts
Sol 6.1 · max52 pts
Astra · max53 pts

Chaque barre part de zéro. Les réglages et éventuels modèles de secours font partie du résultat. Données et configurations. Le tableau ci-dessous conserve les valeurs sans animation.

Valeurs exactes — mêmes configurations
Modèle / effortIndiceCoût pondéré / tâche ($)
Sol 6.1 · low420,13
Sol 6.1 · medium480,21
Sol 6.1 · high500,32
Sol 6.1 · xhigh510,39
Sol 6.1 · max520,72
Astra · max533,26

4. Santé et factualité : lire les progrès sans surinterpréter les scores

L’addendum de sécurité publie une comparaison sur HealthBench. Pour GPT‑6.1 Sol, les scores ajustés à la longueur sont de 64,2 sur la composante Professional, 58,5 sur HealthBench, 36,2 sur Hard et 96,0 sur Consensus. GPT‑6 Sol obtient respectivement 60,8, 53,2, 30,1 et 96,2. Astra atteint 64,7, 58,3, 36,6 et 95,5. [7]

Le tableau montre un progrès sur les trois premières composantes, mais une légère baisse sur Consensus. Le présenter intégralement évite de ne retenir que les colonnes favorables. L’ajustement à la longueur tente aussi de limiter l’avantage que pourrait procurer une réponse plus développée ; les scores ajustés doivent être comparés entre eux, sans les mélanger avec les résultats bruts.

HealthBench évalue des réponses dans un domaine particulier. Un score de 96 sur Consensus n’est pas une précision médicale générale de 96 %. Il ne décrit ni tous les diagnostics possibles ni les décisions réelles d’un professionnel. Les noms des sous-tests et leurs critères font partie du résultat, au même titre que la valeur numérique.

Sur des conversations difficiles sélectionnées après le signalement d’une erreur, OpenAI rapporte une baisse des réponses comportant au moins une erreur : 11,4 % à 7,7 % à faible effort. Soit 3,7 points, ou environ 32 % de réduction relative. Ce test ne représente pas l’usage ordinaire. [1]

Ce résultat plaide pour une amélioration sur des situations difficiles. Il ne permet pas d’annoncer que Sol est fiable à 92,3 % dans toutes les conversations. Le périmètre d’une mesure doit rester visible, surtout lorsque le chiffre paraît assez simple pour devenir un slogan.

HealthBench — scores ajustés à la longueur, OpenAI
ModèleProfessionalHealthBenchHardConsensus
GPT‑6 Sol60,853,230,196,2
GPT‑6 Luna60,854,531,495,9
GPT‑6 Astra64,758,336,695,5
GPT‑6.1 Sol64,258,536,296,0
Rangées de baies de serveurs dans un centre de données
Infrastructures numériques : photo illustrative, sans identification d’un centre de calcul de ces fabricants. Carl Lender / Wikimedia Commons, CC BY 2.0. Source · Licence

5. Tarifs, cache et vitesse : trois leviers à distinguer

L’API standard de Sol coûte 2 dollars par million de tokens en entrée et 10 dollars en sortie ; l’entrée déjà mise en cache coûte 0,10 dollar. Un token est une unité de traitement du texte, qui ne correspond pas nécessairement à un mot. Le cache permet de réutiliser du contexte déjà traité. Au-delà de 272 000 tokens d’entrée, la documentation applique des coefficients supplémentaires à la requête entière : doublement des tarifs d’entrée et de cache, multiplication du tarif de sortie par 1,5. [3]

Le tarif par token n’est pas le prix d’une mission terminée. Un agent peut multiplier les étapes, relire un dossier, utiliser des outils et consacrer du raisonnement à la vérification. La facture dépend de ce parcours. À l’inverse, une réponse courte et erronée peut être bon marché tout en imposant beaucoup de travail humain derrière elle.

Pour un usage via abonnement, les tarifs API ne permettent pas de déduire les quotas de ChatGPT. Il faut distinguer le contrat du produit, les limites d’utilisation et la facturation d’une application construite sur l’API. Le tableau tarifaire aide les développeurs ; il ne remplace pas les conditions de l’offre utilisée par le lecteur.

Une offre Ultrafast est annoncée pour les jours suivants dans Codex, avec jusqu’à huit fois la vitesse de génération. Ce facteur ne décrit pas la durée totale d’une mission. [1]

Une opération qui attend un site externe ou effectue une longue série de vérifications ne devient pas huit fois plus rapide parce que le texte est généré à ce rythme. La vitesse d’écriture, le délai avant la première réponse et le temps jusqu’au résultat final doivent être mesurés séparément.

6. Ce que cette sortie peut changer pour les utilisateurs

L’intérêt de Sol se situe dans les travaux que l’on veut répéter : analyser un dossier, réparer un programme, préparer un tableau ou mettre en forme un document. Si le modèle atteint une qualité suffisante à un coût inférieur, il devient possible d’essayer davantage de solutions, de comparer deux versions ou de réserver un modèle plus coûteux aux passages difficiles. Il s’agit d’une stratégie d’usage, pas d’une garantie fournie par les benchmarks.

Pour un lecteur francophone, une petite évaluation personnelle reste particulièrement pertinente. On peut reprendre quelques demandes habituelles, conserver les mêmes documents et vérifier le respect des consignes, la justesse des calculs et la qualité du français. Le meilleur modèle sera celui qui livre le travail attendu avec le moins de corrections, dans le temps et le budget disponibles.

À La Réunion comme ailleurs, cette approche évite de confondre l’accès à une IA avec son utilité effective. Préparer un support scolaire ou comparer des devis exige d’abord des informations exactes et un résultat clair. Le modèle choisi doit aider à atteindre cette qualité ; son nom ne la démontre pas à lui seul.

La sortie de GPT‑6.1 Sol mérite donc l’attention pour son équilibre entre capacité et coût. Les premiers chiffres étayent ce positionnement, tout en laissant Astra pertinent pour certaines tâches exigeantes. La prochaine étape sera de vérifier si cet équilibre se maintient dans des essais indépendants plus larges et dans le travail quotidien des utilisateurs.

Crédit de l’image de couverture : Carte mère : illustration matérielle, sans lien avec un fournisseur de modèles. Kurt Kaiser / Wikimedia Commons, CC0. Source originale · Licence.

Pour poursuivre ce dossier : OpenAI, Anthropic et MiMo : le comparatif · Google et l’attente de Gemini 4.

Sources et méthode

Recherche arrêtée au 30 septembre 2026. Les annonces et évaluations des fabricants sont attribuées à leurs auteurs. Les chiffres d’Artificial Analysis et de Datacurve sont des mesures externes ; IAforAll n’a pas reproduit ces benchmarks. Les positions et tarifs peuvent évoluer.

  1. Annonce de GPT‑6.1 Sol — OpenAI, 29 septembre 2026
  2. Présentation de GPT‑6 Sol et Luna — OpenAI
  3. Fiche API de GPT‑6.1 Sol — OpenAI
  4. Mesures GPT‑6.1 Sol — Artificial Analysis
  5. Mesures GPT‑6 Astra — Artificial Analysis
  6. Méthodologie de l’indice — Artificial Analysis
  7. Addendum de sécurité et HealthBench — OpenAI

Cet article vous a plu ?

Temps de lecture : environ 12 min

Publications similaires

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *