GPT-3, GPT-4, GPT-5 : comment les modèles d’OpenAI ont évolué (mise à jour 2026)
En six ans, les modèles GPT d’OpenAI sont passés d’un générateur de texte capable de tenir sur 2 048 tokens à un système qui manipule des applications, lit des millions de caractères et se facture au million de tokens. Voici ce qui a réellement changé entre GPT-3, GPT-4 et la famille GPT-5, avec les chiffres publiés et leurs limites. Cet article a été mis à jour le 19 septembre 2026.
Trois générations, trois échelles
Un « token » est un morceau de mot : en français, un mot en compte en moyenne un peu plus d’un. La fenêtre de contexte est la quantité de texte que le modèle peut garder « sous les yeux » dans une même conversation. C’est l’un des indicateurs les plus simples pour mesurer l’évolution des modèles.
La fenêtre de contexte, de GPT-3 à GPT-5.5
Échelle logarithmique : chaque graduation multiplie la capacité par dix.
Sources : Wikipédia (GPT-3, GPT-4), OpenAI (GPT-5.5). GPT-4 existait aussi en version 32 000 tokens via l’API. Dans l’outil Codex, GPT-5.5 est limité à 400 000 tokens.
Concrètement, on passe d’environ trois pages de texte à l’équivalent de plusieurs livres. Cela change les usages : analyser un long contrat, relire un dossier complet ou faire travailler un agent sur un projet entier devient possible en une seule requête.
GPT-3 (2020) : le pari de l’échelle
L’article scientifique décrivant GPT-3 est publié le 28 mai 2020, et l’accès par API s’ouvre en version bêta le 11 juin 2020. Le modèle compte 175 milliards de paramètres. Un paramètre est un réglage interne ajusté pendant l’entraînement : plus il y en a, plus le modèle peut retenir de régularités du langage.
Il a été entraîné sur environ 60 % de pages web filtrées (Common Crawl), 22 % de WebText2, 16 % de livres et 3 % de Wikipédia. Sa nouveauté : apprendre une tâche à partir de quelques exemples donnés dans la requête, sans réentraînement.
Ses limites sont nettes. Dans l’étude d’OpenAI, 80 participants devaient distinguer des articles d’environ 200 mots écrits par un humain ou par la machine : ils ont eu raison 52 % du temps, à peine mieux que le hasard. Mais le modèle ne « comprend » pas le monde : le chercheur Gary Marcus jugeait sa compréhension souvent « sérieusement décalée ».
GPT-4 (2023) : le texte et l’image
GPT-4 sort le 14 mars 2023. Une version préliminaire tournait déjà dans Bing Chat depuis février. Première nouveauté : il accepte des images en entrée, pas seulement du texte. Deuxième : de meilleurs résultats sur les examens professionnels et les tâches de raisonnement.
Il reste toutefois très limité sur l’abstraction : sur le test ConceptARC, il reste sous les 33 % de réussite selon les travaux rapportés par Wikipédia. Et OpenAI n’a publié ni les poids du modèle ni ses caractéristiques techniques. Le chiffre d’un billion de paramètres circulant dans la presse (Semafor) n’a jamais été confirmé. Sam Altman a seulement indiqué que l’entraînement avait coûté plus de 100 millions de dollars.
Fait à retenir : GPT-4 a été retiré de ChatGPT en avril 2025. Il reste accessible par l’API pour les développeurs. Un modèle vedette a donc une vie d’environ deux ans.
GPT-5 (août 2025) et ses successeurs
GPT-5 est lancé le 7 août 2025. OpenAI annonce de meilleures performances en mathématiques, programmation, finance et compréhension multimodale, ainsi qu’un taux d’hallucinations plus bas. L’entreprise ne donne pas, dans les éléments que nous avons pu vérifier, de chiffre unique et indépendant pour ce dernier point. Les « hallucinations » sont des réponses fausses présentées avec assurance.
Les jalons de la famille GPT-5
Dates de sortie annoncées par OpenAI ou relevées dans les sources citées.
GPT-5.4 marque un tournant : le modèle sait « utiliser un ordinateur », c’est-à-dire regarder l’écran, cliquer et saisir du texte. C’est la brique de base des agents IA. Sur OSWorld-Verified, un test de tâches réalisées dans un vrai environnement de bureau, OpenAI annonce 75 % pour GPT-5.4, contre 47,3 % pour GPT-5.2. La performance humaine moyenne mesurée sur ce test est de 72,4 %.
Utiliser un ordinateur : modèles contre humains (OSWorld-Verified)
Pourcentage de tâches réussies, chiffres publiés par OpenAI.
Résultats fournis par l’éditeur, non reproduits ici de façon indépendante.
GPT-5.5 : ce qu’OpenAI annonce
Publié le 23 avril 2026, GPT-5.5 est présenté comme centré sur le code agentique, le travail sur documents et tableurs, la recherche scientifique et l’usage d’outils. OpenAI annonce 82,7 % sur Terminal-Bench 2.0 (tâches en ligne de commande), 78,7 % sur OSWorld-Verified et 84,9 % sur GDPval, un test qui compare la qualité de livrables professionnels à celle d’experts humains.
GPT-5.5 en chiffres
Données de l’annonce officielle du 23 avril 2026.
Pour situer les tarifs, la version GPT-5.5 Pro est facturée 30 $ en entrée et 180 $ en sortie par million de tokens. Les modes Batch et Flex coûtent moitié moins cher. Le traitement prioritaire coûte 2,5 fois le tarif standard.
Point de méthode : tous ces scores viennent des éditeurs eux-mêmes. Un benchmark mesure une tâche précise, pas l’utilité réelle au quotidien. Nous les présentons comme des annonces, pas comme des vérités établies.
Le regard international : la Chine et l’open source
OpenAI n’est plus seule sur ce terrain. Des classements agrégés de septembre 2026, comme celui de Digitiz, placent dans le top 15 plusieurs modèles chinois dont les poids sont ouverts : Kimi K3 (Moonshot AI), GLM-5.3 (Z.ai), Qwen3.8 Max (Alibaba) et DeepSeek V4 Pro. Leurs prix affichés vont d’environ 1,3 $ à 3 $ le million de tokens en entrée, contre 5 $ pour GPT-5.5.
Deux précautions. Ce classement est une source tierce unique, dont la méthode de notation n’est pas la nôtre. Il mentionne aussi une famille GPT-5.6 que nous n’avons pas pu confirmer auprès d’OpenAI : ce comparatif s’arrête donc à GPT-5.5. Côté européen, les grands modèles cités dans ces classements sont peu présents, un sujet que nous traitons dans nos analyses Chine-Europe.
Conclusion : que retenir ?
Entre 2020 et 2026, trois choses ont changé : la taille de la mémoire de travail (de 2 048 tokens à un million), la nature des tâches (du texte à l’usage d’un ordinateur) et le prix, qui varie désormais fortement selon les modèles et les pays d’origine. Deux choses n’ont pas changé : les éditeurs restent les principaux juges de leurs propres modèles, et l’opacité sur l’architecture interne persiste.
Prochaine question à suivre : quand les modèles ouverts, chinois notamment, rattraperont-ils durablement les modèles fermés, et à quel prix pour les utilisateurs francophones et réunionnais ? Nous y reviendrons.
Sources
- OpenAI, Introducing GPT-5.5 (23 avril 2026) : openai.com/index/introducing-gpt-5-5/
- Wikipédia (en), articles GPT-3, GPT-4, GPT-5 et GPT-5.4, consultés le 19 septembre 2026
- Digitiz, Classement des meilleurs LLM en septembre 2026 : digitiz.fr/classement-llm/
Cet article vous a plu ?
Temps de lecture : environ 7 min