Puce electronique vue de pres sur un circuit imprime

GPT-3, GPT-4, GPT-5 : comment les modèles d’OpenAI ont évolué (mise à jour 2026)

En six ans, les modèles GPT d’OpenAI sont passés d’un générateur de texte capable de tenir sur 2 048 tokens à un système qui manipule des applications, lit des millions de caractères et se facture au million de tokens. Voici ce qui a réellement changé entre GPT-3, GPT-4 et la famille GPT-5, avec les chiffres publiés et leurs limites. Cet article a été mis à jour le 19 septembre 2026.

Trois générations, trois échelles

Un « token » est un morceau de mot : en français, un mot en compte en moyenne un peu plus d’un. La fenêtre de contexte est la quantité de texte que le modèle peut garder « sous les yeux » dans une même conversation. C’est l’un des indicateurs les plus simples pour mesurer l’évolution des modèles.

La fenêtre de contexte, de GPT-3 à GPT-5.5

Échelle logarithmique : chaque graduation multiplie la capacité par dix.

GPT-3 (2020)
2 048
GPT-4 (2023)
8 192
GPT-4 Turbo (nov. 2023)
128 000
GPT-5.5 (avr. 2026)
1 000 000

Sources : Wikipédia (GPT-3, GPT-4), OpenAI (GPT-5.5). GPT-4 existait aussi en version 32 000 tokens via l’API. Dans l’outil Codex, GPT-5.5 est limité à 400 000 tokens.

Concrètement, on passe d’environ trois pages de texte à l’équivalent de plusieurs livres. Cela change les usages : analyser un long contrat, relire un dossier complet ou faire travailler un agent sur un projet entier devient possible en une seule requête.

GPT-3 (2020) : le pari de l’échelle

L’article scientifique décrivant GPT-3 est publié le 28 mai 2020, et l’accès par API s’ouvre en version bêta le 11 juin 2020. Le modèle compte 175 milliards de paramètres. Un paramètre est un réglage interne ajusté pendant l’entraînement : plus il y en a, plus le modèle peut retenir de régularités du langage.

Il a été entraîné sur environ 60 % de pages web filtrées (Common Crawl), 22 % de WebText2, 16 % de livres et 3 % de Wikipédia. Sa nouveauté : apprendre une tâche à partir de quelques exemples donnés dans la requête, sans réentraînement.

Ses limites sont nettes. Dans l’étude d’OpenAI, 80 participants devaient distinguer des articles d’environ 200 mots écrits par un humain ou par la machine : ils ont eu raison 52 % du temps, à peine mieux que le hasard. Mais le modèle ne « comprend » pas le monde : le chercheur Gary Marcus jugeait sa compréhension souvent « sérieusement décalée ».

GPT-4 (2023) : le texte et l’image

GPT-4 sort le 14 mars 2023. Une version préliminaire tournait déjà dans Bing Chat depuis février. Première nouveauté : il accepte des images en entrée, pas seulement du texte. Deuxième : de meilleurs résultats sur les examens professionnels et les tâches de raisonnement.

Il reste toutefois très limité sur l’abstraction : sur le test ConceptARC, il reste sous les 33 % de réussite selon les travaux rapportés par Wikipédia. Et OpenAI n’a publié ni les poids du modèle ni ses caractéristiques techniques. Le chiffre d’un billion de paramètres circulant dans la presse (Semafor) n’a jamais été confirmé. Sam Altman a seulement indiqué que l’entraînement avait coûté plus de 100 millions de dollars.

Fait à retenir : GPT-4 a été retiré de ChatGPT en avril 2025. Il reste accessible par l’API pour les développeurs. Un modèle vedette a donc une vie d’environ deux ans.

GPT-5 (août 2025) et ses successeurs

GPT-5 est lancé le 7 août 2025. OpenAI annonce de meilleures performances en mathématiques, programmation, finance et compréhension multimodale, ainsi qu’un taux d’hallucinations plus bas. L’entreprise ne donne pas, dans les éléments que nous avons pu vérifier, de chiffre unique et indépendant pour ce dernier point. Les « hallucinations » sont des réponses fausses présentées avec assurance.

Les jalons de la famille GPT-5

Dates de sortie annoncées par OpenAI ou relevées dans les sources citées.

7 août 2025 · GPT-5Lancement de la génération : mathématiques, code, multimodal.
5 mars 2026 · GPT-5.4Utilisation native de l’ordinateur (clics, applications). Versions mini et nano le 17 mars.
23 avril 2026 · GPT-5.5Contexte d’un million de tokens, travail agentique, tarification API revue.

GPT-5.4 marque un tournant : le modèle sait « utiliser un ordinateur », c’est-à-dire regarder l’écran, cliquer et saisir du texte. C’est la brique de base des agents IA. Sur OSWorld-Verified, un test de tâches réalisées dans un vrai environnement de bureau, OpenAI annonce 75 % pour GPT-5.4, contre 47,3 % pour GPT-5.2. La performance humaine moyenne mesurée sur ce test est de 72,4 %.

Utiliser un ordinateur : modèles contre humains (OSWorld-Verified)

Pourcentage de tâches réussies, chiffres publiés par OpenAI.

GPT-5.2
0
Humain moyen
0
GPT-5.4
0
GPT-5.5
0

Résultats fournis par l’éditeur, non reproduits ici de façon indépendante.

GPT-5.5 : ce qu’OpenAI annonce

Publié le 23 avril 2026, GPT-5.5 est présenté comme centré sur le code agentique, le travail sur documents et tableurs, la recherche scientifique et l’usage d’outils. OpenAI annonce 82,7 % sur Terminal-Bench 2.0 (tâches en ligne de commande), 78,7 % sur OSWorld-Verified et 84,9 % sur GDPval, un test qui compare la qualité de livrables professionnels à celle d’experts humains.

GPT-5.5 en chiffres

Données de l’annonce officielle du 23 avril 2026.

0
tokens de contexte
0
par million de tokens en entrée
0
par million de tokens en sortie
0
GDPval (annonce OpenAI)

Pour situer les tarifs, la version GPT-5.5 Pro est facturée 30 $ en entrée et 180 $ en sortie par million de tokens. Les modes Batch et Flex coûtent moitié moins cher. Le traitement prioritaire coûte 2,5 fois le tarif standard.

Point de méthode : tous ces scores viennent des éditeurs eux-mêmes. Un benchmark mesure une tâche précise, pas l’utilité réelle au quotidien. Nous les présentons comme des annonces, pas comme des vérités établies.

Le regard international : la Chine et l’open source

OpenAI n’est plus seule sur ce terrain. Des classements agrégés de septembre 2026, comme celui de Digitiz, placent dans le top 15 plusieurs modèles chinois dont les poids sont ouverts : Kimi K3 (Moonshot AI), GLM-5.3 (Z.ai), Qwen3.8 Max (Alibaba) et DeepSeek V4 Pro. Leurs prix affichés vont d’environ 1,3 $ à 3 $ le million de tokens en entrée, contre 5 $ pour GPT-5.5.

Deux précautions. Ce classement est une source tierce unique, dont la méthode de notation n’est pas la nôtre. Il mentionne aussi une famille GPT-5.6 que nous n’avons pas pu confirmer auprès d’OpenAI : ce comparatif s’arrête donc à GPT-5.5. Côté européen, les grands modèles cités dans ces classements sont peu présents, un sujet que nous traitons dans nos analyses Chine-Europe.

Conclusion : que retenir ?

Entre 2020 et 2026, trois choses ont changé : la taille de la mémoire de travail (de 2 048 tokens à un million), la nature des tâches (du texte à l’usage d’un ordinateur) et le prix, qui varie désormais fortement selon les modèles et les pays d’origine. Deux choses n’ont pas changé : les éditeurs restent les principaux juges de leurs propres modèles, et l’opacité sur l’architecture interne persiste.

Prochaine question à suivre : quand les modèles ouverts, chinois notamment, rattraperont-ils durablement les modèles fermés, et à quel prix pour les utilisateurs francophones et réunionnais ? Nous y reviendrons.

Sources

  • OpenAI, Introducing GPT-5.5 (23 avril 2026) : openai.com/index/introducing-gpt-5-5/
  • Wikipédia (en), articles GPT-3, GPT-4, GPT-5 et GPT-5.4, consultés le 19 septembre 2026
  • Digitiz, Classement des meilleurs LLM en septembre 2026 : digitiz.fr/classement-llm/

Cet article vous a plu ?

Temps de lecture : environ 7 min

Publications similaires