Gemini 4 se fait attendre : Google est-il vraiment en retard dans l’IA ?
Analyse · données vérifiées le 30 septembre 2026
Les sorties récentes de Claude 5.5 et de GPT‑6.1 Sol rendent l’attente de Gemini 4 plus visible. Mais compter les annonces ne suffit pas à mesurer la position de Google : Gemini 3.8 Flash, les modèles audio et les déclinaisons spécialisées continuent d’évoluer. Les données disponibles au 30 septembre 2026 montrent un retard sur certains classements généraux, tout en interdisant de conclure à un arrêt des progrès.
1. Gemini 4 : un développement confirmé, sans date ferme vérifiée
Le 22 juillet 2026, Sundar Pichai indiquait que Google avait commencé son cycle de préentraînement le plus ambitieux pour Gemini 4. Le préentraînement est la phase où le modèle acquiert ses capacités générales à partir de grandes quantités de données. Cette déclaration confirme un chantier ; elle n’annonce ni une disponibilité publique ni une date de sortie précise. [1]
Dans les sources officielles consultées pour cet article, nous n’avons pas trouvé d’annonce de lancement public de Gemini 4. Il faut garder cette formulation datée : l’absence d’annonce dans la documentation examinée ne permet pas de décrire l’état des modèles internes. Elle permet en revanche de distinguer ce que les utilisateurs peuvent évaluer de ce qui reste en développement.
Dire que Gemini 4 « tarde » peut traduire une attente réelle du public. Affirmer qu’il a manqué une échéance exige une promesse de calendrier vérifiable. Sans elle, le mot retard doit désigner une situation concurrentielle observable, par exemple un écart de performance sur un test commun, plutôt qu’un délai supposé dans un programme de recherche.
Une nouvelle génération peut aussi demander plusieurs étapes avant d’être utilisable : entraînement, évaluations, intégration des outils et organisation de la disponibilité. Nous ne disposons pas d’éléments permettant d’attribuer l’attente de Gemini 4 à une cause précise. Les hypothèses sur un manque de données, un problème d’infrastructure ou un obstacle de sécurité ne sont donc pas présentées ici comme des explications établies.
Cette distinction ne retire rien à l’enjeu. Pour un utilisateur qui choisit un assistant aujourd’hui, les capacités disponibles comptent davantage que les promesses de demain. Google doit être évalué sur ses modèles accessibles, tout comme ses concurrents.
2. Google continue pourtant de sortir des modèles
Le catalogue des fiches techniques de DeepMind mentionne Gemini 3.6 Flash au 21 juillet, Gemini 3.7 Flash au 13 août et Gemini 3.8 Flash au 2 septembre. La fiche de la famille Gemini 3.8 Audio est publiée le 15 septembre et figure comme mise à jour le 24 septembre. Ces dates concernent les fiches et leurs mises à jour ; elles ne doivent pas toutes être interprétées comme des dates de déploiement universel. [2], [3]
Cette chronologie contredit l’idée d’une absence de sorties. Elle montre aussi une stratégie centrée sur des itérations de Flash et sur des fonctions spécialisées. Ce constat est différent de la sortie d’un nouveau modèle phare généraliste. Les deux peuvent avancer à des rythmes distincts.
DeepMind présente Gemini 3.8 Flash comme un modèle de travail pour la programmation, les agents et les usages professionnels. Sa fiche produit indique des entrées texte, image, vidéo, audio et PDF, une sortie textuelle, un contexte de 1 million de tokens et une disponibilité générale dans plusieurs services Google. [4]
La famille audio répond à un autre besoin : dialogue en temps réel et génération de parole. Un modèle vocal peut améliorer l’expérience quotidienne sans changer le rang d’un modèle textuel dans un indice de raisonnement. De la même manière, un modèle spécialisé en cybersécurité ne doit pas être assimilé à une nouvelle version de l’assistant généraliste.
L’impression de ralentissement peut donc venir de la visibilité des annonces. Une version majeure crée un repère simple. Une succession de modèles Flash, Live, TTS ou Cyber demande davantage d’effort pour comprendre ce qui a changé et pour qui. C’est une question de lisibilité de gamme autant qu’une question de rythme technique.
Pour Google, rendre cette progression compréhensible est un enjeu concret. Le lecteur ne devrait pas avoir à parcourir plusieurs catalogues pour savoir quel modèle est actif dans l’outil qu’il utilise, quelles capacités sont nouvelles et lesquelles restent annoncées.
| Famille | Date publiée | Précaution |
|---|---|---|
| Gemini 3.6 Flash | 21 juillet 2026 | Date de fiche, pas accès universel |
| Gemini 3.7 Flash | 13 août 2026 | Date de fiche, pas accès universel |
| Gemini 3.8 Flash | 2 septembre 2026 | Date de fiche, pas accès universel |
| Gemini 3.8 Audio | 15 septembre ; mise à jour 24 septembre | Famille spécialisée dans l’audio |

3. Les chiffres qui justifient une critique sur le raisonnement général
Le classement Artificial Analysis consulté le 30 septembre place Gemini 3.8 Flash à high à 41 points. GPT‑6.1 Sol à max obtient 52, Astra à max 53, et Opus 5.5 à max avec modèle de secours 58. Gemini est donc derrière ces configurations dans cet indice général. [5]
Ce constat est sérieux, mais sa formulation doit rester précise. Il compare Flash à des modèles et des réglages différents, dont certains visent explicitement les travaux les plus difficiles. Il ne prouve pas que chaque produit Google est moins performant dans chaque usage. Il ne renseigne pas non plus sur un Gemini 4 encore non évalué publiquement dans les sources retenues.
L’écart peut cependant peser sur les utilisateurs qui cherchent la meilleure capacité généraliste accessible. Une équipe confrontée à des demandes complexes peut préférer tester les modèles les mieux placés. Google a donc un intérêt à montrer une progression mesurable dans cette catégorie, au-delà de la rapidité ou de l’intégration à ses services.
L’indice utilisé rassemble dix évaluations et reste principalement textuel et anglophone. Il convient de ne pas le transformer en jugement sur la totalité de l’écosystème Google. La voix, la génération d’images, la vidéo ou certains usages scientifiques sont d’autres dimensions, avec leurs propres protocoles. [6]
On peut aussi distinguer le classement d’un modèle de la valeur d’un assistant. Une bonne intégration à un document ou à un moteur de recherche peut rendre un système utile malgré un score général inférieur. Mais cette intégration ne démontre pas une capacité de raisonnement supérieure. Les deux qualités peuvent être importantes et doivent être décrites séparément.
L’animation de cet article présente cet écart sans ajouter un score inventé à Gemini 4. La génération attendue reste hors du graphique. C’est la seule manière de comparer les performances publiques sans confondre une attente avec un résultat.
Google et les leaders : l’écart dans l’indice général
Artificial Analysis · indice v4.3.2 · relevé le 30 septembre 2026. Le score est un indice, pas un pourcentage. Le coût est la moyenne pondérée en dollars par tâche de cette suite.
Échelle fixe : de 0 à 60 points. Plus haut = score supérieur.
Chaque barre part de zéro. Les réglages et éventuels modèles de secours font partie du résultat. Données et configurations. Le tableau ci-dessous conserve les valeurs sans animation.
| Modèle / effort | Indice | Coût pondéré / tâche ($) |
|---|---|---|
| Gemini 3.8 Flash · high | 41 | 1,24 |
| GPT‑6.1 Sol · max | 52 | 0,72 |
| GPT‑6 Astra · max | 53 | 3,26 |
| Claude Opus 5.5 · max avec secours | 58 | 5,98 |
4. Les domaines où Flash reste un concurrent crédible
Le classement public de DeepSWE v1.1 donne Gemini 3.8 Flash à high à 74 % avec une incertitude affichée de ±1 %. Astra à xhigh y figure également à 74 %, avec ±3 %. La page indique un coût moyen de 2,36 dollars pour Flash, contre 4,43 dollars pour Astra, dans les configurations de ce tableau mis à jour le 22 septembre. [7]
Ces valeurs arrondies ne démontrent pas une égalité parfaite. Elles montrent cependant que Flash peut rester compétitif sur des tâches longues de développement logiciel. Elles suffisent à nuancer un verdict selon lequel Google serait dépassé sur tous les fronts.
Il faut également tenir compte de la date du classement. Cette photographie précède l’annonce de GPT‑6.1 Sol. Elle n’est pas un palmarès complet de toutes les versions disponibles le 30 septembre. Un tableau daté est utile tant qu’on conserve sa portée ; il devient trompeur si on le présente comme une hiérarchie définitive.
Google publie d’autres mesures pour Gemini 3.8 Flash : 61,4 % sur Vals Finance Agent v2 et 54,9 % sur HLE‑Verified. Ces résultats sont présentés par DeepMind. HLE‑Verified n’est pas interchangeable avec n’importe quel score de Humanity’s Last Exam : la version, les questions retenues et les outils autorisés doivent correspondre avant une comparaison directe. [4]
La leçon est simple : un modèle peut être moins bien placé dans un indice général et très efficace sur une famille de tâches. Il n’y a pas de contradiction. L’indice est une synthèse ; le test spécialisé examine une capacité avec un protocole particulier.
Pour l’utilisateur, il est donc raisonnable d’essayer Flash sur des besoins précis, notamment lorsqu’une réponse rapide ou l’analyse de plusieurs types de fichiers compte. La validation doit porter sur le résultat final. Un fichier correctement lu ne suffit pas si la synthèse oublie la donnée décisive ; un programme généré ne suffit pas s’il n’est pas exécutable.
| Configuration | Score arrondi | Incertitude affichée | Coût moyen / tâche |
|---|---|---|---|
| Gemini 3.8 Flash · high | 74 % | ±1 % | 2,36 $ |
| GPT‑6 Astra · xhigh | 74 % | ±3 % | 4,43 $ |
Source : Datacurve. Les valeurs et intervalles sont reproduits tels qu’affichés ; ce tableau précède GPT‑6.1 Sol et ne démontre pas une égalité statistique entre modèles.

5. Une stratégie large peut réussir sans dominer chaque classement
Google répartit ses efforts entre modèles généralistes, multimodalité, voix, outils de développement et systèmes spécialisés. Son catalogue comporte aussi Gemini Robotics, Veo, Gemma et des modèles scientifiques. Cette diversité est documentée ; elle ne démontre pas à elle seule que chaque branche avance plus vite que la concurrence. [8]
Notre analyse est que cette largeur peut brouiller la perception des progrès. Un utilisateur qui suit les assistants textuels attend un modèle phare ; une équipe qui construit une interface vocale peut surtout attendre une meilleure latence audio. Une amélioration importante pour la seconde sera peu visible pour le premier.
La distribution constitue un autre axe. Google présente Flash dans l’application Gemini, AI Studio, l’API, Antigravity et sa plateforme d’agents d’entreprise. Cette présence peut faciliter l’adoption dans des outils existants. Elle ne dispense pas de vérifier la version utilisée, les conditions d’accès et le fonctionnement réel des fonctions proposées. [4]
Pour la France et La Réunion, cette distinction a un intérêt pratique. Un assistant peut être bien intégré aux outils quotidiens sans produire la meilleure analyse d’un document complexe. À l’inverse, un modèle performant mais difficile à utiliser dans son travail peut faire perdre du temps. Le bon choix dépend de la tâche, de la langue et de la facilité de contrôle du résultat.
Il serait donc excessif d’expliquer la situation de Google par une simple incapacité à innover. Il serait tout aussi excessif d’utiliser la taille de son écosystème pour éluder les écarts sur les modèles généralistes. Les capacités mesurées et l’intégration des produits sont deux sujets légitimes ; aucun ne doit masquer l’autre.
L’enjeu pour Gemini 4 sera de rendre la progression visible sur les deux plans : des résultats comparables sur des tests publics et une amélioration identifiable pour les utilisateurs. Sans cela, une annonce spectaculaire pourrait attirer l’attention sans répondre aux besoins qui ont conduit certains à choisir un concurrent.
6. Ce qu’il faudra vérifier lorsque Gemini 4 sera annoncé
Le premier élément sera la disponibilité : quels utilisateurs, quelles applications, quelles régions et quelles limites ? Un modèle accessible dans une préversion d’API n’est pas automatiquement celui que tout le monde utilise dans l’application. Cette information doit précéder les promesses de performance.
Le deuxième sera la méthode de comparaison. Il faudra conserver les versions de benchmarks, les niveaux de raisonnement, les outils et les éventuels modèles de secours. Une amélioration par rapport à l’ancienne génération est intéressante ; une comparaison à la concurrence devient plus solide lorsque les conditions sont communes.
Le troisième sera le coût du travail terminé. Le prix par token et la vitesse de génération sont utiles, mais l’utilisateur attend un document juste, un calcul contrôlé ou un programme fonctionnel. Les reprises, les délais externes et le temps de vérification font partie de l’expérience.
Au 30 septembre, la conclusion défendable est donc nuancée : Google reste actif et Flash conserve des résultats compétitifs sur certains tests, mais les configurations leaders d’OpenAI et d’Anthropic le devancent dans l’indice général examiné. L’attente de Gemini 4 accentue cet écart de perception. Sa sortie devra être jugée sur des preuves publiques et des usages réels, plutôt que sur le seul changement de numéro.
Crédit de l’image de couverture : Googleplex, photographié en 2016 : une image historique du siège. The Pancake of Heaven! / Wikimedia Commons, CC BY-SA 4.0. Source originale · Licence.
Pour poursuivre ce dossier : GPT‑6.1 Sol : benchmarks et variantes · OpenAI, Anthropic et MiMo : le comparatif.
Sources et méthode
Recherche arrêtée au 30 septembre 2026. Les annonces et évaluations des fabricants sont attribuées à leurs auteurs. Les chiffres d’Artificial Analysis et de Datacurve sont des mesures externes ; IAforAll n’a pas reproduit ces benchmarks. Les positions et tarifs peuvent évoluer.
- Résultats du deuxième trimestre et Gemini 4 — Google, 22 juillet 2026
- Catalogue des model cards — Google DeepMind
- Fiche Gemini 3.8 Audio — DeepMind
- Présentation de Gemini Flash — DeepMind
- Classement des modèles — Artificial Analysis
- Méthodologie — Artificial Analysis
- Classement DeepSWE v1.1 — Datacurve, mise à jour du 22 septembre
- Catalogue des modèles — Google DeepMind
Cet article vous a plu ?
Temps de lecture : environ 13 min