Abderrahim ELBAHI
Google a publié le 2 septembre 2026 deux modèles : Gemini 3.8 Flash et Gemini 3.8 Flash Cyber. Le premier est ouvert à tous, le second réservé à des défenseurs vérifiés. L’annonce n’est pas une percée de capacité — c’est un déplacement de la frontière entre ce qu’un modèle sait faire et ce qu’il coûte.
Trois modèles Flash en six semaines
L’annonce de Google le dit elle-même : 3.7 Flash datait de trois semaines, et 3.8 est la troisième publication Flash en six semaines.
Ce rythme est une information en soi. Il signifie qu’une décision d’outillage prise sur les chiffres d’un modèle Flash a une durée de vie de quelques semaines, et qu’un comparatif publié aujourd’hui est un instantané, pas un classement.
Ce que disent les seize tests
Google publie un tableau complet, seize tests contre cinq modèles concurrents. C’est rare et il faut le saluer : la plupart des annonces sélectionnent les tests où elles gagnent.
Gemini 3.8 Flash arrive en tête sur huit des seize lignes — Vals Finance Agent v2 à 61,4 %, Harvey’s Legal Agent à 10,0 %, Terminal-bench 2.1 à 89,4 %, CharXiv Reasoning à 86,2 %, LVBench, HLE-Verified à 54,9 %, BioMysteryBench en difficulté humaine à 56,5 %, et LABBench2 à 86,2 %. Tous ces chiffres sont ceux du tableau de Google.
Il perd nettement sur d’autres, et c’est la partie que peu de reprises citeront — toujours d’après le même tableau de Google. Sur Terminal-bench 4.0, qui mesure des capacités d’agent générales, il obtient 19,1 % quand Claude Opus 5 fait 51,8 % — un écart de plus du double. Sur GDPVal-AA v2, un score Elo de travail intellectuel, 1545 contre 1824. Sur OSWorld-2.0, 59,0 % contre 75,4 %.
Le tableau ne désigne donc pas un vainqueur. Il dit : à ce prix, personne ne fait mieux.
Le prix, et la date à retenir
Le tarif d’introduction est de 0,75 dollar par million de jetons en entrée et 3,75 dollars par million de jetons en sortie, identique à celui de 3.7 Flash. Il expire le 31 décembre 2026 : au 1er janvier 2027, les tarifs passent à 1,50 dollar par million de jetons en entrée et 7,50 en sortie, selon l’annonce.
C’est un doublement, et il est daté. Une intégration dimensionnée sur le tarif d’introduction verra sa facture doubler à une date connue d’avance — ce qui est une bonne nouvelle si on la lit à temps, et une mauvaise si on la découvre sur une facture de janvier.
L’ampleur de l’écart avec la concurrence explique le positionnement. Sur les prix d’entrée du même tableau, en dollars par million de jetons : 0,75 pour 3.8 Flash, 2,00 pour Claude Sonnet 5 et GPT-5.6 Terra, 4,00 pour GPT-5.6 Sol, 5,00 pour Claude Opus 5 — le modèle qui le devance sur Terminal-bench 4.0. Soit un facteur de plus de six entre les deux.
La variante Cyber, et ce qu’elle change
3.8 Flash Cyber est le même modèle avec des garde-fous plus permissifs, orientés vers la défense. Il n’est pas ouvert : il passe par le programme Fairwind, réservé à des défenseurs vérifiés.
Trois chiffres méritent d’être lus ensemble, tous issus de l’annonce :
- sur CWE-Bench, un taux de réussite au premier essai de 47,2 % contre 47,8 % pour le modèle de tête — donc légèrement derrière, mais à un coût très inférieur ;
- sur un test interne couvrant 20 langages de programmation, un taux de réussite supérieur à 70 % pour la découverte de vulnérabilités ;
- sur CyberGym, un niveau que Google qualifie de frontière pour la découverte autonome de vulnérabilités.
Le premier de ces trois chiffres est le plus honnête de l’annonce. Google publie un score inférieur à celui du concurrent et argumente sur le rapport coût-efficacité plutôt que sur la performance brute. C’est exactement la lecture que le tableau général impose.
Trois validations extérieures
Elles ne viennent pas de Google, et c’est ce qui leur donne leur poids — bien qu’elles soient rapportées par lui, ce qui reste une médiation. Toutes trois figurent dans l’annonce :
| Qui | Constat rapporté |
|---|---|
| Équipe sécurité de Chrome | 2,6 fois plus de correctifs justes que les modèles commerciaux les plus performants qu’elle avait testés |
| Wiz | +7,5 à 9,7 % de rappel sur leur test interne de tests d’intrusion, pour un coût 2,3 à 5,2 fois inférieur |
| Cloud Vulnerability Research, Google | une vulnérabilité critique trouvée en moins de deux heures |
La troisième est une anecdote et doit se lire comme telle : une découverte réussie ne dit rien du taux d’échec.
Où le modèle est disponible
Pour les développeurs, dans Google Antigravity, l’API Gemini, Google AI Studio, Android Studio et Stitch. Pour les entreprises, dans Gemini Enterprise. Et pour le grand public, dans l’application Gemini, le mode IA de la recherche Google et Google Sheets.
La variante Cyber n’est dans aucune de ces listes. Elle passe par le programme Fairwind, et n’entre donc dans aucune décision d’outillage ordinaire.
Ce que l’annonce ne dit pas
Quatre réserves, qui n’enlèvent rien aux chiffres.
Les mesures sont celles de l’éditeur. Google publie sa méthodologie, ce qui est plus que la moyenne du secteur, mais aucun tiers indépendant n’a rejoué ces tests — ni nous.
Plusieurs affirmations sont qualitatives. « Surpasse des modèles de frontière plus grands » sur DeepSWE, ou « niveau frontière » sur CyberGym, ne sont pas des chiffres. Le tableau, lui, en donne : c’est là qu’il faut lire.
Ni fenêtre de contexte, ni tarif de cache, ni tarif de traitement par lots ne figurent dans l’annonce. Or le cache est précisément le poste sur lequel Anthropic a construit sa baisse de prix la veille — l’absence de cette information empêche toute comparaison de coût réel entre les deux.
Un score bas sur un test d’agent général coexiste avec des scores hauts ailleurs. Les 19,1 % de Terminal-bench 4.0 du tableau de Google ne disqualifient pas le modèle : ils indiquent qu’il n’est pas taillé pour des chaînes d’actions longues et autonomes. Choisir sur la moyenne d’un tableau est la façon la plus sûre de se tromper de modèle.
Ce que ça change pour un projet francophone
Le calcul utile n’est pas « quel modèle arrive en tête » mais « à quel prix mon volume devient-il supportable ». Un facteur six sur le tarif d’entrée déplace ce seuil bien plus que trois points sur un test.
Deux choses à faire, dans cet ordre. Noter la date du 31 décembre 2026 dans le suivi budgétaire de toute intégration qui utilise ce modèle. Puis choisir le test qui ressemble à votre usage plutôt que le score global : une chaîne d’agents autonomes et une extraction de documents ne se jugent pas sur la même ligne du tableau.