Abderrahim ELBAHI
Google a présenté Gemini 3.7 Flash le 13 août 2026. Le modèle gagne de neuf à seize points sur les cinq tests que Google publie, coûte 0,75 $ par million de jetons d’entrée jusqu’au 31 décembre, et écrit entre 82 et 127 jetons par seconde selon le fournisseur. Le prix réellement payé, lui, est cinq fois plus bas que le prix affiché.
Ce que Google a annoncé
L’annonce officielle compare le nouveau modèle à Gemini 3.6 Flash sur cinq évaluations. Toutes progressent.
| Évaluation | Ce qu’elle mesure | 3.7 Flash | 3.6 Flash |
|---|---|---|---|
| FrontierCode 1.1 Main | Qualité de code de production | 43,6 % | 34,4 % |
| DeepSWE v1.1 | Ingénierie logicielle de longue haleine | 65,3 % | 49,0 % |
| WebDev Arena | Développement web, score Elo | 1588 | 1538 |
| GDP.pdf | Compréhension de documents PDF experts | 34,0 % | 22,0 % |
| AutomationBench | Automatisation de flux en entreprise | 30,4 % | 17,0 % |
Le plus gros écart est sur AutomationBench, qui passe de 17,0 % à 30,4 %. C’est aussi le test le plus proche de ce qu’une entreprise cherche à faire d’un modèle : enchaîner des étapes dans un processus interne sans surveillance humaine à chaque tour.
Le plus bas en valeur absolue est le même. À 30,4 %, deux tentatives sur trois échouent encore.
À quoi ressemble un test de code, en pratique
Google publie une démonstration filmée avec son annonce. Elle donne une idée plus juste de ce que « qualité de code de production » recouvre qu’un pourcentage.
C’est une démonstration du fournisseur, pas notre essai. Elle a été préparée, elle montre ce qui a fonctionné, et un jeu de démonstration n’a ni base de données, ni authentification, ni charge réelle. Ce qu’elle établit tout de même : le modèle enchaîne seul la génération du code, celle des images et leur assemblage. C’est cette capacité d’enchaînement que mesure DeepSWE, et c’est là que le gain est le plus net.
La fiche technique
La documentation de l’API donne l’identifiant gemini-3.7-flash et les limites suivantes.
| Caractéristique | Valeur |
|---|---|
| Jetons en entrée | 1 048 576 |
| Jetons en sortie | 65 536 |
| Entrées acceptées | Texte, image, vidéo, audio, PDF |
| Sorties produites | Texte uniquement |
| Niveaux de réflexion | Faible, moyen, élevé |
Sont pris en charge : l’appel de fonctions, les sorties structurées, la mise en cache, l’API par lots, l’exécution de code, la recherche de fichiers, l’ancrage sur la recherche Google et sur Google Maps, le contexte par URL.
Ne le sont pas : la génération d’images, la génération audio, l’API temps réel.
Un détail passe inaperçu et il coûte de l’argent. Le niveau de réflexion « minimal » n’existe plus sur ce modèle, alors qu’il existait sur Gemini 3.5 Flash et sur Gemini 3.1 Flash Lite. Le plancher est désormais « faible ». Sur une tâche simple répétée des milliers de fois, cette marche supplémentaire se paie en jetons de raisonnement.
Ce que le modèle coûte vraiment
C’est le chiffre le plus intéressant de l’annonce, et ce n’est pas Google qui le publie.
Le tarif d’introduction est de 0,75 $ par million de jetons d’entrée et 3,75 $ en sortie, jusqu’au 31 décembre 2026. Au 1er janvier 2027, il double : 1,50 $ et 7,50 $ par million de jetons.
Or OpenRouter publie le prix moyen que ses clients paient réellement, tous fournisseurs confondus : 0,1547 $ par million de jetons d’entrée. Soit moins d’un cinquième du tarif affiché.
Deux mécanismes expliquent l’écart, et les deux se pilotent.
La remise. OpenRouter affiche 50 % de réduction sur le tarif Google, soit 0,375 $ et 1,875 $ par million de jetons. Elle est temporaire et ne dépend pas de vous.
Le cache. C’est l’autre moitié, et celle-là dépend entièrement de la façon dont vos requêtes sont écrites. Le taux de succès du cache relevé sur les deux fournisseurs est de 76,97 % chez Google Vertex et 68,56 % chez Google AI Studio. Un jeton lu en cache coûte le dixième d’un jeton d’entrée ordinaire : 0,075 $ contre 0,75 $ par million de jetons.
Ce que ça veut dire concrètement. Une facture d’API se pilote autant par la structure des requêtes que par le choix du modèle. Un préfixe de requête stable, placé en tête et identique d’un appel à l’autre, tombe dans le cache. Le même contenu réassemblé dans un ordre différent à chaque appel n’y tombe jamais, et se paie dix fois plus cher.
Les mesures indépendantes
Google ne publie ni débit ni latence. OpenRouter les mesure en continu sur les deux fournisseurs qui servent le modèle. Voici les moyennes relevées sur trois jours.
| Mesure | Google AI Studio | Google Vertex |
|---|---|---|
| Débit d’écriture | 127 jetons/s | 82 jetons/s |
| Latence | 1,72 s | 2,01 s |
| Latence de bout en bout | 4,08 s | 5,46 s |
| Erreurs d’appel d’outil | 1,94 % | 2,51 % |
| Erreurs de sortie structurée | 3,22 % | 6,39 % |
| Succès du cache | 68,56 % | 76,97 % |
Le classement s’inverse selon ce qu’on regarde, et c’est le genre de détail qui ne se voit pas dans une annonce. AI Studio écrit une fois et demie plus vite, répond plus tôt, et se trompe deux fois moins sur les sorties structurées. Vertex, lui, met mieux en cache — donc coûte moins cher.
Le marché a tranché dans le sens du portefeuille : 87 % des jetons passent par Vertex, contre 13 % par AI Studio.
La disponibilité relevée sur trente jours est de 98,97 % en moyenne par fournisseur.
Ce que l’annonce ne dit pas
Trois points méritent d’être connus avant d’engager un projet.
Le taux de non-hallucination est de 35,5 %. La mesure vient d’Artificial Analysis, relayée par OpenRouter : parmi les réponses qui ne sont pas correctes, un peu plus d’un tiers sont des refus ou des aveux d’ignorance plutôt que des affirmations fausses. Les deux tiers restants sont des erreurs énoncées avec assurance. Aucun modèle ne fait aujourd’hui exception à ce problème, et cela reste la raison pour laquelle une relecture humaine n’est pas facultative sur un contenu publié.
La disponibilité grand public exclut plusieurs pays. Gemini Spark est accessible aux abonnés Google AI Pro et Ultra dans plus de 160 pays, mais pas dans l’Espace économique européen, ni au Royaume-Uni, en Suisse et au Nigeria. L’API, elle, n’est pas concernée par cette restriction.
Les tests ne sont pas des missions. 43,6 % sur un test de code de production veut dire que le modèle échoue plus souvent qu’il ne réussit. C’est un progrès net sur les 34,4 % de la version précédente ; ce n’est pas un collaborateur autonome.
Ce que nous en retenons
Le saut d’AutomationBench, de 17 à 30 points, est celui qui compte pour une entreprise : il porte sur l’enchaînement d’étapes sans supervision. Il reste trop bas pour confier un processus entier à un modèle, et assez haut pour lui confier des segments bornés dont un humain contrôle la sortie.
La leçon de coût est plus immédiatement exploitable que la leçon de performance. Un écart de un à cinq entre le prix affiché et le prix payé ne vient pas d’une négociation : il vient de la structure des requêtes. C’est un travail d’architecture, pas d’achat.
Et la date du 1er janvier 2027 est à inscrire dès maintenant dans tout budget qui s’appuie sur ce modèle. Le tarif double ce jour-là.