Stratégie

Gemini 3.7 Flash : les chiffres derrière l'annonce

Benchmarks, fiche technique, débit mesuré et prix réellement payé : ce que les chiffres publiés par Google et par OpenRouter disent de Gemini 3.7 Flash.

Portrait de Abderrahim ELBAHI

Abderrahim ELBAHI

Fondateur et Directeur Général

Profil LinkedIn

Publié le , mis à jour le · 9 min de lecture

Visuel d'annonce de Google pour Gemini 3.7 Flash, dégradé bleu et violet portant le nom du modèle

Google a présenté Gemini 3.7 Flash le 13 août 2026. Le modèle gagne de neuf à seize points sur les cinq tests que Google publie, coûte 0,75 $ par million de jetons d’entrée jusqu’au 31 décembre, et écrit entre 82 et 127 jetons par seconde selon le fournisseur. Le prix réellement payé, lui, est cinq fois plus bas que le prix affiché.

Ce que Google a annoncé

L’annonce officielle compare le nouveau modèle à Gemini 3.6 Flash sur cinq évaluations. Toutes progressent.

ÉvaluationCe qu’elle mesure3.7 Flash3.6 Flash
FrontierCode 1.1 MainQualité de code de production43,6 %34,4 %
DeepSWE v1.1Ingénierie logicielle de longue haleine65,3 %49,0 %
WebDev ArenaDéveloppement web, score Elo15881538
GDP.pdfCompréhension de documents PDF experts34,0 %22,0 %
AutomationBenchAutomatisation de flux en entreprise30,4 %17,0 %
43,634,4FrontierCode65,349,0DeepSWE34,022,0GDP.pdf30,417,0AutomationBenchGemini 3.7 FlashGemini 3.6 Flash

Le plus gros écart est sur AutomationBench, qui passe de 17,0 % à 30,4 %. C’est aussi le test le plus proche de ce qu’une entreprise cherche à faire d’un modèle : enchaîner des étapes dans un processus interne sans surveillance humaine à chaque tour.

Le plus bas en valeur absolue est le même. À 30,4 %, deux tentatives sur trois échouent encore.

À quoi ressemble un test de code, en pratique

Google publie une démonstration filmée avec son annonce. Elle donne une idée plus juste de ce que « qualité de code de production » recouvre qu’un pourcentage.

Démonstration publiée par Google. Une instruction demande un niveau de jeu rétro à la première personne en three.js, avec un magicien dans un château. Le modèle travaille, puis rend un niveau jouable dont les décors ont été générés séparément. Vidéo : Google, redimensionnée pour le web.

C’est une démonstration du fournisseur, pas notre essai. Elle a été préparée, elle montre ce qui a fonctionné, et un jeu de démonstration n’a ni base de données, ni authentification, ni charge réelle. Ce qu’elle établit tout de même : le modèle enchaîne seul la génération du code, celle des images et leur assemblage. C’est cette capacité d’enchaînement que mesure DeepSWE, et c’est là que le gain est le plus net.

La fiche technique

La documentation de l’API donne l’identifiant gemini-3.7-flash et les limites suivantes.

CaractéristiqueValeur
Jetons en entrée1 048 576
Jetons en sortie65 536
Entrées acceptéesTexte, image, vidéo, audio, PDF
Sorties produitesTexte uniquement
Niveaux de réflexionFaible, moyen, élevé

Sont pris en charge : l’appel de fonctions, les sorties structurées, la mise en cache, l’API par lots, l’exécution de code, la recherche de fichiers, l’ancrage sur la recherche Google et sur Google Maps, le contexte par URL.

Ne le sont pas : la génération d’images, la génération audio, l’API temps réel.

Un détail passe inaperçu et il coûte de l’argent. Le niveau de réflexion « minimal » n’existe plus sur ce modèle, alors qu’il existait sur Gemini 3.5 Flash et sur Gemini 3.1 Flash Lite. Le plancher est désormais « faible ». Sur une tâche simple répétée des milliers de fois, cette marche supplémentaire se paie en jetons de raisonnement.

Ce que le modèle coûte vraiment

C’est le chiffre le plus intéressant de l’annonce, et ce n’est pas Google qui le publie.

Le tarif d’introduction est de 0,75 $ par million de jetons d’entrée et 3,75 $ en sortie, jusqu’au 31 décembre 2026. Au 1er janvier 2027, il double : 1,50 $ et 7,50 $ par million de jetons.

Or OpenRouter publie le prix moyen que ses clients paient réellement, tous fournisseurs confondus : 0,1547 $ par million de jetons d’entrée. Soit moins d’un cinquième du tarif affiché.

0,75 $Tarif affiché0,375 $Tarif remisé0,1547 $Réellement payé

Deux mécanismes expliquent l’écart, et les deux se pilotent.

La remise. OpenRouter affiche 50 % de réduction sur le tarif Google, soit 0,375 $ et 1,875 $ par million de jetons. Elle est temporaire et ne dépend pas de vous.

Le cache. C’est l’autre moitié, et celle-là dépend entièrement de la façon dont vos requêtes sont écrites. Le taux de succès du cache relevé sur les deux fournisseurs est de 76,97 % chez Google Vertex et 68,56 % chez Google AI Studio. Un jeton lu en cache coûte le dixième d’un jeton d’entrée ordinaire : 0,075 $ contre 0,75 $ par million de jetons.

Ce que ça veut dire concrètement. Une facture d’API se pilote autant par la structure des requêtes que par le choix du modèle. Un préfixe de requête stable, placé en tête et identique d’un appel à l’autre, tombe dans le cache. Le même contenu réassemblé dans un ordre différent à chaque appel n’y tombe jamais, et se paie dix fois plus cher.

Les mesures indépendantes

Google ne publie ni débit ni latence. OpenRouter les mesure en continu sur les deux fournisseurs qui servent le modèle. Voici les moyennes relevées sur trois jours.

MesureGoogle AI StudioGoogle Vertex
Débit d’écriture127 jetons/s82 jetons/s
Latence1,72 s2,01 s
Latence de bout en bout4,08 s5,46 s
Erreurs d’appel d’outil1,94 %2,51 %
Erreurs de sortie structurée3,22 %6,39 %
Succès du cache68,56 %76,97 %

Le classement s’inverse selon ce qu’on regarde, et c’est le genre de détail qui ne se voit pas dans une annonce. AI Studio écrit une fois et demie plus vite, répond plus tôt, et se trompe deux fois moins sur les sorties structurées. Vertex, lui, met mieux en cache — donc coûte moins cher.

Le marché a tranché dans le sens du portefeuille : 87 % des jetons passent par Vertex, contre 13 % par AI Studio.

La disponibilité relevée sur trente jours est de 98,97 % en moyenne par fournisseur.

Ce que l’annonce ne dit pas

Trois points méritent d’être connus avant d’engager un projet.

Le taux de non-hallucination est de 35,5 %. La mesure vient d’Artificial Analysis, relayée par OpenRouter : parmi les réponses qui ne sont pas correctes, un peu plus d’un tiers sont des refus ou des aveux d’ignorance plutôt que des affirmations fausses. Les deux tiers restants sont des erreurs énoncées avec assurance. Aucun modèle ne fait aujourd’hui exception à ce problème, et cela reste la raison pour laquelle une relecture humaine n’est pas facultative sur un contenu publié.

La disponibilité grand public exclut plusieurs pays. Gemini Spark est accessible aux abonnés Google AI Pro et Ultra dans plus de 160 pays, mais pas dans l’Espace économique européen, ni au Royaume-Uni, en Suisse et au Nigeria. L’API, elle, n’est pas concernée par cette restriction.

Les tests ne sont pas des missions. 43,6 % sur un test de code de production veut dire que le modèle échoue plus souvent qu’il ne réussit. C’est un progrès net sur les 34,4 % de la version précédente ; ce n’est pas un collaborateur autonome.

Ce que nous en retenons

Le saut d’AutomationBench, de 17 à 30 points, est celui qui compte pour une entreprise : il porte sur l’enchaînement d’étapes sans supervision. Il reste trop bas pour confier un processus entier à un modèle, et assez haut pour lui confier des segments bornés dont un humain contrôle la sortie.

La leçon de coût est plus immédiatement exploitable que la leçon de performance. Un écart de un à cinq entre le prix affiché et le prix payé ne vient pas d’une négociation : il vient de la structure des requêtes. C’est un travail d’architecture, pas d’achat.

Et la date du 1er janvier 2027 est à inscrire dès maintenant dans tout budget qui s’appuie sur ce modèle. Le tarif double ce jour-là.

Partager

Sur le même sujet

Conseil et stratégie

À lire ensuite

Démarrer

Exposez votre besoin