Gemini 3.8 Flash 2026 : Fairwind, Cyber et les évals
Troisième Flash en six semaines : un SKU public et un Cyber derrière Fairwind. Séparer les SKU avant CyberGym et CWE-Bench.
Google a livré deux SKU Gemini 3.8 le 2 septembre 2026 : un Flash public, et Flash Cyber derrière Fairwind. Troisième Flash en six semaines, pas une nouvelle famille phare.
La requête est Gemini 3.8 Flash et Gemini 3.8 Flash Cyber. Suit le billet blog.google et le relais AA de Digital Applied. Les bancs vendor ne sont pas des reproductions indépendantes. Note précédente : 3.7 Flash.
Ce que le billet de lancement imprime
Auteurs : Tulsee Doshi (produit) et Raluca Ada Popa (sécurité DeepMind). Les deux SKU partagent une même intelligence de base et des boucles agentiques longues. Flash vise le code long horizon et les agents ; bancs cités : DeepSWE v1.1, Vals Finance Agent V2, Harvey Legal Agent, 54,9 % HLE-Verified. Sur les tâches dures, plus d’étapes de raisonnement et d’appels d’outils ; un effort élevé peut coûter plus de tokens.
Lire les deux lignes
- 1
Nommer le SKU public avant le SKU gated
Les développeurs ont 3.8 Flash sur l’API Gemini, AI Studio, Android Studio, Antigravity et Stitch ; les entreprises via Gemini Enterprise ; les consommateurs dans l’app et Sheets. Cyber exige une demande Fairwind — pas la même clé API. Contrôle : Guidelight.
- 2
Un score de patch proche de la frontière n’est pas un échange
CWE-Bench : Cyber à 47,2 % pass@1 contre 47,8 % d’un modèle frontière non nommé ; Google insiste sur un point de Pareto moins cher. Banc pentest interne Wiz : +7,5–9,7 % de rappel à 2,3–5,2× moins cher. Les 2,6× de correctifs Chrome et la « faille fondationnelle critique en moins de deux heures » de Cloud Vulnerability Research sont des cas Google, pas un pack de repro public.
- 3
Le même prix par token n’est pas la même facture par tâche
Digital Applied liste un indice AA 59 et environ 0,58 $ par tâche contre environ 0,40 $ pour 3.7 — même tarif, tâche plus chère parce qu’il travaille plus. Le graphique OfficeChai place 3.8 Flash (high) à 59, sous le xhigh 61 de Muse Spark 1.3 ; voir Muse Spark 1.3.
CyberGym et le banc interne 20 langues
Google dit que Cyber bat 3.5 Flash Cyber et des modèles frontière bien plus gros sur CyberGym. Un banc interne sur 20 langages dépasserait 70 % de succès. Les items ne sont pas publics.
Corriger avant d’exploiter
Le billet place l’investissement sur le correctif d’abord, pas l’exploit. CWE-Bench est exécuté à l’extérieur par Collinear. Récit défenseur, pas une API d’attaque publique.
3.7 n’est pas retiré
Google écrit que 3.7 Flash reste pleinement pris en charge pour les charges efficacité d’abord. Baisser l’effort ou rester sur 3.7 si les tokens sont la contrainte.
| Formulation | Source vérifiable | Lecture |
|---|---|---|
| HLE-Verified 54,9 % | blog.google 2026-09-02 | Run vendor ; pas de harness indépendant |
| CWE-Bench 47,2 % vs 47,8 % | Collinear ; contrepartie non nommée | Proche, moins cher — pas une couronne |
| AA high 59 ; ~0,58 $ / tâche | Registre septembre Digital Applied | Indice tiers, pas la table Google |
Google : les deux sorties s’appuient sur la même intelligence de base, accélérée par des boucles agentiques longues qui évaluent et affinent récursivement les modèles sous-jacents.
# Gemini 3.8 · Google blog 2026-09-02
# authors: Tulsee Doshi, Raluca Ada Popa
sku: gemini-3.8-flash # general
sku: gemini-3.8-flash-cyber # Fairwind only
price_intro: $0.75 / $3.75 per 1M (to 2026-12-31)
price_2027: $1.50 / $7.50
hle_verified: 54.9% # vendor-run
cwe_bench_pass1: 47.2% # Collinear
aa_index_high: 59 # Digital Applied / AA
3.7_flash: remains fully supportedLimites
- Tables vendor ≠ indice tiers
- DeepSWE, HLE et les bancs agents finance/droit sont nommés par le labo. AA 59 est un relais de registre. Ne pas les fondre en une couronne.
- Le SKU Cyber ≠ une clé pour tous
- Fairwind vise des défenseurs de confiance. Les mitigations cyber plus souples sont la condition d’accès, pas un checkpoint ouvert.
- Cette page n’est pas une fiche réunion
- Sortie et éval seulement. Pour un huddle court : wbmeet et créer une salle.
Questions à recouper
3.8 Flash et Flash Cyber ont-ils les mêmes poids ?
Google écrit « la même intelligence de base » dans des environnements de déploiement différents. Les docs publics ne donnent ni hash de poids ni checkpoint téléchargeable. Traiter deux SKU, deux politiques d’accès.
54,9 % ou 59 est-il le score « officiel » ?
Ni l’un ni l’autre n’est un constat de régulateur. 54,9 % est le HLE-Verified Google. 59 est le relais AA high de Digital Applied. Nommer la suite sur toute note de labo.
Jusqu’à quand le prix d’intro ?
Note de bas de page : jusqu’au 31 décembre 2026. Au 1er janvier 2027, 1,50 / 7,50 $ par million de tokens.
Preuve que Google a dépassé les autres labs ?
Non. CWE-Bench reste un peu sous une contrepartie non nommée. Sur les graphiques AA, 3.8 Flash high est sous plusieurs modèles de la bande d’égalité. Cette page ne déplie que la sortie.