Éval en double aveugle DeepMind 2026 : Gemini 2.5 Flash Lite

DeepMind a testé Gemini 2.5 Flash Lite en double aveugle dans une enclave de calcul confidentiel. Poids et prompts restent cachés ; les scores n’ont pas été publiés.

Les évals frontière indépendantes imposaient un choix : céder les poids ou céder les questions. Le 27 août, Google DeepMind a dit qu’une enclave cryptographique avait évité ce choix pour un modèle de production.

L’objet est l’évaluation en double aveugle de DeepMind — présentée comme la première sur un modèle propriétaire de classe frontière. Système testé : Gemini 2.5 Flash Lite (AVERI : Flash-Lite). Suit ce qui se vérifie sur deepmind.google et le rapport AVERI. Aucun score inédit n’est inventé.

Juil.–août : run dans l’enclavePrompts réservés dans un TEE27 août : les deux côtés publient

Ce que dit la note officielle

Auteurs : William Isaac, Sol Messing, Kristian Lum. Partenaires : AISI de Singapour, OpenMined, AVERI, MLCommons. Le motif est la contamination : si le modèle a déjà vu les items, le chiffre n’est que partiellement fiable. Les contrats zéro-log étaient l’ancien contrôle ; ce pilote ajoute cryptographie et calcul confidentiel.

1
Officiel : premier pilote double aveugle propriétaire
0
Public : aucun score de modèle
4
Partenaires nommés

Chiffres vérifiables

  1. 1

    Quel échange le double aveugle remplace

    DeepMind : les évals externes à fort enjeu exigeaient soit les prompts de l’évaluateur (le labo pouvait lire), soit les poids du labo (risque IP). Confidential Space vise à garder les deux actifs privés.

  2. 2

    Ce qu’AVERI décrit de bout en bout

    AVERI (AI Verification and Evaluation Research Institute) parle de la première éval en double aveugle d’un modèle de langue propriétaire en juillet–août 2026. MLCommons a fourni des items AILuminate inédits ; AVERI les a chiffrés ; les deux côtés ont exécuté le logiciel OpenMined dans une enclave configurée par Google ; AVERI a déchiffré et noté. 2024 : OpenMined–Anthropic–AISI UK avec GPT-2. 2026 : modèle de production.

  3. 3

    Quels dangers, où sont les scores

    Notes AVERI : CBRNE, cyberattaques, discours de haine, automutilation, crime violent. TechRepublic et d’autres : l’AISI de Singapour a aussi testé des contenus nuisibles en contexte local. Scores non publiés. Même règle que pour TASTE Anthropic et Guidelight : ne citer un chiffre que s’il est imprimé.

01

Isolation matérielle, pas une poignée de main

Les relais techniques nomment une VM A3 Confidential, Intel TDX et un GPU H100 Confidential. Poids en mémoire GPU chiffrée, prompts en mémoire hôte. L’attestation distante vérifie l’environnement.

02

Le labo écrit la confiance restante

Rapport technique selon TechRepublic : une partie du code d’inférence propriétaire n’était pas pleinement inspectable ; les builds Confidential Space n’étaient pas reproductibles indépendamment ; des services Google signent l’attestation. AVERI : beaucoup de chemins de falsification, pas tous, sont fermés.

03

L’échelle reste un GPU

Plusieurs textes : adapté aux modèles de production qui tiennent dans la mémoire d’un GPU. Les plus gros systèmes frontière exigeraient du multi-GPU. Ne pas lire « chaque fleuron Gemini a déjà passé une éval scellée ».

FormulationSource vérifiableLecture
Première éval double aveugle propriétaire frontièreBillet DeepMind, 2026-08-27Claim de méthode, pas de score
Gemini 2.5 Flash-Lite + items AILuminate inéditsRapport pilote AVERIModèle de production, pas un proxy GPT-2
L’évaluateur ne voit pas les poids / Google pas les itemsLes deux côtés, même découpeCalcul conjoint dans l’enclave

DeepMind : le pilote doit tracer une nouvelle ligne de supervision. AVERI : transformer autant que possible les conflits d’accès en ingénierie — l’audit dépasse l’éval de modèle.

# DeepMind double-blind eval pilot
# announced 2026-08-27
model: Gemini 2.5 Flash Lite
partners: Singapore AISI, OpenMined, AVERI, MLCommons
box: Google Cloud Confidential Space (TEE)
public_scores: none
prior_proxy: 2024 OpenMined + Anthropic + UK AISI (GPT-2)

Lecture et limites

Pas de score ≠ succès ou échec
Les pages publiques valident l’architecture, pas la note de sûreté de Gemini. Pas de pourcentage AILuminate inventé.
Double aveugle ≠ obligation légale pour chaque labo
AVERI cite le code de pratique GPAI de l’UE et l’Illinois SB 315 (audits dès 2028). Ce run reste volontaire.
Cette page n’est pas une fiche réunion
Elle n’explique que l’éval. Pour un huddle court : wbmeet et créer une salle.

Questions à recouper

Quel Gemini ?

DeepMind : « a Gemini Flash Lite model ». AVERI et relais : Gemini 2.5 Flash-Lite. Pas Ultra, pas un plus gros fleuron inédit.

Pourquoi retenir les scores ?

Le billet DeepMind porte sur la méthode. AVERI : rapport confidentiel, prompts et sorties privés. Les relais confirment l’absence de feuille publique tâche par tâche.

Écart avec la démo d’enclave 2024 ?

AVERI : 2024, GPT-2 et cinq lignes proxy. 2026, modèle de production propriétaire et items AILuminate inédits.

Peut-on reproduire le run ?

Le rapport technique, tel que résumé : builds non reproductibles indépendamment, attestation signée via Google. Démo d’architecture, pas un portail public.

Démarrer une réunion gratuite