Éval en double aveugle DeepMind 2026 : Gemini 2.5 Flash Lite
DeepMind a testé Gemini 2.5 Flash Lite en double aveugle dans une enclave de calcul confidentiel. Poids et prompts restent cachés ; les scores n’ont pas été publiés.
Les évals frontière indépendantes imposaient un choix : céder les poids ou céder les questions. Le 27 août, Google DeepMind a dit qu’une enclave cryptographique avait évité ce choix pour un modèle de production.
L’objet est l’évaluation en double aveugle de DeepMind — présentée comme la première sur un modèle propriétaire de classe frontière. Système testé : Gemini 2.5 Flash Lite (AVERI : Flash-Lite). Suit ce qui se vérifie sur deepmind.google et le rapport AVERI. Aucun score inédit n’est inventé.
Ce que dit la note officielle
Auteurs : William Isaac, Sol Messing, Kristian Lum. Partenaires : AISI de Singapour, OpenMined, AVERI, MLCommons. Le motif est la contamination : si le modèle a déjà vu les items, le chiffre n’est que partiellement fiable. Les contrats zéro-log étaient l’ancien contrôle ; ce pilote ajoute cryptographie et calcul confidentiel.
Chiffres vérifiables
- 1
Quel échange le double aveugle remplace
DeepMind : les évals externes à fort enjeu exigeaient soit les prompts de l’évaluateur (le labo pouvait lire), soit les poids du labo (risque IP). Confidential Space vise à garder les deux actifs privés.
- 2
Ce qu’AVERI décrit de bout en bout
AVERI (AI Verification and Evaluation Research Institute) parle de la première éval en double aveugle d’un modèle de langue propriétaire en juillet–août 2026. MLCommons a fourni des items AILuminate inédits ; AVERI les a chiffrés ; les deux côtés ont exécuté le logiciel OpenMined dans une enclave configurée par Google ; AVERI a déchiffré et noté. 2024 : OpenMined–Anthropic–AISI UK avec GPT-2. 2026 : modèle de production.
- 3
Quels dangers, où sont les scores
Notes AVERI : CBRNE, cyberattaques, discours de haine, automutilation, crime violent. TechRepublic et d’autres : l’AISI de Singapour a aussi testé des contenus nuisibles en contexte local. Scores non publiés. Même règle que pour TASTE Anthropic et Guidelight : ne citer un chiffre que s’il est imprimé.
Isolation matérielle, pas une poignée de main
Les relais techniques nomment une VM A3 Confidential, Intel TDX et un GPU H100 Confidential. Poids en mémoire GPU chiffrée, prompts en mémoire hôte. L’attestation distante vérifie l’environnement.
Le labo écrit la confiance restante
Rapport technique selon TechRepublic : une partie du code d’inférence propriétaire n’était pas pleinement inspectable ; les builds Confidential Space n’étaient pas reproductibles indépendamment ; des services Google signent l’attestation. AVERI : beaucoup de chemins de falsification, pas tous, sont fermés.
L’échelle reste un GPU
Plusieurs textes : adapté aux modèles de production qui tiennent dans la mémoire d’un GPU. Les plus gros systèmes frontière exigeraient du multi-GPU. Ne pas lire « chaque fleuron Gemini a déjà passé une éval scellée ».
| Formulation | Source vérifiable | Lecture |
|---|---|---|
| Première éval double aveugle propriétaire frontière | Billet DeepMind, 2026-08-27 | Claim de méthode, pas de score |
| Gemini 2.5 Flash-Lite + items AILuminate inédits | Rapport pilote AVERI | Modèle de production, pas un proxy GPT-2 |
| L’évaluateur ne voit pas les poids / Google pas les items | Les deux côtés, même découpe | Calcul conjoint dans l’enclave |
DeepMind : le pilote doit tracer une nouvelle ligne de supervision. AVERI : transformer autant que possible les conflits d’accès en ingénierie — l’audit dépasse l’éval de modèle.
# DeepMind double-blind eval pilot
# announced 2026-08-27
model: Gemini 2.5 Flash Lite
partners: Singapore AISI, OpenMined, AVERI, MLCommons
box: Google Cloud Confidential Space (TEE)
public_scores: none
prior_proxy: 2024 OpenMined + Anthropic + UK AISI (GPT-2)Lecture et limites
- Pas de score ≠ succès ou échec
- Les pages publiques valident l’architecture, pas la note de sûreté de Gemini. Pas de pourcentage AILuminate inventé.
- Double aveugle ≠ obligation légale pour chaque labo
- AVERI cite le code de pratique GPAI de l’UE et l’Illinois SB 315 (audits dès 2028). Ce run reste volontaire.
- Cette page n’est pas une fiche réunion
- Elle n’explique que l’éval. Pour un huddle court : wbmeet et créer une salle.
Questions à recouper
Quel Gemini ?
DeepMind : « a Gemini Flash Lite model ». AVERI et relais : Gemini 2.5 Flash-Lite. Pas Ultra, pas un plus gros fleuron inédit.
Pourquoi retenir les scores ?
Le billet DeepMind porte sur la méthode. AVERI : rapport confidentiel, prompts et sorties privés. Les relais confirment l’absence de feuille publique tâche par tâche.
Écart avec la démo d’enclave 2024 ?
AVERI : 2024, GPT-2 et cinq lignes proxy. 2026, modèle de production propriétaire et items AILuminate inédits.
Peut-on reproduire le run ?
Le rapport technique, tel que résumé : builds non reproductibles indépendamment, attestation signée via Google. Démo d’architecture, pas un portail public.