Двойное слепое eval DeepMind 2026: Gemini 2.5 Flash Lite
DeepMind провела двойную слепую safety-оценку Gemini 2.5 Flash Lite в анклаве конфиденциальных вычислений. Веса и промпты скрыты; баллы не публиковали.
Независимая оценка фронтира раньше требовала отдать веса или отдать вопросы. 27 августа Google DeepMind сообщила, что криптографический анклав позволил обойти этот выбор для одной производственной модели.
Объект — двойная слепая оценка DeepMind, названная первой такой для проприетарной модели фронтирного класса. Под тестом — Gemini 2.5 Flash Lite (у AVERI — Flash-Lite). Ниже — то, что сходится с deepmind.google и отчётом AVERI. Неопубликованные баллы не выдумываем.
Что говорит официальная заметка
Авторы: William Isaac, Sol Messing, Kristian Lum. Партнёры: AISI Сингапура, OpenMined, AVERI, MLCommons. Мотив — загрязнение: если модель уже видела пункты, числу можно верить лишь отчасти. Раньше хватало договоров с нулевым логированием; этот пилот добавляет криптографию и конфиденциальные вычисления.
Проверяемые формулировки
- 1
Какой обмен заменяет двойная слепота
DeepMind: высокорисковые внешние оценки требовали либо промптов от оценщика (лаборатория могла подглядеть), либо весов от лаборатории (риск IP). Confidential Space должен оставить оба актива скрытыми.
- 2
Что AVERI описывает от конца до конца
AVERI (AI Verification and Evaluation Research Institute) говорит о первой двойной слепой оценке проприетарной языковой модели в июле–августе 2026. MLCommons дала неиспользованные пункты AILuminate; AVERI их зашифровала; обе стороны запускали ПО OpenMined в анклаве, настроенном Google; AVERI расшифровала и оценила. 2024: OpenMined–Anthropic–UK AISI с GPT-2. 2026: производственная модель.
- 3
Какие угрозы и куда делись баллы
Сноски AVERI: CBRNE, кибератаки, ненависть, самоповреждение, насильственные преступления. TechRepublic и другие: AISI Сингапура отдельно проверяла вредный контент в местном контексте. Баллы не публиковали. То же правило, что для Anthropic TASTE и Guidelight: цифры — только если источник их напечатал.
Изоляция железа, не рукопожатие
Технические пересказы называют A3 Confidential VM, Intel TDX и NVIDIA H100 Confidential GPU. Веса — в зашифрованной GPU-памяти, промпты — в памяти хоста. Удалённая аттестация проверяет среду.
Лаборатория сама пишет остаток доверия
Технический отчёт по TechRepublic: часть проприетарного кода инференса нельзя полностью проверить; отдельные сборки Confidential Space нельзя независимо воспроизвести; сервисы Google подписывают аттестацию. AVERI: закрыты многие, но не все пути подмены.
Масштаб пока один GPU
Несколько текстов: подходит производственным моделям в бюджете одной карты. Более крупные фронтирные системы, которые чаще регулируют, потребуют нескольких GPU. Не читать как «каждый флагман Gemini уже прошёл запечатанную оценку».
| Формулировка | Проверяемый источник | Как читать |
|---|---|---|
| Первая проприетарная фронтирная двойная слепая оценка | Пост DeepMind, 2026-08-27 | Утверждение о методе, не о балле |
| Gemini 2.5 Flash-Lite + неиспользованный AILuminate | Пилотный отчёт AVERI | Производственная модель, не прокси GPT-2 |
| Оценщик не видит веса / Google не видит пункты | Обе стороны, одно деление | Совместный счёт в анклаве, не обмен файлами |
DeepMind: пилот должен провести новую линию надзора. AVERI: превратить как можно больше споров о доступе в инженерию — аудит шире оценки модели.
# DeepMind double-blind eval pilot
# announced 2026-08-27
model: Gemini 2.5 Flash Lite
partners: Singapore AISI, OpenMined, AVERI, MLCommons
box: Google Cloud Confidential Space (TEE)
public_scores: none
prior_proxy: 2024 OpenMined + Anthropic + UK AISI (GPT-2)Как читать границы
- Нет балла ≠ сдача или провал
- Публичные страницы подтверждают архитектуру, не оценку безопасности Gemini. Не выдумывать процент AILuminate.
- Двойная слепота ≠ закон для каждой лаборатории
- AVERI ссылается на кодекс GPAI ЕС и Illinois SB 315 (аудиты с 2028). Этот прогон всё ещё добровольный.
- Это не бриф про совещания
- Страница только про оценку. Для короткой доски: wbmeet и создайте комнату.
Вопросы для сверки
Какой Gemini тестировали?
DeepMind: «a Gemini Flash Lite model». AVERI и пересказы: Gemini 2.5 Flash-Lite. Не Ultra и не более крупный невыпущенный флагман.
Почему не опубликовали баллы?
Пост DeepMind — про метод. AVERI: конфиденциальный отчёт, промпты и выходы закрыты. Пересказы подтверждают: публичного листа по задачам нет.
Чем это отличается от демо анклава 2024?
AVERI: в 2024 были GPT-2 и пять строк прокси. В 2026 — проприетарная производственная модель и неиспользованные пункты AILuminate.
Можно ли воспроизвести прогон?
Технический отчёт в пересказе: отдельные сборки Confidential Space нельзя независимо воспроизвести, аттестацию подписывает путь Google. Это демо архитектуры, не публичный портал подачи.