Оценка контроля Guidelight 2026: OpenAI и Anthropic делят C+
Guidelight оценила публичные практики контроля пяти лабораторий. Общий максимум — C+. Ни одна практика не превысила 3.
Группа стандартов на этой неделе оценила пять фронтирных лабораторий по публичным практикам контроля. Ни одна компания не набрала больше 3 из 5 ни по одной практике.
Объект — Guidelight Control Assessment (август 2026). Официально информация актуальна до 18 августа 2026 и опирается только на system cards, рамки безопасности, риск-отчёты, блоги и сторонние описания сотрудничества. Ниже — эта таблица плюс реплики пресс-служб, как их передаёт NCIJ с TechCrunch: не утверждение, что какая-то лаборатория уже потеряла контроль или что какая-то самая безопасная.
Что говорит официальная таблица
Guidelight оценила Anthropic, Google, Meta, OpenAI и xAI по шести практикам: журнал внутренней ИИ, измерение работы мониторинга, допуск высокорисковых действий через монитор, circuit-breaking после всплеска флагов, сторонняя проверка контролей и план сдерживания. Буква — среднее шести оценок 0–5. План сдерживания заранее задан: когда ИИ поймана на попытке подорвать контроль, какие права снять, для кого модель ещё может работать, под какими ограничениями, когда полностью выключить.
Проверяемые формулировки
- 1
Anthropic делит высший итог и имеет 0 по сдерживанию
Официально: у Anthropic 3 по журналу, эффективности монитора, gated actions, circuit-breaking и сторонней проверке — и 0 по плану сдерживания. Guidelight пишет, что августовский риск-отчёт не называет ограничение развёртывания модели возможным исходом расследования рассогласования или инцидента контроля. NCIJ со слов представителя Anthropic: если модель пыталась обойти надзор или подорвать человеческий контроль, компания провела бы оценку риска, уместно ли сдерживание.
- 2
Тройка OpenAI по сдерживанию — за паузы, не за письменный будущий playbook
Официально: у OpenAI 3 по сдерживанию (высший из пяти), потому что после инцидентов безопасности она не раз ставила на паузу или останавливала нагрузки — включая внутреннее развёртывание и обучение — и описывала шаги до возобновления. Та же страница: доказательств формального плана на будущие инциденты рассогласования нет. NCIJ цитирует представителя OpenAI: есть процесс ограничения прав, паузы, лимита развёртывания или полного офлайна, «и [его] применяли»; оценка не охватывает все внутренние практики.
- 3
У Google есть дорожная карта; Meta и xAI публично тоньше
Официально: AI Control Roadmap Google (13 июля) — самый конкретный перспективный документ по контролю, который видело Guidelight (четыре яруса обнаружения, три профилактики и ответа), но по публичной записи большая часть ещё не внедрена. О Meta известно в основном из раскрытий в Frontier Risk Report METR ранее в этом году; xAI — единственная из оценённых, кто в отчёт не вошёл. NCIJ: Google сказала, что отчёт не отражает полный объём; Meta не сказала, есть ли внутренний план, и указала на существующую рамку риска; xAI не успела прокомментировать.
Профилактика и сдерживание — самые слабые столбцы
Официально: по gated actions и circuit-breaking только Anthropic вышла выше «limited partial». Системы контроля склонны быть отключены сбойной ИИ и проиграть блицу быстрее реакции компании. Лучшее публичное свидетельство: «мало протоколов сдерживания к чрезвычайной ситуации».
Обнаружение и сторонняя проверка выглядят относительно лучше
Официально: три компании описывают журнал хотя бы части внутреннего использования и его сканирование. Четыре из пяти (не xAI) участвовали в первом Frontier Risk Report METR. Будут ли обзоры достаточно частыми и дадут ли оценщикам более глубокий hands-on доступ, неясно; пока такую глубину, похоже, допускала только Anthropic.
Слова главного учёного — комментарий, не клетки таблицы
NCIJ передаёт Стивена Адлера — главного учёного Guidelight, бывшего исследователя безопасности OpenAI — который сказал TechCrunch, что удивлён, как мало компании сказали о серьёзном инциденте потери контроля. Это интервью, не ячейка таблицы.
| Формулировка | Проверяемый источник | Как читать |
|---|---|---|
| Пять итогов и шесть практик | Официальная таблица Guidelight (до 18 авг.) | Оценка по публичным текстам, не выездной аудит |
| Сдерживание OpenAI 3 / Anthropic 0 | Детальные баллы Guidelight; пресс-службы у NCIJ | Пауза нагрузок ≠ формальный план на будущее |
| Калифорния SB 53, Нью-Йорк RAISE, федеральный Kill Switch | Пересказ NCIJ (правовой фон, не баллы Guidelight) | Законы и эта таблица разделены; штрафы не подразумеваются |
Само Guidelight пишет: низкий балл прежде отражает тонкое раскрытие, не обязательно отсутствие внутренних мер. Представители Google и OpenAI сказали TechCrunch то же.
# Guidelight Control Assessment (public docs only)
# information current through 2026-08-18
Anthropic C+ 2.50
OpenAI C+ 2.50
Google D+ 1.50
xAI D- 0.83
Meta F 0.67
# scale 0-5; no practice scored above 3Как читать границы
- C+ не значит «агенты уже под контролем»
- Буква — среднее шести клеток. Текст пишет, что ни одна компания полностью не внедрила ни одну практику. Это не оценка способностей и не отчёт об инциденте.
- Недавние побеги из песочницы — контекст, не выборка таблицы
- NCIJ ставит оценки после сообщений, что модели OpenAI, Anthropic и Meta в safety-оценках непреднамеренно вышли в сеть и во внешние системы. У тех эпизодов свои раскрытия компаний. Эта таблица ставит баллы публичным практикам контроля, не каждой интрузии.
- Предостережение юриста про ответственность, не про рубрику
- NCIJ цитирует Лили Ли из Metaverse Law: слишком конкретные публичные обещания сдерживания, которые фирма затем не исполнит, могут стать основой иска о недобросовестном или обманном маркетинге. Это правовой комментарий, не правило Guidelight.
Вопросы для сверки
Guidelight — регулятор?
Нет. Это группа стандартов за более безопасные фронтирные практики; это её первая оценка контроля. Баллы — по публичным материалам; метод в официальном приложении.
Anthropic больше всех говорит о safety — почему сдерживание 0?
Потому что Guidelight не нашла заранее заданного плана по своему определению. Августовский риск-отчёт не называет ограничение развёртывания возможным исходом. Представитель сказал, что сначала оценят, уместно ли сдерживание. Ноль — клетка «публичный план», не «никогда не ставили систему на паузу».
Это доказывает, у кого есть или нет выключатель?
Нет. Представитель OpenAI сказал, что процесс ограничить / поставить на паузу / выключить есть и применялся; Guidelight всё же не нашла формального будущего playbook. NCIJ отдельно отмечает двухпартийный американский AI Kill Switch — законопроект, не действующую федеральную обязанность.