Anthropic TASTE 2026: что значит 60% у Fable 5 против 77%

TASTE от Anthropic меряет, как модели судят заявки по safety-исследованиям. Fable 5 — 60%; оценка согласия людей — 77%.

Автоматизировать исследования безопасности нельзя, не умея сначала оценивать заявки. 28 августа группа alignment в Anthropic выпустила бенчмарк именно для этого: нынешние флагманы заметно отстают от опытных исследователей.

Объект — TASTE (The AI Safety Taste Evaluation). В посте — 92 пары эмпирических заявок по safety-исследованиям против предпочтений экспертов; оценка согласия людей 77%, лучшая модель Fable 5 — 60%. Ниже — цифры, которые сходятся с alignment.anthropic.com и аннотацией, а не тезис, что модели уже заменяют рецензию, или что какая-то лаборатория «провалилась» целиком.

Человеческие заявки Fellows как семяПарное обсуждение, затем фильтры28 авг.: опубликован TASTE

Что говорит официальная заметка

Авторы: Hasan Baig (Anthropic Fellows Program), Hailey Joren и Joe Benton (Anthropic). Мотив узкий: у многих вопросов safety нет проверяемой награды, а выбор направления даёт большой рычаг. Если автоматический R&D обгонит работу по рассогласованию и злоупотреблениям, нужно мерить суждение на труднопроверяемом шаге. TASTE берёт человеческое предпочтение как истину и оставляет только пары, где люди достаточно согласны.

60%
Официально: Fable 5, стандартная парная схема
77%
Официально: оценка согласия исследователей
92
Официально: пары предпочтений

Проверяемые формулировки

  1. 1

    Как собрали метки с высоким согласием

    Каркас на Claude Opus 4.6 восстановил мотивирующие вопросы из 93 человеческих заявок Fellows и сгенерировал новые. Четыре исследователя оценили каждый набор (общее / верхний уровень / подход, 1–5), обсудили в парах и пересмотрели. Парное обсуждение плюс фильтр «сильная уверенность» поднимает согласие с отложенными исследователями с 53% до обсуждения до 68%. Пары с разрывом общего балла не меньше двух и не более десяти появлений заявки дают 92 пары при 77% оценочного человеческого согласия. На 50 парах, где другой человек оценил обе, согласие 83%.

  2. 2

    Fable 5 лидирует и всё ещё ниже людей

    Стандарт: модель видит обе заявки и выдаёт вероятность победы, которую бинаризуют. Fable 5 — 60%; аннотация ставит поле примерно от 41% (случай) до 60%. Низкое усилие рассуждения — 48%, максимальное — 60%. На 74 парах из разных промптов Fable 5 даёт 69%. Авторы пишут, что модели переоценивают, насколько заявка отвечает семенному вопросу. Более жёсткая схема — оценка по одной заявке через подразумеваемые предпочтения.

  3. 3

    Флагманы агентных досок здесь близки к случаю

    Официальная подпись к рисунку: Opus 5 и GPT-5.6-Sol на TASTE близки к случаю, хотя на общих агентных досках они на фронтире. Это не «они не умеют писать код». Выбор направления safety-исследования — другая задача. Та же осторожность, что и в нашем разборе оценки контроля Guidelight: узкий балл — не общий балл безопасности лаборатории.

01

Людям сначала нужно согласоваться, иначе нет золотой метки

В протоколах есть и содержательные споры о технике, и простое неверное прочтение. Авторы советуют оставлять парное обсуждение и фильтр уверенности. Без этого шага согласие на размытых выходах снова падает к половине.

02

Проверяемая работа и суждение разделены

Обзор alignment той же недели ставит TASTE рядом с автоматическим alignment-исследованием, у которого есть объективный скорер: где исправление можно оценить, автоматизация уже обходит часть человеческих баз; где истина — человеческое суждение, фронтир почти не начался. Это совместное чтение двух статей. Сам TASTE не претендует на общий зачёт.

03

Набор делят, а не выкладывают как публичную доску

Anthropic пишет, что делится TASTE с исследователями безопасности через форму. Не читать это как публичный LMSYS-лидерборд и не выдумывать полную неопубликованную таблицу.

ФормулировкаПроверяемый источникКак читать
Fable 5 60% / люди 77% / 92 парыПост и статья Anthropic Alignment, 2026-08-28Точность суждения, не общий IQ
53% до обсуждения → 68% сильная уверенность + после разговораОфициальный эксперимент по качеству метокПрирост от процесса, не от смены модели
Opus 5 и GPT-5.6-Sol близки к случаюОфициальная подпись к рисункуУзкая задача; интервалы ±10 пунктов, без рангов

Официальный вывод: модели всё ещё отстают от экспертов; нужны более крупные и разнообразные оценки навыка safety-исследований. Парное обсуждение и фильтр уверенности описаны как переиспользуемые методы сбора.

# TASTE (The AI Safety Taste Evaluation)
# Anthropic Alignment, 2026-08-28
pairs: 92
human_agreement_est: 77%
best_model: Fable 5  60%  (low effort 48%, max 60%)
near_chance: Opus 5, GPT-5.6-Sol
label_filter: pair discussion + strong confidence + Δscore ≥ 2

Как читать границы

60% не значит «готов председательствовать в грантовом комитете»
Золотая метка — предпочтение экспертов по модельным эмпирическим заявкам. Это не живой комитет и не ворота релиза продукта.
Флагманы у случая ≠ «у этих моделей нет навыка»
Авторы отделяют TASTE от общих агентных досок. Интервалы широкие; относительный ранг назван небезопасным. Читать «Opus 5 рухнул» — перебор.
Эта страница не бриф про совещания
Она только объясняет оценку. Если нужен час у общей доски, откройте wbmeet и создайте или войдите в комнату — не склеивайте safety-бенчмарк с конференц-сьютом.

Вопросы для сверки

TASTE — публичный лидерборд?

Нет. Пост говорит о доступе для исследователей безопасности по заявке. В блоге — агрегаты и рисунок, не публичный портал подачи, который можно прогнать заново.

Лидерство Fable 5 значит, что Anthropic лучше всех в safety-исследованиях?

Нет. Это максимум на этой парной схеме из 92 пар; интервалы около ±10 пунктов. В статье также 69% на подмножестве с разными промптами и смещение к «отвечает на семенной вопрос» на парах одного промпта.

Как оценены человеческие 77%?

Общий балл берут у исследователя из противоположной обсуждающей пары; выше побеждает. Так покрывают пары, которые один человек не оценивал с обеих сторон. На 50 парах с двойной оценкой — 83%. Авторы называют это приближением, не идеальным потолком людей.

Заявки писали люди или модели?

Предмет теста — сгенерированные эмпирические заявки. Семя — 93 человеческих текста Fellows; Opus 4.6 восстановил промпты и переписал. Люди судили черновики, не сырую стопку домашних заданий Fellows.

Начать бесплатную встречу