Anthropic TASTE 2026: что значит 60% у Fable 5 против 77%
TASTE от Anthropic меряет, как модели судят заявки по safety-исследованиям. Fable 5 — 60%; оценка согласия людей — 77%.
Автоматизировать исследования безопасности нельзя, не умея сначала оценивать заявки. 28 августа группа alignment в Anthropic выпустила бенчмарк именно для этого: нынешние флагманы заметно отстают от опытных исследователей.
Объект — TASTE (The AI Safety Taste Evaluation). В посте — 92 пары эмпирических заявок по safety-исследованиям против предпочтений экспертов; оценка согласия людей 77%, лучшая модель Fable 5 — 60%. Ниже — цифры, которые сходятся с alignment.anthropic.com и аннотацией, а не тезис, что модели уже заменяют рецензию, или что какая-то лаборатория «провалилась» целиком.
Что говорит официальная заметка
Авторы: Hasan Baig (Anthropic Fellows Program), Hailey Joren и Joe Benton (Anthropic). Мотив узкий: у многих вопросов safety нет проверяемой награды, а выбор направления даёт большой рычаг. Если автоматический R&D обгонит работу по рассогласованию и злоупотреблениям, нужно мерить суждение на труднопроверяемом шаге. TASTE берёт человеческое предпочтение как истину и оставляет только пары, где люди достаточно согласны.
Проверяемые формулировки
- 1
Как собрали метки с высоким согласием
Каркас на Claude Opus 4.6 восстановил мотивирующие вопросы из 93 человеческих заявок Fellows и сгенерировал новые. Четыре исследователя оценили каждый набор (общее / верхний уровень / подход, 1–5), обсудили в парах и пересмотрели. Парное обсуждение плюс фильтр «сильная уверенность» поднимает согласие с отложенными исследователями с 53% до обсуждения до 68%. Пары с разрывом общего балла не меньше двух и не более десяти появлений заявки дают 92 пары при 77% оценочного человеческого согласия. На 50 парах, где другой человек оценил обе, согласие 83%.
- 2
Fable 5 лидирует и всё ещё ниже людей
Стандарт: модель видит обе заявки и выдаёт вероятность победы, которую бинаризуют. Fable 5 — 60%; аннотация ставит поле примерно от 41% (случай) до 60%. Низкое усилие рассуждения — 48%, максимальное — 60%. На 74 парах из разных промптов Fable 5 даёт 69%. Авторы пишут, что модели переоценивают, насколько заявка отвечает семенному вопросу. Более жёсткая схема — оценка по одной заявке через подразумеваемые предпочтения.
- 3
Флагманы агентных досок здесь близки к случаю
Официальная подпись к рисунку: Opus 5 и GPT-5.6-Sol на TASTE близки к случаю, хотя на общих агентных досках они на фронтире. Это не «они не умеют писать код». Выбор направления safety-исследования — другая задача. Та же осторожность, что и в нашем разборе оценки контроля Guidelight: узкий балл — не общий балл безопасности лаборатории.
Людям сначала нужно согласоваться, иначе нет золотой метки
В протоколах есть и содержательные споры о технике, и простое неверное прочтение. Авторы советуют оставлять парное обсуждение и фильтр уверенности. Без этого шага согласие на размытых выходах снова падает к половине.
Проверяемая работа и суждение разделены
Обзор alignment той же недели ставит TASTE рядом с автоматическим alignment-исследованием, у которого есть объективный скорер: где исправление можно оценить, автоматизация уже обходит часть человеческих баз; где истина — человеческое суждение, фронтир почти не начался. Это совместное чтение двух статей. Сам TASTE не претендует на общий зачёт.
Набор делят, а не выкладывают как публичную доску
Anthropic пишет, что делится TASTE с исследователями безопасности через форму. Не читать это как публичный LMSYS-лидерборд и не выдумывать полную неопубликованную таблицу.
| Формулировка | Проверяемый источник | Как читать |
|---|---|---|
| Fable 5 60% / люди 77% / 92 пары | Пост и статья Anthropic Alignment, 2026-08-28 | Точность суждения, не общий IQ |
| 53% до обсуждения → 68% сильная уверенность + после разговора | Официальный эксперимент по качеству меток | Прирост от процесса, не от смены модели |
| Opus 5 и GPT-5.6-Sol близки к случаю | Официальная подпись к рисунку | Узкая задача; интервалы ±10 пунктов, без рангов |
Официальный вывод: модели всё ещё отстают от экспертов; нужны более крупные и разнообразные оценки навыка safety-исследований. Парное обсуждение и фильтр уверенности описаны как переиспользуемые методы сбора.
# TASTE (The AI Safety Taste Evaluation)
# Anthropic Alignment, 2026-08-28
pairs: 92
human_agreement_est: 77%
best_model: Fable 5 60% (low effort 48%, max 60%)
near_chance: Opus 5, GPT-5.6-Sol
label_filter: pair discussion + strong confidence + Δscore ≥ 2Как читать границы
- 60% не значит «готов председательствовать в грантовом комитете»
- Золотая метка — предпочтение экспертов по модельным эмпирическим заявкам. Это не живой комитет и не ворота релиза продукта.
- Флагманы у случая ≠ «у этих моделей нет навыка»
- Авторы отделяют TASTE от общих агентных досок. Интервалы широкие; относительный ранг назван небезопасным. Читать «Opus 5 рухнул» — перебор.
- Эта страница не бриф про совещания
- Она только объясняет оценку. Если нужен час у общей доски, откройте wbmeet и создайте или войдите в комнату — не склеивайте safety-бенчмарк с конференц-сьютом.
Вопросы для сверки
TASTE — публичный лидерборд?
Нет. Пост говорит о доступе для исследователей безопасности по заявке. В блоге — агрегаты и рисунок, не публичный портал подачи, который можно прогнать заново.
Лидерство Fable 5 значит, что Anthropic лучше всех в safety-исследованиях?
Нет. Это максимум на этой парной схеме из 92 пар; интервалы около ±10 пунктов. В статье также 69% на подмножестве с разными промптами и смещение к «отвечает на семенной вопрос» на парах одного промпта.
Как оценены человеческие 77%?
Общий балл берут у исследователя из противоположной обсуждающей пары; выше побеждает. Так покрывают пары, которые один человек не оценивал с обеих сторон. На 50 парах с двойной оценкой — 83%. Авторы называют это приближением, не идеальным потолком людей.
Заявки писали люди или модели?
Предмет теста — сгенерированные эмпирические заявки. Семя — 93 человеческих текста Fellows; Opus 4.6 восстановил промпты и переписал. Люди судили черновики, не сырую стопку домашних заданий Fellows.