2026 Anthropic TASTE评估是什么:Fable 5仅60%对77%全解析

Anthropic 的 TASTE 量模型怎么评安全研究提案。Fable 5 得 60%,估计的人类协议是 77%。

自动化安全研究要先会评判提案。Anthropic 对齐团队在 8 月 28 日放出一份专门量这件事的基准:当前旗舰模型仍明显落后于资深研究者。

核心对象是 TASTE(The AI Safety Taste Evaluation)。官方写 92 对经验性安全研究提案,对照资深研究者偏好;人类协议约 77%,最好模型 Fable 5 为 60%。下文按 alignment.anthropic.com 博文与论文摘要能对上的数字写,不写成「模型已能替代安全评审」或「某家全面落后」。

Fellows 人工提案作种子成对讨论后过滤标签8 月 28 日:TASTE 发布

官方写成了什么

作者是 Hasan Baig(Anthropic Fellows Program)、Hailey Joren 与 Joe Benton(Anthropic)。动机写得很窄:安全研究里许多题没有可验证奖励,评判提案又是高杠杆步骤。若自动研发快过缓解错位与滥用的能力,就需要量模型在「难核验」环节上的判断。TASTE 把人类偏好当金标,只保留人类彼此同意度够高的对。

60%
官方:Fable 5 标准设定(成对)
77%
官方:估计的研究者协议
92
官方:成对比较条数

能核对的几条口径

  1. 1

    标签怎么做成高协议集

    先用 Claude Opus 4.6 的脚手架,从 Fellows Program 里 93 份人工提案反推动机题并生成新提案。四名研究者各自打分(总体 / 高层次 / 方法,1–5),再成对讨论、修订。成对讨论加上自报「强信心」,把与留出研究者的协议从讨论前 53% 提到 68%。再筛总分至少差 2 分、每条提案最多出现 10 次,得到 92 对、估计人类协议 77%。只比「同一人评过两篇」的 50 对时,协议是 83%。

  2. 2

    Fable 5 领先,仍低于人类

    标准设定:模型同时看两篇,给出胜出概率再二值化。Fable 5 为 60%,论文摘要写模型大约从随机的 41% 到 60%。低推理力度 48%,最高力度 60%。在 74 对「不同动机题」上 Fable 5 到 69%。作者写模型常过度看重提案是否答到题干。更难的单篇打分设定用隐含偏好对照金标,官方写更严。

  3. 3

    通用代理榜上的旗舰在这里接近随机

    官方图注:Opus 5 与 GPT-5.6-Sol 在 TASTE 上接近随机,尽管二者在通用代理基准上处于前沿。这不是说它们「不会写代码」,而是「选哪条安全研究方向」与现成 agent 榜不是同一件事。和本站另一篇 Guidelight 控制评估 一样,分数量的是窄任务,不要叠成「实验室总安全分」。

01

人类先对齐,模型才有金标

讨论记录里既有「某技术是否真能成」的实质分歧,也有误读正文。官方建议以后收标签时保留成对讨论和信心过滤。没有这一步,模糊产出上的协议会掉回接近一半。

02

可验证任务与判断任务被拆开

同周对齐动态还把 TASTE 和「有客观计分器的自动对齐研究」对照:能打分的修复上,自动化已越过部分人类基线;以人类判断为真值时,前沿几乎还没开始。这是两篇论文并读的推论,TASTE 正文没有自称总冠军。

03

数据不公开刷榜

官方写正在与安全研究者分享 TASTE,需填表申请。不要把它读成公开可下载的 LMSYS 式排行榜,也不要发明未公布的逐模型完整表。

说法能核对的来源读法
Fable 5 60% / 人类 77% / 92 对Anthropic Alignment 2026-08-28 博文与论文研究判断准确率,不是通用 IQ
讨论前 53% → 强信心讨论后 68%官方:标签质量实验协议提升来自流程,不是换模型
Opus 5、GPT-5.6-Sol 接近随机官方图注窄任务;区间约 ±10 点,不宜排座次

官方结论:模型仍落后于专家研究者;以后需要更多样、更大规模的安全研究能力评测。成对讨论与信心过滤被写成可复用的收数方法。

# TASTE (The AI Safety Taste Evaluation)
# Anthropic Alignment, 2026-08-28
pairs: 92
human_agreement_est: 77%
best_model: Fable 5  60%  (low effort 48%, max 60%)
near_chance: Opus 5, GPT-5.6-Sol
label_filter: pair discussion + strong confidence + Δscore ≥ 2

读法与边界

60% 不是「已经能主持安全立项」
金标是资深研究者偏好,样本是模型写的经验性提案。这不是现场学术委员会,也不是产品发布门槛。
随机附近的旗舰 ≠ 这些模型「没有能力」
作者把 TASTE 和通用代理基准拆开写。区间宽,相对排名官方写不安全。读成「Opus 5 全面崩盘」会超前。
和开会工具不是一条产品线
本页只解释评测。若读完只是要约一小时白板讨论,用 wbmeet 建房即可,见 如何创建与加入房间;不必把安全基准和会议套件绑在一起。

还想核对的问题

TASTE 是不是公开排行榜?

不是。官方写与安全研究者分享,需申请。博文给出汇总数字与图,不是完整可复现的公开提交入口。

Fable 5 领先是否等于 Anthropic 模型最会做安全研究?

不能这么推。它只在这份 92 对、成对设定上最高;区间约 ±10 点。论文还写它在不同题干的子集上到 69%,同题干对上更容易偏「是否答到题」。

人类 77% 是怎么估的?

从对立讨论组随机抽一名研究者的总体分,较高者算偏好。用来覆盖没有同一人评过两篇的对。只算双方都评过的 50 对时是 83%。官方写这只是近似,不是完美的「人类上限」。

提案是人写的还是模型写的?

评测用的是模型生成的经验性提案。种子来自 Fellows Program 的 93 份人工提案,再用 Opus 4.6 反推动机题并改写。人类评的是这些生成稿,不是把整期 Fellows 作业直接当考题。

免费开始开会