2026 Anthropic TASTE評估是什麼:Fable 5僅60%對77%全解析

Anthropic 的 TASTE 量模型怎麼評安全研究提案。Fable 5 得 60%,估計的人類協議是 77%。

自動化安全研究要先會評判提案。Anthropic 對齊團隊在 8 月 28 日放出一份專門量這件事的基準:當前旗艦模型仍明顯落後於資深研究者。

核心對象是 TASTE(The AI Safety Taste Evaluation)。官方寫 92 對經驗性安全研究提案,對照資深研究者偏好;人類協議約 77%,最好模型 Fable 5 為 60%。下文按 alignment.anthropic.com 博文與論文摘要能對上的數字寫,不寫成「模型已能替代安全評審」或「某家全面落後」。

Fellows 人工提案作種子成對討論後過濾標籤8 月 28 日:TASTE 發布

官方寫成了什麼

作者是 Hasan Baig(Anthropic Fellows Program)、Hailey Joren 與 Joe Benton(Anthropic)。動機寫得很窄:安全研究裡許多題沒有可驗證獎勵,評判提案又是高槓桿步驟。若自動研發快過緩解錯位與濫用的能力,就需要量模型在「難核驗」環節上的判斷。TASTE 把人類偏好當金標,只保留人類彼此同意度夠高的對。

60%
官方:Fable 5 標準設定(成對)
77%
官方:估計的研究者協議
92
官方:成對比較條數

能核對的幾條口徑

  1. 1

    標籤怎麼做成高協議集

    先用 Claude Opus 4.6 的鷹架,從 Fellows Program 裡 93 份人工提案反推動機題並生成新提案。四名研究者各自打分(總體/高層次/方法,1–5),再成對討論、修訂。成對討論加上自報「強信心」,把與留出研究者的協議從討論前 53% 提到 68%。再篩總分至少差 2 分、每條提案最多出現 10 次,得到 92 對、估計人類協議 77%。只比「同一人評過兩篇」的 50 對時,協議是 83%。

  2. 2

    Fable 5 領先,仍低於人類

    標準設定:模型同時看兩篇,給出勝出機率再二值化。Fable 5 為 60%,論文摘要寫模型大約從隨機的 41% 到 60%。低推理力度 48%,最高力度 60%。在 74 對「不同動機題」上 Fable 5 到 69%。作者寫模型常過度看重提案是否答到題幹。更難的單篇打分設定用隱含偏好對照金標,官方寫更嚴。

  3. 3

    通用代理榜上的旗艦在這裡接近隨機

    官方圖註:Opus 5 與 GPT-5.6-Sol 在 TASTE 上接近隨機,儘管二者在通用代理基準上處於前沿。這不是說它們「不會寫程式」,而是「選哪條安全研究方向」與現成 agent 榜不是同一件事。和本站另一篇 Guidelight 控制評估 一樣,分數量的是窄任務,不要疊成「實驗室總安全分」。

01

人類先對齊,模型才有金標

討論紀錄裡既有「某技術是否真能成」的實質分歧,也有誤讀正文。官方建議以後收標籤時保留成對討論和信心過濾。沒有這一步,模糊產出上的協議會掉回接近一半。

02

可驗證任務與判斷任務被拆開

同週對齊動態還把 TASTE 和「有客觀計分器的自動對齊研究」對照:能打分的修復上,自動化已越過部分人類基線;以人類判斷為真值時,前沿幾乎還沒開始。這是兩篇論文並讀的推論,TASTE 正文沒有自稱總冠軍。

03

資料不公開刷榜

官方寫正在與安全研究者分享 TASTE,需填表申請。不要把它讀成公開可下載的 LMSYS 式排行榜,也不要發明未公布的逐模型完整表。

說法能核對的來源讀法
Fable 5 60% / 人類 77% / 92 對Anthropic Alignment 2026-08-28 博文與論文研究判斷準確率,不是通用 IQ
討論前 53% → 強信心討論後 68%官方:標籤質量實驗協議提升來自流程,不是換模型
Opus 5、GPT-5.6-Sol 接近隨機官方圖註窄任務;區間約 ±10 點,不宜排座次

官方結論:模型仍落後於專家研究者;以後需要更多樣、更大規模的安全研究能力評測。成對討論與信心過濾被寫成可複用的收數方法。

# TASTE (The AI Safety Taste Evaluation)
# Anthropic Alignment, 2026-08-28
pairs: 92
human_agreement_est: 77%
best_model: Fable 5  60%  (low effort 48%, max 60%)
near_chance: Opus 5, GPT-5.6-Sol
label_filter: pair discussion + strong confidence + Δscore ≥ 2

讀法與界線

60% 不是「已經能主持安全立案」
金標是資深研究者偏好,樣本是模型寫的經驗性提案。這不是現場學術委員會,也不是產品發布門檻。
隨機附近的旗艦 ≠ 這些模型「沒有能力」
作者把 TASTE 和通用代理基準拆開寫。區間寬,相對排名官方寫不安全。讀成「Opus 5 全面崩盤」會超前。
和開會工具不是一條產品線
本頁只解釋評測。若讀完只是要約一小時白板討論,用 wbmeet 建房即可,見 如何建立與加入房間;不必把安全基準和會議套件綁在一起。

還想核對的問題

TASTE 是不是公開排行榜?

不是。官方寫與安全研究者分享,需申請。博文給出彙總數字與圖,不是完整可重現的公開提交入口。

Fable 5 領先是否等於 Anthropic 模型最會做安全研究?

不能這麼推。它只在這份 92 對、成對設定上最高;區間約 ±10 點。論文還寫它在不同題幹的子集上到 69%,同題幹對上更容易偏「是否答到題」。

人類 77% 是怎麼估的?

從對立討論組隨機抽一名研究者的總體分,較高者算偏好。用來覆蓋沒有同一人評過兩篇的對。只算雙方都評過的 50 對時是 83%。官方寫這只是近似,不是完美的「人類上限」。

提案是人寫的還是模型寫的?

評測用的是模型生成的經驗性提案。種子來自 Fellows Program 的 93 份人工提案,再用 Opus 4.6 反推動機題並改寫。人類評的是這些生成稿,不是把整期 Fellows 作業直接當考題。

免費開始開會