2026年 Anthropic TASTEとは:Fable 5が60%、研究者77%

AnthropicのTASTEはモデルが安全研究提案をどう選ぶかを測る。Fable 5は60%、推定される人間一致は77%。

安全研究の自動化は、まず提案を正しく選べるかにかかっている。Anthropicのアライメント班が8月28日に出した基準では、現行旗艦は熟練研究者より明確に低い。

対象は TASTE(The AI Safety Taste Evaluation)。公式は経験的な安全研究提案の92対を熟練者の選好と照合し、人間の一致を約77%、最良モデルFable 5を60%と書く。以下は alignment.anthropic.com の記事と論文要旨で照合できる数字であり、「すでに安全審査を代替できる」「某社が全面敗北」とは書かない。

Fellowsの人手提案を種にペア議論のあとフィルタ8月28日:TASTE公開

公式が書いたこと

著者はHasan Baig(Anthropic Fellows Program)、Hailey Joren、Joe Benton(Anthropic)。動機は狭い。安全の多くの問いに検証可能な報酬がなく、提案選びはレバレッジが高い。自動R&Dが誤整列と濫用の緩和を追い越すなら、「検証しにくい」判断を測る必要がある。TASTEは人間の選好を金標準にし、人間同士の一致が十分な対だけを残す。

60%
公式:Fable 5、標準のペア設定
77%
公式:推定される研究者一致
92
公式:ペア比較の数

照合できる表現

  1. 1

    高一致ラベルの作り方

    Claude Opus 4.6の足場で、Fellowsの人手提案93件から動機質問を逆算し、新しい提案を生成する。研究者4人が各セットを採点(総合/高次/手法、1–5)、ペアで議論し、改訂する。ペア議論と自己申告の「強い確信」で、保留研究者との一致は議論前53%から68%へ。総合点差2以上、各提案の出現は最大10回に抑え、92対・推定人間一致77%になる。別の研究者が両方を採点した50対だけなら83%。

  2. 2

    Fable 5は首位でも人間より低い

    標準設定:モデルは両案を見て勝率を出し、二値化する。Fable 5は60%。要旨はおよそ偶然の41%から60%と書く。低努力48%、最大努力60%。異なるプロンプト由来の74対では69%。著者はモデルが「種の問いに答えたか」を過大評価すると書く。より厳しい単案採点は、含意された選好で金標準と照合する。

  3. 3

    エージェント榜の旗艦はここで偶然に近い

    公式の図注:Opus 5とGPT-5.6-Solは汎用エージェント基準では前線にいながら、TASTEでは偶然に近い。これは「コードが書けない」ではない。安全研究の方向を選ぶ作業と既存のagent榜は別物だ。本サイトの Guidelight制御評価 と同じで、狭い点数をラボ全体の安全点に重ねない。

01

人間が先に揃わないと金標準がない

議論記録には手法の成否という実質対立も、本文の誤読もある。公式は今後の収集でもペア議論と確信フィルタを残すよう勧める。この段階がないと、曖昧な成果物での一致は半分近くに戻る。

02

検証可能な仕事と判断の仕事は分けてある

同週の整理は、客観スコアがある自動アライメント研究とTASTEを対にする。直せる対象には自動化が一部の人間基線を超え、人間判断が真のときは前線はほとんど始まっていない。二本を併読した読みであり、TASTE本文が総合優勝を自称してはいない。

03

公開スクレイプ用の榜ではない

公式は安全研究者とフォーム経由で共有すると書く。公開のLMSYS型リーダーボードとして読まず、未公表の全モデル表を作らない。

言い方照合できる出典読み方
Fable 5 60% / 人間 77% / 92対Anthropic Alignment 2026-08-28 記事と論文研究判断の精度。汎用IQではない
議論前53% → 強確信+議論後68%公式:ラベル品質の実験上がったのは手順であり、モデル入替ではない
Opus 5とGPT-5.6-Solが偶然に近い公式の図注狭い課題。区間±10点前後で順位は不適

公式の結び:モデルは熟練研究者にまだ及ばない。より多様で大規模な安全研究能力の評価が要る。ペア議論と確信フィルタは再利用できる収集法として書かれている。

# TASTE (The AI Safety Taste Evaluation)
# Anthropic Alignment, 2026-08-28
pairs: 92
human_agreement_est: 77%
best_model: Fable 5  60%  (low effort 48%, max 60%)
near_chance: Opus 5, GPT-5.6-Sol
label_filter: pair discussion + strong confidence + Δscore ≥ 2

読み方と境界

60%は「安全案件の審査長ができる」ではない
金標準はモデル生成の経験的提案に対する熟練者の選好である。現場の委員会でも、製品出荷の門でもない。
偶然付近の旗艦 ≠ 「能力がない」
著者はTASTEと汎用エージェント基準を分けて書く。区間は広く、相対順位は不安全と明記している。「Opus 5が全面崩壊」は先走りである。
会議ツールとは別線
この頁は評測の説明だけ。一時間の白板が必要なら wbmeet で部屋を作り、作成と参加 を見れば足りる。安全基準と会議スイートを結び付けない。

確認したい問い

TASTEは公開リーダーボードか。

違う。公式は申請した安全研究者と共有すると書く。ブログは集計と図であり、再現できる公開提出口ではない。

Fable 5首位はAnthropicが安全研究で最強という意味か。

ならない。この92対のペア設定で最高なだけ。区間は約±10点。異なるプロンプトの部分集合では69%、同一プロンプト対では「種の問いに答えたか」に偏ると論文は書く。

人間77%はどう推定したか。

対立する議論組から総合点を一人分サンプリングし、高い方を選好とする。同一人が両方を見ていない対もカバーする。両方が採点した50対だけなら83%。公式は近似であり、完全な人間上限ではないと書く。

提案は人手かモデルか。

試験対象はモデル生成の経験的提案。種はFellowsの人手93件で、Opus 4.6が動機を逆算して書き直す。人間が採点したのは生成稿であり、課題一式の生提出ではない。

無料で会議を開始