Anthropic TASTE 2026: Was Fable 5 bei 60% gegen 77% heißt

Anthropics TASTE misst, wie Modelle Safety-Forschungsvorschläge beurteilen. Fable 5: 60%; geschätzte Humanübereinstimmung: 77%.

Wer Sicherheitsforschung automatisieren will, muss zuerst Vorschläge beurteilen können. Anthropics Alignment-Gruppe hat am 28. August eine Benchmark genau dafür veröffentlicht: heutige Flaggschiffe liegen klar hinter erfahrenen Forschern.

Gegenstand ist TASTE (The AI Safety Taste Evaluation). Der Beitrag nennt 92 Paare empirischer Safety-Forschungsvorschläge, bewertet gegen Expertenpräferenzen; geschätzte menschliche Übereinstimmung 77%, bestes Modell Fable 5 mit 60%. Es folgt, was sich an alignment.anthropic.com und der Abstract prüfen lässt — kein Claim, Modelle ersetzten schon Safety-Review, und kein „Labor gescheitert“.

Fellows-Humanvorschläge als SaatPaardiskussion, dann Filter28. Aug.: TASTE veröffentlicht

Was die offizielle Notiz sagt

Autoren: Hasan Baig (Anthropic Fellows Program), Hailey Joren und Joe Benton (Anthropic). Das Motiv ist eng: viele Safety-Fragen haben keine verifizierbaren Belohnungen, die Wahl der Richtung ist hebelstark. Wenn automatisierte F&E die Arbeit an Misalignment und Missbrauch überholt, braucht es ein Maß für Urteil auf dem schwer prüfbaren Schritt. TASTE nimmt menschliche Präferenz als Goldstandard und behält nur Paare mit genug menschlicher Übereinstimmung.

60%
Offiziell: Fable 5, Standard-Paarsetup
77%
Offiziell: geschätzte Forscherübereinstimmung
92
Offiziell: Präferenzpaare

Prüfbare Angaben

  1. 1

    Wie die hochübereinstimmenden Labels entstanden

    Ein Claude-Opus-4.6-Gerüst rekonstruierte Motivfragen aus 93 menschlichen Fellows-Vorschlägen und erzeugte neue. Vier Forschende bewerteten jedes Set (gesamt / High-Level / Ansatz, 1–5), diskutierten in Paaren, revidierten. Paardiskussion plus Filter „starke Konfidenz“ hebt die Übereinstimmung mit zurückgehaltenen Forschenden von 53% vor der Diskussion auf 68%. Paare mit mindestens zwei Punkten Gesamtdifferenz und höchstens zehn Auftritten pro Vorschlag ergeben 92 Paare bei 77% geschätzter Humanübereinstimmung. Auf den 50 Paaren, die eine andere Person beide sah, sind es 83%.

  2. 2

    Fable 5 führt und bleibt hinter Menschen

    Standardsetup: das Modell sieht beide Vorschläge und gibt eine Gewinnwahrscheinlichkeit, die binarisiert wird. Fable 5: 60%; der Abstract setzt das Feld etwa von 41% (Zufall) bis 60%. Geringer Reasoning-Aufwand 48%, maximaler 60%. Auf 74 Paaren aus verschiedenen Prompts erreicht Fable 5 69%. Die Autoren schreiben, Modelle übergewichteten, wie gut ein Vorschlag die Saatfrage beantwortet. Ein härteres Einzelscoring über implizierte Präferenzen gilt als strenger.

  3. 3

    Agent-Board-Flaggschiffe liegen hier nahe Zufall

    Offizielle Abbildungsnotiz: Opus 5 und GPT-5.6-Sol liegen auf TASTE nahe Zufall, obwohl sie auf allgemeinen Agentenboards vorn sind. Das heißt nicht „sie können nicht coden“. Eine Safety-Forschungsrichtung zu wählen ist nicht dieselbe Aufgabe. Gleiche Vorsicht wie bei unserer Guidelight-Kontrollbewertung: eine enge Note ist keine Labor-Gesamtsicherheitsnote.

01

Menschen mussten sich einigen, bevor Modelle ein Goldlabel hatten

Diskussionsprotokolle zeigen substanzielle Streitfragen zur Technik und schlichtes Falschlesen. Die Autoren empfehlen, Paardiskussion und Konfidenzfilter künftig beizubehalten. Ohne diesen Schritt fällt die Übereinstimmung bei unscharfen Outputs wieder gegen die Hälfte.

02

Prüfbare Arbeit und Urteil wurden getrennt

Die Alignment-Zusammenfassung derselben Woche stellt TASTE neben automatisierte Alignment-Forschung mit objektivem Scorer: wo ein Fix bewertbar ist, übertrifft Automatisierung schon manche Humanbaseline; wo menschliches Urteil die Wahrheit ist, hat die Frontier kaum begonnen. Das ist eine gemeinsame Lesart zweier Papiere. TASTE selbst behauptet keinen Sweep.

03

Der Satz wird geteilt, nicht öffentlich gescraped

Anthropic schreibt, TASTE werde über ein Formular mit Safety-Forschenden geteilt. Nicht als öffentliches LMSYS-Board lesen und keine unveröffentlichte Volltabelle erfinden.

AussagePrüfbare QuelleLesart
Fable 5 60% / Menschen 77% / 92 PaareAnthropic-Alignment-Post und Paper, 2026-08-28Urteilsgenauigkeit, kein allgemeiner IQ
53% vor Diskussion → 68% stark + nach GesprächOffizielles Label-QualitätsexperimentDer Anstieg ist Prozess, kein Modellwechsel
Opus 5 und GPT-5.6-Sol nahe ZufallOffizielle AbbildungsnotizEnge Aufgabe; ±10-Punkte-Intervalle, keine Ränge

Offizieller Schluss: Modelle liegen noch hinter Experten; größere, vielfältigere Evals der Safety-Forschungskompetenz werden nötig. Paardiskussion und Konfidenzfilter stehen als wiederverwendbare Sammelmethoden.

# TASTE (The AI Safety Taste Evaluation)
# Anthropic Alignment, 2026-08-28
pairs: 92
human_agreement_est: 77%
best_model: Fable 5  60%  (low effort 48%, max 60%)
near_chance: Opus 5, GPT-5.6-Sol
label_filter: pair discussion + strong confidence + Δscore ≥ 2

Lesen und Grenzen

60% heißt nicht „bereit, ein Safety-Gremium zu leiten“
Das Goldlabel ist Expertenpräferenz über modellgeschriebene empirische Vorschläge. Kein Live-Komitee, kein Produkt-Gate.
Zufallsnahe Flaggschiffe ≠ „diese Modelle können nichts“
Die Autoren trennen TASTE von allgemeinen Agentenboards. Intervalle sind breit; relative Ränge gelten als unsicher. „Opus 5 ist zusammengebrochen“ ist zu viel.
Diese Seite ist kein Meeting-Produktbrief
Sie erklärt nur die Eval. Für eine Stunde am gemeinsamen Board: wbmeet öffnen und Raum erstellen und beitreten — Safety-Benchmark nicht an eine Konferenzsuite hängen.

Fragen zum Gegenprüfen

Ist TASTE ein öffentliches Leaderboard?

Nein. Der Beitrag sagt: Teilen mit Safety-Forschenden auf Antrag. Der Blog liefert Aggregate und eine Abbildung, kein öffentliches Einreichungsportal zum Nachspielen.

Heißt Fable-5-Führung, Anthropic-Modelle seien die besten Safety-Forscher?

Nein. Höchstwert in diesem 92-Paar-Setup; Intervalle etwa ±10 Punkte. Das Paper nennt zudem 69% auf einem Teil mit anderen Prompts und eine Verzerrung zu „beantwortet die Saatfrage“ bei gleichen Prompts.

Wie wird die menschlichen 77% geschätzt?

Ein Gesamtwert wird aus dem gegnerischen Diskussionspaar gezogen; der höhere gewinnt. So sind Paare abgedeckt, die niemand allein beide sah. Auf den 50 Paaren mit Doppelwertung: 83%. Die Autoren nennen das eine Näherung, keine perfekte Human-Decke.

Waren die Vorschläge von Menschen oder Modellen?

Geprüft werden modellgenerierte empirische Vorschläge. Saat: 93 menschliche Fellows-Texte; Opus 4.6 rekonstruierte Prompts und schrieb neu. Menschen bewerteten die Entwürfe, nicht den Rohstapel der Fellows-Hausaufgaben.

Kostenloses Meeting starten