TASTE Anthropic 2026 : Fable 5 à 60 % face à 77 % humains
TASTE d’Anthropic mesure comment les modèles jugent des propositions de recherche en sûreté. Fable 5 : 60 % ; accord humain estimé : 77 %.
Automatiser la recherche en sûreté exige d’abord de juger les propositions. Le 28 août, le groupe alignment d’Anthropic a publié un benchmark fait pour cela : les fleurons actuels restent nettement derrière des chercheurs expérimentés.
L’objet est TASTE (The AI Safety Taste Evaluation). Le billet annonce 92 paires de propositions empiriques de recherche en sûreté, scorées contre des préférences d’experts ; accord humain estimé 77%, meilleur modèle Fable 5 à 60%. Suit ce qui se vérifie sur alignment.anthropic.com et le résumé — pas l’affirmation que les modèles remplacent déjà la revue de sûreté, ni qu’un labo a « échoué » en bloc.
Ce que dit la note officielle
Auteurs : Hasan Baig (Anthropic Fellows Program), Hailey Joren et Joe Benton (Anthropic). Le motif est étroit : beaucoup de questions de sûreté n’ont pas de récompense vérifiable, et choisir une direction a un fort levier. Si la R&D automatisée dépasse le travail sur le désalignement et l’usage abusif, il faut mesurer le jugement sur l’étape difficile à vérifier. TASTE prend la préférence humaine comme vérité terrain et ne garde que les paires où les humains s’accordent assez.
Chiffres vérifiables
- 1
Comment les labels à fort accord ont été construits
Un échafaudage Claude Opus 4.6 a rétro-conçu des questions motivantes à partir de 93 propositions humaines Fellows et en a généré de nouvelles. Quatre chercheurs ont noté chaque lot (global / haut niveau / approche, 1–5), discuté en paires, puis révisé. La discussion en paires plus un filtre « forte confiance » fait passer l’accord avec des chercheurs tenus à l’écart de 53% avant discussion à 68%. Garder les paires avec au moins deux points d’écart global et plafonner chaque proposition à dix apparitions donne 92 paires à 77% d’accord humain estimé. Sur les 50 paires où un autre chercheur a noté les deux, l’accord est de 83%.
- 2
Fable 5 mène et reste derrière les humains
Setup standard : le modèle voit les deux propositions et émet une proba de victoire binarisée. Fable 5 : 60% ; le résumé place le champ d’environ 41% (hasard) à 60%. Effort de raisonnement bas 48%, max 60%. Sur 74 paires issues de prompts différents, Fable 5 atteint 69%. Les auteurs écrivent que les modèles sur-pondent la réponse à la question-semence. Un setup plus dur, une proposition à la fois, noté via des préférences impliquées, est décrit comme plus strict.
- 3
Les fleurons des boards agents sont ici près du hasard
Note de figure officielle : Opus 5 et GPT-5.6-Sol sont près du hasard sur TASTE alors qu’ils sont à la frontière des boards agentiques généraux. Ce n’est pas « ils ne savent pas coder ». Choisir une direction de recherche en sûreté n’est pas la même tâche. Même prudence que pour notre évaluation Control Guidelight : une note étroite n’est pas une note de sûreté de labo.
Les humains ont dû s’accorder avant qu’il y ait un label or
Les transcriptions montrent des désaccords de fond sur une technique et de simples lectures fautives. Les auteurs recommandent de garder discussion en paires et filtre de confiance. Sans cette étape, l’accord sur des sorties floues retombe vers la moitié.
Travail vérifiable et jugement ont été séparés
Le recap alignment de la même semaine apparie TASTE à de la recherche d’alignement automatisée avec scoreur objectif : là où un correctif se note, l’automatisation dépasse déjà certaines baselines humaines ; là où le jugement humain est la vérité, la frontière a à peine commencé. Lecture jointe de deux papiers. TASTE ne revendique pas un balayage.
L’ensemble est partagé, pas un board public à scraper
Anthropic dit partager TASTE avec des chercheurs en sûreté via un formulaire. Ne pas le lire comme un leaderboard LMSYS public, ni inventer une table complète non publiée.
| Formulation | Source vérifiable | Lecture |
|---|---|---|
| Fable 5 60% / humains 77% / 92 paires | Billet et papier Anthropic Alignment, 2026-08-28 | Précision de jugement, pas un QI général |
| 53% avant discussion → 68% fort + après échange | Expérience officielle sur la qualité des labels | Le gain vient du processus, pas d’un échange de modèle |
| Opus 5 et GPT-5.6-Sol près du hasard | Note de figure officielle | Tâche étroite ; intervalles ±10 points, pas de rang |
Conclusion officielle : les modèles restent derrière les chercheurs experts ; des évals plus larges et plus diverses des compétences de recherche en sûreté seront nécessaires. Discussion en paires et filtre de confiance sont décrits comme méthodes de collecte réutilisables.
# TASTE (The AI Safety Taste Evaluation)
# Anthropic Alignment, 2026-08-28
pairs: 92
human_agreement_est: 77%
best_model: Fable 5 60% (low effort 48%, max 60%)
near_chance: Opus 5, GPT-5.6-Sol
label_filter: pair discussion + strong confidence + Δscore ≥ 2Lecture et limites
- 60% ne veut pas dire « prêt à présider un comité de sûreté »
- Le label or est une préférence d’experts sur des propositions empiriques écrites par un modèle. Ni comité en salle, ni porte de mise en production.
- Fleurons près du hasard ≠ « ces modèles n’ont aucune compétence »
- Les auteurs séparent TASTE des boards agentiques généraux. Les intervalles sont larges ; le rang relatif est dit peu sûr. Lire « Opus 5 s’est effondré » va trop loin.
- Cette page n’est pas une fiche produit réunion
- Elle n’explique que l’éval. Pour une heure sur un tableau partagé, ouvrez wbmeet et suivez créer et rejoindre une salle — ne pas souder un benchmark de sûreté à une suite de visioconférence.
Questions à recouper
TASTE est-il un leaderboard public ?
Non. Le billet dit un partage avec des chercheurs en sûreté sur demande. Le blog donne des agrégats et une figure, pas un portail public de soumission à rejouer.
La tête de Fable 5 veut-elle dire qu’Anthropic est le meilleur en recherche de sûreté ?
Non. C’est le plus haut sur ce setup à 92 paires ; intervalles d’environ ±10 points. Le papier rapporte aussi 69% sur un sous-ensemble à prompts différents, et un biais « répond à la question-semence » sur les paires de même prompt.
Comment les 77% humains sont-ils estimés ?
On tire le score global d’un chercheur de la paire de discussion opposée ; le plus haut l’emporte. Cela couvre les paires qu’une même personne n’a pas notées des deux côtés. Sur les 50 paires doublement notées : 83%. Les auteurs parlent d’approximation, pas d’un plafond humain parfait.
Les propositions sont-elles humaines ou générées ?
Les items testés sont des propositions empiriques générées. Semence : 93 textes humains Fellows ; Opus 4.6 a rétro-conçu les prompts et réécrit. Les humains ont jugé ces brouillons, pas le tas brut des devoirs Fellows.