2026 Anthropic TASTE란: Fable 5는 60%, 연구자는 77%

Anthropic TASTE는 모델이 안전 연구 제안을 어떻게 고르는지 잰다. Fable 5는 60%, 추정 인간 합의는 77%.

안전 연구를 자동화하려면 먼저 제안서를 가릴 수 있어야 한다. Anthropic 정렬 팀이 8월 28일 공개한 기준에서 현재 플래그십은 숙련 연구자보다 분명히 낮다.

대상은 TASTE(The AI Safety Taste Evaluation)다. 공식문은 경험적 안전 연구 제안 92쌍을 숙련자 선호와 대조하고, 인간 합의를 약 77%, 최고 모델 Fable 5를 60%로 적는다. 아래는 alignment.anthropic.com 글과 논문 초록에서 맞출 수 있는 숫자이며, 「이미 안전 심사를 대체한다」거나 「어느 랩이 전면 패배」라고 쓰지 않는다.

Fellows 사람 제안을 씨앗으로쌍 토론 후 필터8월 28일: TASTE 공개

공식문이 쓴 것

저자는 Hasan Baig(Anthropic Fellows Program), Hailey Joren, Joe Benton(Anthropic)이다. 동기는 좁다. 안전의 많은 물음에 검증 가능한 보상이 없고, 제안 선택은 레버리지가 크다. 자동 R&D가 오정렬·오남용 완화를 앞지르면 「검증하기 어려운」 판단을 재야 한다. TASTE는 인간 선호를 골드 라벨로 두고, 인간끼리 합의가 충분한 쌍만 남긴다.

60%
공식: Fable 5, 표준 쌍 설정
77%
공식: 추정 연구자 합의
92
공식: 쌍 비교 수

확인할 수 있는 표현

  1. 1

    고합의 라벨을 만든 방법

    Claude Opus 4.6 스캐폴드로 Fellows 사람 제안 93건에서 동기 질문을 역설계하고 새 제안을 생성한다. 연구자 4명이 각 세트를 채점(전체/고수준/방법, 1–5)한 뒤 쌍으로 토론하고 수정한다. 쌍 토론과 자기보고 「강한 확신」으로 보류 연구자와의 합의는 토론 전 53%에서 68%로 오른다. 전체 점수 차가 2 이상이고 각 제안이 최대 10번만 나오게 걸러 92쌍, 추정 인간 합의 77%가 된다. 다른 연구자가 둘 다 채점한 50쌍만 보면 83%다.

  2. 2

    Fable 5가 앞서도 인간보다 낮다

    표준 설정: 모델이 두 안을 보고 승률을 낸 뒤 이진화한다. Fable 5는 60%. 초록은 대략 우연 41%에서 60%라고 쓴다. 낮은 추론 노력 48%, 최대 노력 60%. 다른 프롬프트에서 온 74쌍에서는 69%. 저자는 모델이 「씨앗 질문에 답했는가」를 과대평가한다고 쓴다. 더 어려운 단일 제안 채점은 함의된 선호로 골드와 대조하며, 공식문은 더 엄하다고 한다.

  3. 3

    에이전트 보드 플래그십은 여기서 우연에 가깝다

    공식 그림 주석: Opus 5와 GPT-5.6-Sol은 일반 에이전트 기준에서는 프론티어인데 TASTE에서는 우연에 가깝다. 「코드를 못 짠다」가 아니다. 안전 연구 방향을 고르는 일과 기존 agent 보드는 다른 과제다. 이 사이트의 Guidelight 통제 평가와 같이, 좁은 점수를 랩 전체 안전 점으로 겹치지 말라.

01

인간이 먼저 맞춰야 골드 라벨이 생긴다

토론 기록에는 기법이 될지의 실질 대립과 본문 오독이 모두 있다. 공식문은 이후 수집에도 쌍 토론과 확신 필터를 남기라고 한다. 이 단계가 없으면 모호한 산출물의 합의는 절반 가까이 떨어진다.

02

검증 가능한 일과 판단 일은 나뉘어 있다

같은 주 정리는 객관 채점기가 있는 자동 정렬 연구와 TASTE를 짝짓는다. 고칠 대상을 점수 낼 수 있으면 자동화가 일부 인간 기준을 넘고, 인간 판단이 진실이면 프론티어는 거의 시작하지 않았다. 두 논문을 같이 읽은 해석이며, TASTE 본문이 종합 우승을 자칭하지는 않는다.

03

공개 스크레이프 보드가 아니다

공식문은 신청 양식으로 안전 연구자와 공유한다고 쓴다. 공개 LMSYS형 리더보드로 읽지 말고, 미공개 전체 모델 표를 만들지 말라.

표현대조 출처읽는 법
Fable 5 60% / 인간 77% / 92쌍Anthropic Alignment 2026-08-28 글과 논문연구 판단 정확도. 일반 IQ가 아님
토론 전 53% → 강한 확신+토론 후 68%공식: 라벨 품질 실험오른 것은 절차이지 모델 교체가 아님
Opus 5와 GPT-5.6-Sol이 우연에 가까움공식 그림 주석좁은 과제. 구간 ±10포인트, 순위 부적합

공식 맺음: 모델은 여전히 숙련 연구자에 못 미친다. 더 다양하고 큰 규모의 안전 연구 능력 평가가 필요하다. 쌍 토론과 확신 필터는 재사용 가능한 수집법으로 적혀 있다.

# TASTE (The AI Safety Taste Evaluation)
# Anthropic Alignment, 2026-08-28
pairs: 92
human_agreement_est: 77%
best_model: Fable 5  60%  (low effort 48%, max 60%)
near_chance: Opus 5, GPT-5.6-Sol
label_filter: pair discussion + strong confidence + Δscore ≥ 2

읽는 법과 경계

60%는 「안전 과제를 주재할 수 있다」가 아니다
골드 라벨은 모델이 쓴 경험적 제안에 대한 숙련자 선호다. 현장 위원회도, 제품 출시 문턱도 아니다.
우연 근처 플래그십 ≠ 「능력이 없다」
저자는 TASTE와 일반 에이전트 기준을 나눠 쓴다. 구간이 넓고 상대 순위는 불안전하다고 명시한다. 「Opus 5가 전면 붕괴」는 앞선 읽기다.
회의 도구와는 다른 선
이 페이지는 평가 설명만 한다. 한 시간 화이트보드가 필요하면 wbmeet에서 방을 만들고 방 만들기와 참가를 보면 된다. 안전 기준과 회의 스위트를 묶지 말라.

확인하고 싶은 질문

TASTE는 공개 리더보드인가?

아니다. 공식문은 신청한 안전 연구자와 공유한다고 쓴다. 블로그는 집계와 그림이며, 재현 가능한 공개 제출 창구가 아니다.

Fable 5 선두가 Anthropic이 안전 연구에 최강이라는 뜻인가?

아니다. 이 92쌍 쌍 설정에서 가장 높을 뿐이다. 구간은 약 ±10포인트. 다른 프롬프트 부분집합에서는 69%, 같은 프롬프트 쌍에서는 「씨앗 질문에 답했는가」로 기운다고 논문이 쓴다.

인간 77%는 어떻게 추정했나?

반대 토론 조에서 연구자 한 명의 전체 점수를 샘플링하고 높은 쪽을 선호로 본다. 한 사람이 양쪽을 보지 않은 쌍도 덮는다. 둘 다 채점한 50쌍만 보면 83%. 공식문은 근사이지 완벽한 인간 상한이 아니라고 쓴다.

제안은 사람이 썼나 모델이 썼나?

시험 항목은 모델이 생성한 경험적 제안이다. 씨앗은 Fellows 사람 글 93건이고, Opus 4.6이 동기를 역설계해 다시 쓴다. 인간이 채점한 것은 생성고이지 Fellows 숙제 원본 더미가 아니다.

무료로 회의 시작