2026 Ornith-1.5란: 397B 오픈웨이트와 자기생성 커리큘럼

8월 19일 Ornith-1.5 공개 가중치가 세 규모로 나왔다. 공식 숫자와 GIGAZINE의 MIT/Hugging Face 설명을 가른다.

2026년 8월 19일 Ornith는 내려받을 수 있는 공개 가중치를 세 규모로 냈다. 가장 큰 MoE는 폐쇄 플래그십의 에이전트 점수 옆에 두고, 가장 작은 Dense는 공식문이 휴대전화로 양자화할 수 있다고 쓴다.

대상은 Ornith-1.5다. 공식 블로그는 엔드투엔드 자기개선으로 쓴다. 모델이 더 어려운 과제를 내고, 과제별 스캐폴드를 만든 뒤 강화학습용 풀이 롤아웃을 만든다. 아래는 공식 숫자와 GIGAZINE 배포 메모뿐이며, 외부 랩이 Opus 승리를 재현했다고 쓰지 않는다.

Ornith-1.0: 자기 스캐폴드 8월 19일: Ornith-1.5 세 규모 8월 20일: GIGAZINE이 MIT/Hugging Face를 보도

무엇이 나왔나

공식문은 1.5가 1.0을 확장하고, 1.0은 Qwen3.5Gemma 4 위에 지속 사전학습·중간학습·후학습을 더했다고 쓴다. 1.5는 스캐폴드와 롤아웃 최적화에서 과제 생성까지 함께 최적화하는 루프로 옮긴다.

397B
최대 MoE 총 파라미터
86.1
공식: 397B Terminal-Bench 2.1
9B
Dense와 공식 Mobile 양자

확인할 수 있는 표현

  1. 1

    세 규모는 이름이 있다

    공식 목록은 Ornith-1.5-397B(MoE), Ornith-1.5-35B-A3B(MoE, 토큰당 3B 활성), Ornith-1.5-9B(Dense). GIGAZINE은 iPhone/Android용 Ornith-1.5-9B-Mobile도 적었다.

  2. 2

    397B 대 Opus 4.8은 혼재이지 전승이 아니다

    공식문은 Terminal-Bench 2.1 86.1, DeepSWE 56.0을 Opus 4.8의 85.0/59.0과 「동등」하다고 쓴다. 같은 표에서 Terminus-2는 위, DeepSWE는 아래다. GLM-5.2와 DeepSeek-V4-Flash-0731 대비 유사 규모 공개 모델에서 앞선다고 쓴다.

  3. 3

    커리큘럼은 생성되고 보상에는 硬門이 있다

    각 주기는 환경·과제 유형·이력에서 더 어려운 과제를 내고, 스캐폴드(지시, 도구, 분해, 편성)를 쓴 뒤 롤아웃을 만든다. 과제 보상은 타당성 V×프론티어 난이도 D×새로움 N. V=0이면 전체가 0. 난이도는 현재 모델 성공률이며 목표는 p*=0.2. 세 단계 모두 GRPO.

01

35B는 활성이 작고 에이전트 점은 높다

공식문은 35B-A3B가 같은 규모 Qwen 3.6-35B와 더 밀집한 Gemma 4-31B, Meta Muse Glimmer-30B를 에이전트 코딩에서 앞선다고 쓴다. Terminal-Bench 2.1은 68.5 대 43.4와 51.7, SWE-bench Verified는 79.0 대 52.0과 76.0.

02

9B는 더 큰 밀집 모델을 앞선다고 한다

9B는 Terminal-Bench 2.1(Claude Code) 47.0, SWE-bench Verified 70.6. 대부분 시험에서 더 큰 Gemma 4-31B를 앞선다고 쓴다. 자체 표이지 제3자 클러스터 재실행이 아니다.

03

라이선스와 배포는 따로 읽는다

GIGAZINE은 1.5를 MIT, Hugging Face ornith-ai 컬렉션이라고 썼다. 공식 본문은 같은 문단에서 라이선스 전문을 반복하지 않는다. 받기 전에는 저장소 LICENSE를 본다.

표현대조할 출처읽는 법
8월 19일 1.5 세 규모 공개Ornith 공식; GIGAZINE 8월 20일출시일은 공식 글
397B TB2.1 86.1/DeepSWE 56.0공식 표(다섯 번 평균)자체 평가. Opus 전승 아님
MIT+Hugging FaceGIGAZINE 8월 20일보도 요약. LICENSE 확인

공식 폐루프는 더 강한 정책이 더 어렵고 정보량 많은 과제를 만들고, 진화하는 스캐폴드가 능력을 끌어내며, 더 나은 롤아웃이 다음 학습 신호를 준다고 쓴다. 방법 주장이지 외부 감사가 아니다.

# Official 1.5 loop (2026-08-19)
propose harder tasks
generate / refine scaffold
produce solution rollouts
R_task = V * D(p*=0.2) * N
optimize three stages with GRPO

읽는 법과 경계

「Opus와 동등」≠ 모든 행에서 앞선다
공식 DeepSWE에서 397B는 Opus 4.8보다 낮다(56.0 대 59.0). Terminal-Bench 격차도 하네스(Terminus-2와 Claude Code)에 따라 다르다.
자기생성 커리큘럼도 보상 해킹이 가능하다
공식문은 과제 정합·보상 충실·해킹 저항용 하네스 보상을 따로 쓴다. 평가 각주는 SWE-bench에서 git 기록 제거와 네트워크 차단, NL2Repo에서 지정 저장소와 pip 차단을 쓴다. 방호 선언이지 뚫리지 않는다는 증명이 아니다.
공개된 것은 체크포인트이지 전체 훈련 고지서가 아니다
가중치, 서빙 설명, 양자 형식은 나왔다. 자기생성 커리큘럼의 계산량과 데이터 궤적은 줄 단위 재현 예산으로 쓰여 있지 않다.

확인하고 싶은 질문

Ornith-1.5는 처음부터의 새 베이스인가?

공식문은 1.5가 1.0을 확장하고, 1.0은 Qwen3.5와 Gemma 4 위에서 지속 사전학습·중간학습·후학습을 했다고 쓴다. 그 베이스와 무관한 사전학습으로 읽으면 안 된다.

397B가 이미 Claude Opus 4.8을 이겼나?

저자들은 유사 규모 공개 모델에서 앞서고 두 에이전트 벤치에서 Opus와 「동등」하다고 쓴다. Terminus-2는 위, DeepSWE는 아래. 독립 전체 표 재실행은 없다.

9B가 정말 폰에서 돌아가나?

공식문과 GIGAZINE 모두 iPhone/Android용 9B-Mobile 양자를 쓴다. 기기 RAM과 속도의 단일 벤치는 없다. 확인할 수 있는 것은 양자 팩이 나왔다는 점이지, 아무 폰이나 397B를 부드럽게 돌린다는 뜻이 아니다.

무료로 회의 시작