2026 Ornith-1.5란: 397B 오픈웨이트와 자기생성 커리큘럼
8월 19일 Ornith-1.5 공개 가중치가 세 규모로 나왔다. 공식 숫자와 GIGAZINE의 MIT/Hugging Face 설명을 가른다.
2026년 8월 19일 Ornith는 내려받을 수 있는 공개 가중치를 세 규모로 냈다. 가장 큰 MoE는 폐쇄 플래그십의 에이전트 점수 옆에 두고, 가장 작은 Dense는 공식문이 휴대전화로 양자화할 수 있다고 쓴다.
대상은 Ornith-1.5다. 공식 블로그는 엔드투엔드 자기개선으로 쓴다. 모델이 더 어려운 과제를 내고, 과제별 스캐폴드를 만든 뒤 강화학습용 풀이 롤아웃을 만든다. 아래는 공식 숫자와 GIGAZINE 배포 메모뿐이며, 외부 랩이 Opus 승리를 재현했다고 쓰지 않는다.
무엇이 나왔나
공식문은 1.5가 1.0을 확장하고, 1.0은 Qwen3.5와 Gemma 4 위에 지속 사전학습·중간학습·후학습을 더했다고 쓴다. 1.5는 스캐폴드와 롤아웃 최적화에서 과제 생성까지 함께 최적화하는 루프로 옮긴다.
확인할 수 있는 표현
- 1
세 규모는 이름이 있다
공식 목록은
Ornith-1.5-397B(MoE),Ornith-1.5-35B-A3B(MoE, 토큰당 3B 활성),Ornith-1.5-9B(Dense). GIGAZINE은 iPhone/Android용Ornith-1.5-9B-Mobile도 적었다. - 2
397B 대 Opus 4.8은 혼재이지 전승이 아니다
공식문은 Terminal-Bench 2.1 86.1, DeepSWE 56.0을 Opus 4.8의 85.0/59.0과 「동등」하다고 쓴다. 같은 표에서 Terminus-2는 위, DeepSWE는 아래다. GLM-5.2와 DeepSeek-V4-Flash-0731 대비 유사 규모 공개 모델에서 앞선다고 쓴다.
- 3
커리큘럼은 생성되고 보상에는 硬門이 있다
각 주기는 환경·과제 유형·이력에서 더 어려운 과제를 내고, 스캐폴드(지시, 도구, 분해, 편성)를 쓴 뒤 롤아웃을 만든다. 과제 보상은 타당성 V×프론티어 난이도 D×새로움 N. V=0이면 전체가 0. 난이도는 현재 모델 성공률이며 목표는 p*=0.2. 세 단계 모두 GRPO.
35B는 활성이 작고 에이전트 점은 높다
공식문은 35B-A3B가 같은 규모 Qwen 3.6-35B와 더 밀집한 Gemma 4-31B, Meta Muse Glimmer-30B를 에이전트 코딩에서 앞선다고 쓴다. Terminal-Bench 2.1은 68.5 대 43.4와 51.7, SWE-bench Verified는 79.0 대 52.0과 76.0.
9B는 더 큰 밀집 모델을 앞선다고 한다
9B는 Terminal-Bench 2.1(Claude Code) 47.0, SWE-bench Verified 70.6. 대부분 시험에서 더 큰 Gemma 4-31B를 앞선다고 쓴다. 자체 표이지 제3자 클러스터 재실행이 아니다.
라이선스와 배포는 따로 읽는다
GIGAZINE은 1.5를 MIT, Hugging Face ornith-ai 컬렉션이라고 썼다. 공식 본문은 같은 문단에서 라이선스 전문을 반복하지 않는다. 받기 전에는 저장소 LICENSE를 본다.
| 표현 | 대조할 출처 | 읽는 법 |
|---|---|---|
| 8월 19일 1.5 세 규모 공개 | Ornith 공식; GIGAZINE 8월 20일 | 출시일은 공식 글 |
| 397B TB2.1 86.1/DeepSWE 56.0 | 공식 표(다섯 번 평균) | 자체 평가. Opus 전승 아님 |
| MIT+Hugging Face | GIGAZINE 8월 20일 | 보도 요약. LICENSE 확인 |
공식 폐루프는 더 강한 정책이 더 어렵고 정보량 많은 과제를 만들고, 진화하는 스캐폴드가 능력을 끌어내며, 더 나은 롤아웃이 다음 학습 신호를 준다고 쓴다. 방법 주장이지 외부 감사가 아니다.
# Official 1.5 loop (2026-08-19)
propose harder tasks
generate / refine scaffold
produce solution rollouts
R_task = V * D(p*=0.2) * N
optimize three stages with GRPO
읽는 법과 경계
- 「Opus와 동등」≠ 모든 행에서 앞선다
- 공식 DeepSWE에서 397B는 Opus 4.8보다 낮다(56.0 대 59.0). Terminal-Bench 격차도 하네스(Terminus-2와 Claude Code)에 따라 다르다.
- 자기생성 커리큘럼도 보상 해킹이 가능하다
- 공식문은 과제 정합·보상 충실·해킹 저항용 하네스 보상을 따로 쓴다. 평가 각주는 SWE-bench에서 git 기록 제거와 네트워크 차단, NL2Repo에서 지정 저장소와 pip 차단을 쓴다. 방호 선언이지 뚫리지 않는다는 증명이 아니다.
- 공개된 것은 체크포인트이지 전체 훈련 고지서가 아니다
- 가중치, 서빙 설명, 양자 형식은 나왔다. 자기생성 커리큘럼의 계산량과 데이터 궤적은 줄 단위 재현 예산으로 쓰여 있지 않다.
확인하고 싶은 질문
Ornith-1.5는 처음부터의 새 베이스인가?
공식문은 1.5가 1.0을 확장하고, 1.0은 Qwen3.5와 Gemma 4 위에서 지속 사전학습·중간학습·후학습을 했다고 쓴다. 그 베이스와 무관한 사전학습으로 읽으면 안 된다.
397B가 이미 Claude Opus 4.8을 이겼나?
저자들은 유사 규모 공개 모델에서 앞서고 두 에이전트 벤치에서 Opus와 「동등」하다고 쓴다. Terminus-2는 위, DeepSWE는 아래. 독립 전체 표 재실행은 없다.
9B가 정말 폰에서 돌아가나?
공식문과 GIGAZINE 모두 iPhone/Android용 9B-Mobile 양자를 쓴다. 기기 RAM과 속도의 단일 벤치는 없다. 확인할 수 있는 것은 양자 팩이 나왔다는 점이지, 아무 폰이나 397B를 부드럽게 돌린다는 뜻이 아니다.