2026 Ornith-1.5是什麼:397B開源、自生成課程與手機9B全解析
8月19日 Ornith-1.5 開源三檔權重。下文依官方博文與 GIGAZINE 分開能核對的數字和口徑。
2026 年 8 月 19 日,Ornith 把一套開源權重写成可下载的三档:最大的 MoE 對标闭源旗舰的代理编程分,最小的 Dense 官方写能量化到手机。
核心對象是 Ornith-1.5。官方博文把它写成「端到端自改进」:模型自己出更难的题、生成任务腳手架,再产出强化学习用的解答軌跡。下文只整理官方數字和 GIGAZINE 能對上的發布口径,不写成「已獨立復現超越 Opus」。
發布了什么
官方写 1.5 建立在 1.0 之上;1.0 又建立在 Qwen3.5 与 Gemma 4 上,再做持續預訓練、中訓和後訓。1.5 把閉環从「優化腳手架和 rollout」扩到同时優化出題。
能核對的幾條口徑
-
1
三档规模寫得很具體
官方列出
Ornith-1.5-397B(MoE)、Ornith-1.5-35B-A3B(MoE,每 token 啟動 3B)、Ornith-1.5-9B(Dense)。GIGAZINE 另寫量化包Ornith-1.5-9B-Mobile,稱可在 iPhone / Android 上跑。 -
2
397B 對 Opus 4.8 是「部分持平」,不是全勝
官方正文寫 397B 在 Terminal-Bench 2.1 得 86.1、DeepSWE 得 56.0,与 Claude Opus 4.8 的 85.0 / 59.0「相當」。同表 Terminus-2 高於 Opus,DeepSWE 低於 Opus。對 GLM-5.2 与 DeepSeek-V4-Flash-0731,官方寫在同規模開源里領先。
-
3
課程是自己出的,獎勵有硬門閂
每個週期:根據环境、任务类型說明和歷史解題記錄,提出更難的題;再生成腳手架(指令、工具、拆解、編排);策略產出 rollout。任務獎勵 = 有效性 V × 前沿難度 D × 新穎度 N。無效任務 V=0 則整項為零。难度用當前模型成功率,目標 p*=0.2。三階段都用 GRPO。
35B 啟動量小,代理编程分仍高
官方写 35B-A3B 在代理编程上大幅高於同規模 Qwen 3.6-35B,也高於稠密的 Gemma 4-31B 与 Meta Muse Glimmer-30B:Terminal-Bench 2.1 為 68.5 對 43.4 与 51.7,SWE-bench Verified 為 79.0 對 52.0 与 76.0。
9B 官方寫能打過更大稠密模型
9B 官方報 Terminal-Bench 2.1(Claude Code)47.0、SWE-bench Verified 70.6,並稱在多數測試上超過參數更多的 Gemma 4-31B。这是官方表,不是第三方机房複跑。
許可與分發要分開讀
GIGAZINE 写 1.5 以 MIT 開源,權重在 Hugging Face 的 ornith-ai collection。官方博文正文沒有在同一段裡複述許可證全文。下载前仍应以仓库声明為准。
| 說法 | 能核對的来源 | 讀法 |
|---|---|---|
| 8 月 19 日發布三档 1.5 | Ornith 官方博文;GIGAZINE 8 月 20 日 | 發布日以官方為准 |
| 397B TB2.1 86.1 / DeepSWE 56.0 | Ornith 官方表(五次平均) | 厂商评测,對 Opus 并非全胜 |
| MIT + Hugging Face | GIGAZINE 8 月 20 日 | 媒体转述,以仓库 LICENSE 為准 |
官方把閉環写成:更強的策略能出更難、更有資訊量的題;演化的腳手架更能引出能力;更高質量的 rollout 再提供學習信號。這是方法描述,不是外部審計結論。
# Official 1.5 loop (2026-08-19)
propose harder tasks
generate / refine scaffold
produce solution rollouts
R_task = V * D(p*=0.2) * N
optimize three stages with GRPO
讀法与边界
- 「与 Opus 相當」≠ 全面超過
- 官方自己的 DeepSWE 上 397B 低於 Opus 4.8(56.0 對 59.0)。Terminal-Bench 的領先幅度也取决于 harness(Terminus-2 与 Claude Code 兩列不同)。
- 自生成課程仍可能獎勵駭客
- 官方单独写了 harness 奖励:任务對齐、奖励保真、抗作弊。评测腳註写 SWE-bench 去掉 git 歷史、斷網,NL2Repo 屏蔽指定倉庫與 pip。這是他們的防護聲明,不是證明系統無法被刷分。
- 開源可復現的是權重,不是训练全程
- 公开的是检查点、服务說明和量化格式。完整自生成课程的训练计算与数据軌跡,官方博文没有写成可逐项復現的账单。
还想核對的问题
Ornith-1.5 是不是從零訓練的全新底座?
官方写 1.5 擴展 1.0;1.0 在 Qwen3.5 与 Gemma 4 上做了持續預訓練、中訓和後訓。不宜寫成與這兩家底座無關的全新預訓練。
397B 已經超過 Claude Opus 4.8 了嗎?
官方写的是同規模開源領先,并對 Opus 在两项代理基准上「相當」。表內 Terminal-Bench 2.1(Terminus-2)高於 Opus,DeepSWE 低於 Opus。没有獨立第三方整表复测。
9B 真能在手機上跑嗎?
官方与 GIGAZINE 都寫有 9B-Mobile 量化、面向 iPhone / Android。具體機型、記憶體與速度沒有寫成統一基準。能核對的是他们發布了量化包,不是「任意手机都能流畅跑 397B」。