2026 Ornith-1.5是什麼:397B開源、自生成課程與手機9B全解析

8月19日 Ornith-1.5 開源三檔權重。下文依官方博文與 GIGAZINE 分開能核對的數字和口徑。

2026 年 8 月 19 日,Ornith 把一套開源權重写成可下载的三档:最大的 MoE 對标闭源旗舰的代理编程分,最小的 Dense 官方写能量化到手机。

核心對象是 Ornith-1.5。官方博文把它写成「端到端自改进」:模型自己出更难的题、生成任务腳手架,再产出强化学习用的解答軌跡。下文只整理官方數字和 GIGAZINE 能對上的發布口径,不写成「已獨立復現超越 Opus」。

Ornith-1.0:自腳手架 8 月 19 日:Ornith-1.5 三档權重 8 月 20 日:GIGAZINE 跟進 MIT / Hugging Face

發布了什么

官方写 1.5 建立在 1.0 之上;1.0 又建立在 Qwen3.5Gemma 4 上,再做持續預訓練、中訓和後訓。1.5 把閉環从「優化腳手架和 rollout」扩到同时優化出題。

397B
最大 MoE 總參數
86.1
官方:397B Terminal-Bench 2.1
9B
Dense + 官方 Mobile 量化

能核對的幾條口徑

  1. 1

    三档规模寫得很具體

    官方列出 Ornith-1.5-397B(MoE)、Ornith-1.5-35B-A3B(MoE,每 token 啟動 3B)、Ornith-1.5-9B(Dense)。GIGAZINE 另寫量化包 Ornith-1.5-9B-Mobile,稱可在 iPhone / Android 上跑。

  2. 2

    397B 對 Opus 4.8 是「部分持平」,不是全勝

    官方正文寫 397B 在 Terminal-Bench 2.1 得 86.1、DeepSWE 得 56.0,与 Claude Opus 4.8 的 85.0 / 59.0「相當」。同表 Terminus-2 高於 Opus,DeepSWE 低於 Opus。對 GLM-5.2 与 DeepSeek-V4-Flash-0731,官方寫在同規模開源里領先。

  3. 3

    課程是自己出的,獎勵有硬門閂

    每個週期:根據环境、任务类型說明和歷史解題記錄,提出更難的題;再生成腳手架(指令、工具、拆解、編排);策略產出 rollout。任務獎勵 = 有效性 V × 前沿難度 D × 新穎度 N。無效任務 V=0 則整項為零。难度用當前模型成功率,目標 p*=0.2。三階段都用 GRPO。

01

35B 啟動量小,代理编程分仍高

官方写 35B-A3B 在代理编程上大幅高於同規模 Qwen 3.6-35B,也高於稠密的 Gemma 4-31B 与 Meta Muse Glimmer-30B:Terminal-Bench 2.1 為 68.5 對 43.4 与 51.7,SWE-bench Verified 為 79.0 對 52.0 与 76.0。

02

9B 官方寫能打過更大稠密模型

9B 官方報 Terminal-Bench 2.1(Claude Code)47.0、SWE-bench Verified 70.6,並稱在多數測試上超過參數更多的 Gemma 4-31B。这是官方表,不是第三方机房複跑。

03

許可與分發要分開讀

GIGAZINE 写 1.5 以 MIT 開源,權重在 Hugging Face 的 ornith-ai collection。官方博文正文沒有在同一段裡複述許可證全文。下载前仍应以仓库声明為准。

說法 能核對的来源 讀法
8 月 19 日發布三档 1.5 Ornith 官方博文;GIGAZINE 8 月 20 日 發布日以官方為准
397B TB2.1 86.1 / DeepSWE 56.0 Ornith 官方表(五次平均) 厂商评测,對 Opus 并非全胜
MIT + Hugging Face GIGAZINE 8 月 20 日 媒体转述,以仓库 LICENSE 為准

官方把閉環写成:更強的策略能出更難、更有資訊量的題;演化的腳手架更能引出能力;更高質量的 rollout 再提供學習信號。這是方法描述,不是外部審計結論。

# Official 1.5 loop (2026-08-19)
propose harder tasks
generate / refine scaffold
produce solution rollouts
R_task = V * D(p*=0.2) * N
optimize three stages with GRPO

讀法与边界

「与 Opus 相當」≠ 全面超過
官方自己的 DeepSWE 上 397B 低於 Opus 4.8(56.0 對 59.0)。Terminal-Bench 的領先幅度也取决于 harness(Terminus-2 与 Claude Code 兩列不同)。
自生成課程仍可能獎勵駭客
官方单独写了 harness 奖励:任务對齐、奖励保真、抗作弊。评测腳註写 SWE-bench 去掉 git 歷史、斷網,NL2Repo 屏蔽指定倉庫與 pip。這是他們的防護聲明,不是證明系統無法被刷分。
開源可復現的是權重,不是训练全程
公开的是检查点、服务說明和量化格式。完整自生成课程的训练计算与数据軌跡,官方博文没有写成可逐项復現的账单。

还想核對的问题

Ornith-1.5 是不是從零訓練的全新底座?

官方写 1.5 擴展 1.0;1.0 在 Qwen3.5 与 Gemma 4 上做了持續預訓練、中訓和後訓。不宜寫成與這兩家底座無關的全新預訓練。

397B 已經超過 Claude Opus 4.8 了嗎?

官方写的是同規模開源領先,并對 Opus 在两项代理基准上「相當」。表內 Terminal-Bench 2.1(Terminus-2)高於 Opus,DeepSWE 低於 Opus。没有獨立第三方整表复测。

9B 真能在手機上跑嗎?

官方与 GIGAZINE 都寫有 9B-Mobile 量化、面向 iPhone / Android。具體機型、記憶體與速度沒有寫成統一基準。能核對的是他们發布了量化包,不是「任意手机都能流畅跑 397B」。

免費開始開會