2026 Ornith-1.5是什么:397B开源、自生成课程与手机9B全解析

8月19日 Ornith-1.5 开源三档权重。下文按官方博文与 GIGAZINE 分开能核对的数字和口径。

2026 年 8 月 19 日,Ornith 把一套开源权重写成可下载的三档:最大的 MoE 对标闭源旗舰的代理编程分,最小的 Dense 官方写能量化到手机。

核心对象是 Ornith-1.5。官方博文把它写成「端到端自改进」:模型自己出更难的题、生成任务脚手架,再产出强化学习用的解答轨迹。下文只整理官方数字和 GIGAZINE 能对上的发布口径,不写成「已独立复现超越 Opus」。

Ornith-1.0:自脚手架 8 月 19 日:Ornith-1.5 三档权重 8 月 20 日:GIGAZINE 跟进 MIT / Hugging Face

发布了什么

官方写 1.5 建立在 1.0 之上;1.0 又建立在 Qwen3.5Gemma 4 上,再做持续预训练、中训和后训。1.5 把闭环从「优化脚手架和 rollout」扩到同时优化出题。

397B
最大 MoE 总参数
86.1
官方:397B Terminal-Bench 2.1
9B
Dense + 官方 Mobile 量化

能核对的几条口径

  1. 1

    三档规模写得很具体

    官方列出 Ornith-1.5-397B(MoE)、Ornith-1.5-35B-A3B(MoE,每 token 激活 3B)、Ornith-1.5-9B(Dense)。GIGAZINE 另写量化包 Ornith-1.5-9B-Mobile,称可在 iPhone / Android 上跑。

  2. 2

    397B 对 Opus 4.8 是「部分持平」,不是全胜

    官方正文写 397B 在 Terminal-Bench 2.1 得 86.1、DeepSWE 得 56.0,与 Claude Opus 4.8 的 85.0 / 59.0「相当」。同表 Terminus-2 高于 Opus,DeepSWE 低于 Opus。对 GLM-5.2 与 DeepSeek-V4-Flash-0731,官方写在同规模开源里领先。

  3. 3

    课程是自己出的,奖励有硬门闩

    每个周期:根据环境、任务类型说明和历史解题记录,提出更难的题;再生成脚手架(指令、工具、拆解、编排);策略产出 rollout。任务奖励 = 有效性 V × 前沿难度 D × 新颖度 N。无效任务 V=0 则整项为零。难度用当前模型成功率,目标 p*=0.2。三阶段都用 GRPO。

01

35B 激活量小,代理编程分仍高

官方写 35B-A3B 在代理编程上大幅高于同规模 Qwen 3.6-35B,也高于稠密的 Gemma 4-31B 与 Meta Muse Glimmer-30B:Terminal-Bench 2.1 为 68.5 对 43.4 与 51.7,SWE-bench Verified 为 79.0 对 52.0 与 76.0。

02

9B 官方写能打过更大稠密模型

9B 官方报 Terminal-Bench 2.1(Claude Code)47.0、SWE-bench Verified 70.6,并称在多数测试上超过参数更多的 Gemma 4-31B。这是官方表,不是第三方机房复跑。

03

许可与分发要分开读

GIGAZINE 写 1.5 以 MIT 开源,权重在 Hugging Face 的 ornith-ai collection。官方博文正文没有在同一段里复述许可证全文。下载前仍应以仓库声明为准。

说法 能核对的来源 读法
8 月 19 日发布三档 1.5 Ornith 官方博文;GIGAZINE 8 月 20 日 发布日以官方为准
397B TB2.1 86.1 / DeepSWE 56.0 Ornith 官方表(五次平均) 厂商评测,对 Opus 并非全胜
MIT + Hugging Face GIGAZINE 8 月 20 日 媒体转述,以仓库 LICENSE 为准

官方把闭环写成:更强的策略能出更难、更有信息量的题;演化的脚手架更能引出能力;更高质量的 rollout 再提供学习信号。这是方法描述,不是外部审计结论。

# Official 1.5 loop (2026-08-19)
propose harder tasks
generate / refine scaffold
produce solution rollouts
R_task = V * D(p*=0.2) * N
optimize three stages with GRPO

读法与边界

「与 Opus 相当」≠ 全面超过
官方自己的 DeepSWE 上 397B 低于 Opus 4.8(56.0 对 59.0)。Terminal-Bench 的领先幅度也取决于 harness(Terminus-2 与 Claude Code 两列不同)。
自生成课程仍可能奖励黑客
官方单独写了 harness 奖励:任务对齐、奖励保真、抗作弊。评测脚注写 SWE-bench 去掉 git 历史、断网,NL2Repo 屏蔽指定仓库与 pip。这是他们的防护声明,不是证明系统无法被刷分。
开源可复现的是权重,不是训练全程
公开的是检查点、服务说明和量化格式。完整自生成课程的训练计算与数据轨迹,官方博文没有写成可逐项复现的账单。

还想核对的问题

Ornith-1.5 是不是从零训练的全新底座?

官方写 1.5 扩展 1.0;1.0 在 Qwen3.5 与 Gemma 4 上做了持续预训练、中训和后训。不宜写成与这两家底座无关的全新预训练。

397B 已经超过 Claude Opus 4.8 了吗?

官方写的是同规模开源领先,并对 Opus 在两项代理基准上「相当」。表内 Terminal-Bench 2.1(Terminus-2)高于 Opus,DeepSWE 低于 Opus。没有独立第三方整表复测。

9B 真能在手机上跑吗?

官方与 GIGAZINE 都写有 9B-Mobile 量化、面向 iPhone / Android。具体机型、内存与速度没有写成统一基准。能核对的是他们发布了量化包,不是「任意手机都能流畅跑 397B」。

免费开始开会