Что такое Ornith-1.5 2026: 397B открытые веса и самоучебный курс

19 августа Ornith-1.5 вышла с открытыми весами. Ниже отделены официальные цифры от MIT / Hugging Face у GIGAZINE.

19 августа 2026 Ornith выложила три скачиваемых размера открытых весов: большой MoE рядом с агентными баллами закрытого флагмана и плотный 9B, который авторы квантуют на телефоны.

Объект — Ornith-1.5. Официальный блог описывает сквозное самоулучшение: модель предлагает более трудные задачи, пишет каркас и даёт rollout для RL. Ниже только официальные цифры и заметка GIGAZINE — не утверждение, что внешняя лаборатория воспроизвела победу над Opus.

Ornith-1.0: само-каркас 19 августа: три размера Ornith-1.5 20 августа: GIGAZINE про MIT / Hugging Face

Что вышло

Текст пишет, что 1.5 расширяет 1.0, а 1.0 собран на Qwen3.5 и Gemma 4 с продолженным претрейном, mid- и post-training. 1.5 сдвигает цикл от оптимизации каркаса и rollout к совместной оптимизации генерации задач.

397B
Крупнейший MoE по параметрам
86.1
Официально: 397B Terminal-Bench 2.1
9B
Dense плюс официальный Mobile-квант

Проверяемые формулировки

  1. 1

    Три размера названы

    Официальный список: Ornith-1.5-397B (MoE), Ornith-1.5-35B-A3B (MoE, 3B активных на токен), Ornith-1.5-9B (плотный). GIGAZINE также назвала Ornith-1.5-9B-Mobile для iPhone и Android.

  2. 2

    397B против Opus 4.8 — смешанно, не свип

    Текст даёт 86,1 на Terminal-Bench 2.1 и 56,0 на DeepSWE, «on par» с Opus 4.8 на 85,0 и 59,0. Terminus-2 выше, DeepSWE ниже. Против GLM-5.2 и DeepSeek-V4-Flash-0731 авторы заявляют лидерство среди открытых моделей схожего масштаба.

  3. 3

    Курс генерируется; у награды есть жёсткий затвор

    Каждый цикл предлагает более трудные задачи, пишет каркас (инструкции, инструменты, разбор, оркестрация) и даёт rollout. Награда = валидность V × трудность фронтира D × новизна N. V=0 обнуляет член. Трудность — по текущей доле успеха, цель p*=0,2. Все три стадии — GRPO.

01

35B мало активирует и держит высокие агентные баллы

Авторы пишут, что 35B-A3B обходит одноразмерный Qwen 3.6-35B и более плотные Gemma 4-31B и Meta Muse Glimmer-30B: 68,5 против 43,4 и 51,7 на Terminal-Bench 2.1, 79,0 против 52,0 и 76,0 на SWE-bench Verified.

02

9B якобы обходит более крупные плотные модели

9B: 47,0 на Terminal-Bench 2.1 (Claude Code) и 70,6 на SWE-bench Verified; на большинстве тестов — выше Gemma 4-31B. Это таблица вендора, не чужой кластер.

03

Лицензию и раздачу читать отдельно

GIGAZINE написала MIT и коллекцию ornith-ai на Hugging Face. Официальное эссе не повторяет полный текст лицензии в том же абзаце. Перед скачиванием — LICENSE репозитория.

ФормулировкаПроверяемый источникКак читать
Три размера 1.5 19 августаБлог Ornith; GIGAZINE 20 августаДата выпуска — официальный пост
397B TB2.1 86,1 / DeepSWE 56,0Официальная таблица (среднее 5 прогонов)Оценка вендора; не свип Opus
MIT + Hugging FaceGIGAZINE 20 августаПересказ прессы; сверить LICENSE

Официальный цикл: более сильные политики дают более трудные и информативные задачи; эволюционирующие каркасы вытягивают способность; более качественные rollout дают следующий сигнал обучения. Это методическое утверждение, не внешний аудит.

# Official 1.5 loop (2026-08-19)
propose harder tasks
generate / refine scaffold
produce solution rollouts
R_task = V * D(p*=0.2) * N
optimize three stages with GRPO

Как читать границы

«On par with Opus» ≠ впереди в каждой строке
В собственной колонке DeepSWE 397B отстаёт от Opus 4.8 (56,0 против 59,0). Отрыв Terminal-Bench зависит от harness (Terminus-2 против Claude Code).
Самодельный курс всё ещё можно хакнуть
Текст задаёт отдельную награду harness за выравнивание, верность награды и устойчивость к хаку. Сноски: SWE-bench без git-истории и сети, NL2Repo с блокировкой репозиториев и pip. Это их контроли, не доказательство неуязвимости.
Открыт чекпоинт, не полный счёт обучения
Веса, заметки по сервису и кванты опубликованы. Вычисления и следы данных самокурса не записаны как построчный бюджет воспроизведения.

Вопросы для сверки

Ornith-1.5 — база с нуля?

Текст пишет, что 1.5 расширяет 1.0, а 1.0 продолжила, mid- и post-тренировала Qwen3.5 и Gemma 4. Это не претрейн без связи с этими базами.

397B уже обходит Claude Opus 4.8?

Авторы заявляют лидерство среди открытых моделей схожего масштаба и «on par» с Opus на двух агентных бенчах. Terminus-2 выше, DeepSWE ниже. Полного независимого перезапуска таблицы нет.

9B реально бежит на телефоне?

Официальный текст и GIGAZINE описывают квант 9B-Mobile для iPhone и Android. ОЗУ и скорость не сведены в один стенд. Проверяем пакет кванта — не то, что любой телефон плавно крутит 397B.

Начать бесплатную встречу