Что такое Ornith-1.5 2026: 397B открытые веса и самоучебный курс
19 августа Ornith-1.5 вышла с открытыми весами. Ниже отделены официальные цифры от MIT / Hugging Face у GIGAZINE.
19 августа 2026 Ornith выложила три скачиваемых размера открытых весов: большой MoE рядом с агентными баллами закрытого флагмана и плотный 9B, который авторы квантуют на телефоны.
Объект — Ornith-1.5. Официальный блог описывает сквозное самоулучшение: модель предлагает более трудные задачи, пишет каркас и даёт rollout для RL. Ниже только официальные цифры и заметка GIGAZINE — не утверждение, что внешняя лаборатория воспроизвела победу над Opus.
Что вышло
Текст пишет, что 1.5 расширяет 1.0, а 1.0 собран на Qwen3.5 и Gemma 4 с продолженным претрейном, mid- и post-training. 1.5 сдвигает цикл от оптимизации каркаса и rollout к совместной оптимизации генерации задач.
Проверяемые формулировки
- 1
Три размера названы
Официальный список:
Ornith-1.5-397B(MoE),Ornith-1.5-35B-A3B(MoE, 3B активных на токен),Ornith-1.5-9B(плотный). GIGAZINE также назвалаOrnith-1.5-9B-Mobileдля iPhone и Android. - 2
397B против Opus 4.8 — смешанно, не свип
Текст даёт 86,1 на Terminal-Bench 2.1 и 56,0 на DeepSWE, «on par» с Opus 4.8 на 85,0 и 59,0. Terminus-2 выше, DeepSWE ниже. Против GLM-5.2 и DeepSeek-V4-Flash-0731 авторы заявляют лидерство среди открытых моделей схожего масштаба.
- 3
Курс генерируется; у награды есть жёсткий затвор
Каждый цикл предлагает более трудные задачи, пишет каркас (инструкции, инструменты, разбор, оркестрация) и даёт rollout. Награда = валидность V × трудность фронтира D × новизна N. V=0 обнуляет член. Трудность — по текущей доле успеха, цель p*=0,2. Все три стадии — GRPO.
35B мало активирует и держит высокие агентные баллы
Авторы пишут, что 35B-A3B обходит одноразмерный Qwen 3.6-35B и более плотные Gemma 4-31B и Meta Muse Glimmer-30B: 68,5 против 43,4 и 51,7 на Terminal-Bench 2.1, 79,0 против 52,0 и 76,0 на SWE-bench Verified.
9B якобы обходит более крупные плотные модели
9B: 47,0 на Terminal-Bench 2.1 (Claude Code) и 70,6 на SWE-bench Verified; на большинстве тестов — выше Gemma 4-31B. Это таблица вендора, не чужой кластер.
Лицензию и раздачу читать отдельно
GIGAZINE написала MIT и коллекцию ornith-ai на Hugging Face. Официальное эссе не повторяет полный текст лицензии в том же абзаце. Перед скачиванием — LICENSE репозитория.
| Формулировка | Проверяемый источник | Как читать |
|---|---|---|
| Три размера 1.5 19 августа | Блог Ornith; GIGAZINE 20 августа | Дата выпуска — официальный пост |
| 397B TB2.1 86,1 / DeepSWE 56,0 | Официальная таблица (среднее 5 прогонов) | Оценка вендора; не свип Opus |
| MIT + Hugging Face | GIGAZINE 20 августа | Пересказ прессы; сверить LICENSE |
Официальный цикл: более сильные политики дают более трудные и информативные задачи; эволюционирующие каркасы вытягивают способность; более качественные rollout дают следующий сигнал обучения. Это методическое утверждение, не внешний аудит.
# Official 1.5 loop (2026-08-19)
propose harder tasks
generate / refine scaffold
produce solution rollouts
R_task = V * D(p*=0.2) * N
optimize three stages with GRPO
Как читать границы
- «On par with Opus» ≠ впереди в каждой строке
- В собственной колонке DeepSWE 397B отстаёт от Opus 4.8 (56,0 против 59,0). Отрыв Terminal-Bench зависит от harness (Terminus-2 против Claude Code).
- Самодельный курс всё ещё можно хакнуть
- Текст задаёт отдельную награду harness за выравнивание, верность награды и устойчивость к хаку. Сноски: SWE-bench без git-истории и сети, NL2Repo с блокировкой репозиториев и pip. Это их контроли, не доказательство неуязвимости.
- Открыт чекпоинт, не полный счёт обучения
- Веса, заметки по сервису и кванты опубликованы. Вычисления и следы данных самокурса не записаны как построчный бюджет воспроизведения.
Вопросы для сверки
Ornith-1.5 — база с нуля?
Текст пишет, что 1.5 расширяет 1.0, а 1.0 продолжила, mid- и post-тренировала Qwen3.5 и Gemma 4. Это не претрейн без связи с этими базами.
397B уже обходит Claude Opus 4.8?
Авторы заявляют лидерство среди открытых моделей схожего масштаба и «on par» с Opus на двух агентных бенчах. Terminus-2 выше, DeepSWE ниже. Полного независимого перезапуска таблицы нет.
9B реально бежит на телефоне?
Официальный текст и GIGAZINE описывают квант 9B-Mobile для iPhone и Android. ОЗУ и скорость не сведены в один стенд. Проверяем пакет кванта — не то, что любой телефон плавно крутит 397B.