Ornith-1.5 2026 : 397B open weights et curriculum auto-généré

Ornith-1.5 a livré des poids ouverts le 19 août. On sépare ici les chiffres officiels de la note MIT / Hugging Face de GIGAZINE.

Le 19 août 2026, Ornith a mis en ligne trois tailles de poids ouverts : un grand MoE à côté des scores agents d’un fleuron fermé, et un Dense 9B que les auteurs disent quantifiable sur téléphone.

L’objet est Ornith-1.5. Le blog officiel parle d’auto-amélioration de bout en bout : le modèle propose des tâches plus dures, écrit un échafaudage, puis produit des rollouts pour l’apprentissage par renforcement. Ce qui suit n’est que chiffres officiels et note GIGAZINE — pas une reproduction externe d’une victoire sur Opus.

Ornith-1.0 : auto-échafaudage 19 août : trois tailles Ornith-1.5 20 août : GIGAZINE sur MIT / Hugging Face

Ce qui est sorti

Le texte dit que 1.5 étend 1.0, et que 1.0 a été bâti sur Qwen3.5 et Gemma 4 avec pré-entraînement continu, mid-training et post-training. 1.5 fait passer la boucle de l’optimisation des échafaudages et rollouts à l’optimisation conjointe de la génération de tâches.

397B
Plus grand MoE en paramètres
86.1
Officiel : 397B Terminal-Bench 2.1
9B
Dense plus quant Mobile officiel

Chiffres vérifiables

  1. 1

    Les trois tailles sont nommées

    Liste officielle : Ornith-1.5-397B (MoE), Ornith-1.5-35B-A3B (MoE, 3B actifs par jeton), Ornith-1.5-9B (dense). GIGAZINE a aussi nommé Ornith-1.5-9B-Mobile pour iPhone et Android.

  2. 2

    397B contre Opus 4.8 est mixte, pas un balayage

    Le texte donne 86,1 sur Terminal-Bench 2.1 et 56,0 sur DeepSWE, « on par » avec Opus 4.8 à 85,0 et 59,0. Terminus-2 est au-dessus, DeepSWE en dessous. Face à GLM-5.2 et DeepSeek-V4-Flash-0731, les auteurs revendiquent une avance parmi les modèles ouverts de taille proche.

  3. 3

    Le curriculum est généré ; la récompense a une porte dure

    Chaque cycle propose des tâches plus dures, écrit un échafaudage (consignes, outils, décomposition, orchestration) puis des rollouts. Récompense = validité V × difficulté de frontière D × nouveauté N. V=0 annule le terme. La difficulté use le taux de succès courant, cible p*=0,2. Les trois étages utilisent GRPO.

01

Le 35B active peu et reste haut en scores agents

Les auteurs écrivent que le 35B-A3B bat le Qwen 3.6-35B de même taille et les denses Gemma 4-31B et Meta Muse Glimmer-30B : 68,5 contre 43,4 et 51,7 sur Terminal-Bench 2.1, 79,0 contre 52,0 et 76,0 sur SWE-bench Verified.

02

Le 9B est dit battre de plus grands denses

Le 9B est à 47,0 sur Terminal-Bench 2.1 (Claude Code) et 70,6 sur SWE-bench Verified, et dépasserait Gemma 4-31B sur la plupart des tests. C’est la table vendeur, pas un cluster tiers.

03

Licence et distribution à lire à part

GIGAZINE a écrit MIT et la collection ornith-ai sur Hugging Face. L’essai officiel ne répète pas la licence complète dans le même paragraphe. Le LICENSE du dépôt reste le texte à lire.

FormulationSource vérifiableLecture
Trois tailles 1.5 le 19 aoûtBlog Ornith ; GIGAZINE 20 aoûtDate de sortie : texte officiel
397B TB2.1 86,1 / DeepSWE 56,0Table officielle (moyenne 5 runs)Éval vendeur ; pas un sweep d’Opus
MIT + Hugging FaceGIGAZINE 20 aoûtRecension presse ; vérifier LICENSE

La boucle officielle : des politiques plus fortes produisent des tâches plus dures et informatives ; des échafaudages qui évoluent extraient plus de capacité ; de meilleurs rollouts fournissent le signal suivant. Claim de méthode, pas un audit externe.

# Official 1.5 loop (2026-08-19)
propose harder tasks
generate / refine scaffold
produce solution rollouts
R_task = V * D(p*=0.2) * N
optimize three stages with GRPO

Lecture et limites

« On par with Opus » ≠ en tête sur chaque ligne
Sur leur propre colonne DeepSWE, le 397B est derrière Opus 4.8 (56,0 contre 59,0). Les avances Terminal-Bench dépendent du harness (Terminus-2 vs Claude Code).
Un curriculum maison peut encore être piraté
Le texte définit une récompense d’harness pour alignement, fidélité et résistance au piratage. Notes d’éval : SWE-bench sans historique git ni réseau, NL2Repo avec dépôts et pip bloqués. Ce sont leurs contrôles, pas une preuve d’ininjouabilité.
Ce qui est ouvert est le checkpoint, pas la facture d’entraînement
Poids, notes de service et formats quantifiés ont été publiés. Le calcul et les traces de données du curriculum ne sont pas écrits comme un budget reproductible ligne à ligne.

Questions à recouper

Ornith-1.5 est-il une base entraînée de zéro ?

Le texte dit que 1.5 étend 1.0, et que 1.0 a continué, mid- et post-entraîné sur Qwen3.5 et Gemma 4. Ce n’est pas un pré-entraînement sans lien avec ces bases.

Le 397B bat-il déjà Claude Opus 4.8 ?

Les auteurs revendiquent une avance parmi les modèles ouverts de taille proche et « on par » avec Opus sur deux bancs agents. Terminus-2 est au-dessus, DeepSWE en dessous. Pas de reprise indépendante de la table entière.

Le 9B tourne-t-il vraiment sur un téléphone ?

Le texte officiel et GIGAZINE décrivent un quant 9B-Mobile pour iPhone et Android. RAM et vitesse ne sont pas un banc unique. On peut vérifier le paquet quant — pas qu’un téléphone quelconque fasse tourner le 397B sans accroc.

Démarrer une réunion gratuite