Ornith-1.5 2026 : 397B open weights et curriculum auto-généré
Ornith-1.5 a livré des poids ouverts le 19 août. On sépare ici les chiffres officiels de la note MIT / Hugging Face de GIGAZINE.
Le 19 août 2026, Ornith a mis en ligne trois tailles de poids ouverts : un grand MoE à côté des scores agents d’un fleuron fermé, et un Dense 9B que les auteurs disent quantifiable sur téléphone.
L’objet est Ornith-1.5. Le blog officiel parle d’auto-amélioration de bout en bout : le modèle propose des tâches plus dures, écrit un échafaudage, puis produit des rollouts pour l’apprentissage par renforcement. Ce qui suit n’est que chiffres officiels et note GIGAZINE — pas une reproduction externe d’une victoire sur Opus.
Ce qui est sorti
Le texte dit que 1.5 étend 1.0, et que 1.0 a été bâti sur Qwen3.5 et Gemma 4 avec pré-entraînement continu, mid-training et post-training. 1.5 fait passer la boucle de l’optimisation des échafaudages et rollouts à l’optimisation conjointe de la génération de tâches.
Chiffres vérifiables
- 1
Les trois tailles sont nommées
Liste officielle :
Ornith-1.5-397B(MoE),Ornith-1.5-35B-A3B(MoE, 3B actifs par jeton),Ornith-1.5-9B(dense). GIGAZINE a aussi nomméOrnith-1.5-9B-Mobilepour iPhone et Android. - 2
397B contre Opus 4.8 est mixte, pas un balayage
Le texte donne 86,1 sur Terminal-Bench 2.1 et 56,0 sur DeepSWE, « on par » avec Opus 4.8 à 85,0 et 59,0. Terminus-2 est au-dessus, DeepSWE en dessous. Face à GLM-5.2 et DeepSeek-V4-Flash-0731, les auteurs revendiquent une avance parmi les modèles ouverts de taille proche.
- 3
Le curriculum est généré ; la récompense a une porte dure
Chaque cycle propose des tâches plus dures, écrit un échafaudage (consignes, outils, décomposition, orchestration) puis des rollouts. Récompense = validité V × difficulté de frontière D × nouveauté N. V=0 annule le terme. La difficulté use le taux de succès courant, cible p*=0,2. Les trois étages utilisent GRPO.
Le 35B active peu et reste haut en scores agents
Les auteurs écrivent que le 35B-A3B bat le Qwen 3.6-35B de même taille et les denses Gemma 4-31B et Meta Muse Glimmer-30B : 68,5 contre 43,4 et 51,7 sur Terminal-Bench 2.1, 79,0 contre 52,0 et 76,0 sur SWE-bench Verified.
Le 9B est dit battre de plus grands denses
Le 9B est à 47,0 sur Terminal-Bench 2.1 (Claude Code) et 70,6 sur SWE-bench Verified, et dépasserait Gemma 4-31B sur la plupart des tests. C’est la table vendeur, pas un cluster tiers.
Licence et distribution à lire à part
GIGAZINE a écrit MIT et la collection ornith-ai sur Hugging Face. L’essai officiel ne répète pas la licence complète dans le même paragraphe. Le LICENSE du dépôt reste le texte à lire.
| Formulation | Source vérifiable | Lecture |
|---|---|---|
| Trois tailles 1.5 le 19 août | Blog Ornith ; GIGAZINE 20 août | Date de sortie : texte officiel |
| 397B TB2.1 86,1 / DeepSWE 56,0 | Table officielle (moyenne 5 runs) | Éval vendeur ; pas un sweep d’Opus |
| MIT + Hugging Face | GIGAZINE 20 août | Recension presse ; vérifier LICENSE |
La boucle officielle : des politiques plus fortes produisent des tâches plus dures et informatives ; des échafaudages qui évoluent extraient plus de capacité ; de meilleurs rollouts fournissent le signal suivant. Claim de méthode, pas un audit externe.
# Official 1.5 loop (2026-08-19)
propose harder tasks
generate / refine scaffold
produce solution rollouts
R_task = V * D(p*=0.2) * N
optimize three stages with GRPO
Lecture et limites
- « On par with Opus » ≠ en tête sur chaque ligne
- Sur leur propre colonne DeepSWE, le 397B est derrière Opus 4.8 (56,0 contre 59,0). Les avances Terminal-Bench dépendent du harness (Terminus-2 vs Claude Code).
- Un curriculum maison peut encore être piraté
- Le texte définit une récompense d’harness pour alignement, fidélité et résistance au piratage. Notes d’éval : SWE-bench sans historique git ni réseau, NL2Repo avec dépôts et pip bloqués. Ce sont leurs contrôles, pas une preuve d’ininjouabilité.
- Ce qui est ouvert est le checkpoint, pas la facture d’entraînement
- Poids, notes de service et formats quantifiés ont été publiés. Le calcul et les traces de données du curriculum ne sont pas écrits comme un budget reproductible ligne à ligne.
Questions à recouper
Ornith-1.5 est-il une base entraînée de zéro ?
Le texte dit que 1.5 étend 1.0, et que 1.0 a continué, mid- et post-entraîné sur Qwen3.5 et Gemma 4. Ce n’est pas un pré-entraînement sans lien avec ces bases.
Le 397B bat-il déjà Claude Opus 4.8 ?
Les auteurs revendiquent une avance parmi les modèles ouverts de taille proche et « on par » avec Opus sur deux bancs agents. Terminus-2 est au-dessus, DeepSWE en dessous. Pas de reprise indépendante de la table entière.
Le 9B tourne-t-il vraiment sur un téléphone ?
Le texte officiel et GIGAZINE décrivent un quant 9B-Mobile pour iPhone et Android. RAM et vitesse ne sont pas un banc unique. On peut vérifier le paquet quant — pas qu’un téléphone quelconque fasse tourner le 397B sans accroc.