Ornith-1.5 2026: Was 397B-Open-Weights und Selbstcurriculum bedeuten
Ornith-1.5 kam am 19. August mit offenen Gewichten. Hier trennen sich offizielle Zahlen von GIGAZINEs MIT-/Hugging-Face-Notiz.
Am 19. August 2026 legte Ornith drei herunterladbare Open-Weight-Größen vor: ein großes MoE neben den Agentenwerten eines geschlossenen Flaggschiffs, und ein dichtes 9B, das die Autoren auf Telefone quantisieren.
Das Objekt ist Ornith-1.5. Der Offizialblog rahmt Ende-zu-Ende-Selbstverbesserung: das Modell schlägt schwerere Aufgaben vor, schreibt ein aufgabenspezifisches Gerüst und erzeugt Lösungs-Rollouts für RL. Es folgt nur Offizialzahlen plus GIGAZINE — kein Anspruch, ein externes Labor habe einen Opus-Sieg reproduziert.
Was erschien
Der Text sagt, 1.5 erweitere 1.0; 1.0 baue auf Qwen3.5 und Gemma 4 mit Continued Pretraining, Mid- und Post-Training. 1.5 verschiebt die Schleife vom Optimieren von Gerüst und Rollout zum gemeinsamen Optimieren der Aufgabenerzeugung.
Prüfbare Angaben
- 1
Die drei Größen sind benannt
Offiziell:
Ornith-1.5-397B(MoE),Ornith-1.5-35B-A3B(MoE, 3B aktiv pro Token),Ornith-1.5-9B(dicht). GIGAZINE nannte zusätzlichOrnith-1.5-9B-Mobilefür iPhone und Android. - 2
397B gegen Opus 4.8 ist gemischt, kein Sweep
Der Text nennt 86,1 auf Terminal-Bench 2.1 und 56,0 auf DeepSWE, „on par“ mit Opus 4.8 bei 85,0 und 59,0. Terminus-2 liegt darüber, DeepSWE darunter. Gegen GLM-5.2 und DeepSeek-V4-Flash-0731 beanspruchen die Autoren eine Führung unter offenen Modellen ähnlicher Größe.
- 3
Das Curriculum wird erzeugt; Reward hat ein Harttor
Jeder Zyklus schlägt schwerere Aufgaben vor, schreibt ein Gerüst (Anweisungen, Tools, Zerlegung, Orchestrierung) und erzeugt Rollouts. Aufgabenreward ist Validität V × Frontier-Schwierigkeit D × Neuheit N. V=0 setzt den ganzen Term auf null. Schwierigkeit nutzt die aktuelle Erfolgsrate, Ziel p*=0,2. Alle drei Stufen nutzen GRPO.
35B aktiviert wenig und bleibt bei Agentenpunkten hoch
Die Autoren schreiben, 35B-A3B schlage gleich großes Qwen 3.6-35B sowie dichteres Gemma 4-31B und Meta Muse Glimmer-30B: 68,5 gegen 43,4 und 51,7 auf Terminal-Bench 2.1, 79,0 gegen 52,0 und 76,0 auf SWE-bench Verified.
9B soll größere dichte Modelle schlagen
9B steht bei 47,0 auf Terminal-Bench 2.1 (Claude Code) und 70,6 auf SWE-bench Verified und soll Gemma 4-31B auf den meisten Tests schlagen. Das ist die Herstellertabelle, kein Dritt-Cluster.
Lizenz und Verteilung getrennt lesen
GIGAZINE schrieb MIT und die ornith-ai-Sammlung auf Hugging Face. Der Offizialessay wiederholt die volle Lizenz nicht im selben Absatz. Vor dem Download gilt die Repo-LICENSE.
| Aussage | Prüfbare Quelle | Lesart |
|---|---|---|
| Drei 1.5-Größen am 19. August | Ornith-Blog; GIGAZINE 20. August | Lieferdatum aus dem Offizialtext |
| 397B TB2.1 86,1 / DeepSWE 56,0 | Offizielle Tabelle (Fünf-Lauf-Mittel) | Hersteller-Eval; kein Opus-Sweep |
| MIT + Hugging Face | GIGAZINE 20. August | Pressefassung; LICENSE prüfen |
Die offizielle Schleife: stärkere Policies erzeugen schwerere, informativere Aufgaben; evolvierende Gerüste holen mehr Fähigkeit; bessere Rollouts liefern das nächste Lernsignal. Methodenclaim, kein externes Audit.
# Official 1.5 loop (2026-08-19)
propose harder tasks
generate / refine scaffold
produce solution rollouts
R_task = V * D(p*=0.2) * N
optimize three stages with GRPO
Lesen und Grenzen
- „On par with Opus“ ≠ in jeder Zeile vorn
- Auf der eigenen DeepSWE-Spalte liegt 397B hinter Opus 4.8 (56,0 gegen 59,0). Terminal-Bench-Vorsprünge hängen am Harness (Terminus-2 gegen Claude Code).
- Ein selbst gemachtes Curriculum kann trotzdem gehackt werden
- Der Text definiert einen eigenen Harness-Reward für Aufgabenpassung, Reward-Treue und Hack-Resistenz. Eval-Fußnoten: SWE-bench ohne Git-Historie und Netz, NL2Repo mit gesperrten Repos und pip. Das sind ihre Kontrollen, kein Beweis der Unspielbarkeit.
- Offen ist der Checkpoint, nicht die volle Trainingsrechnung
- Gewichte, Serving-Notizen und Quants wurden veröffentlicht. Rechen- und Datenspuren des Selbstcurriculums stehen nicht als reproduzierbares Budget.
Fragen zum Gegenprüfen
Ist Ornith-1.5 ein Basismodell von null?
Der Text sagt, 1.5 erweitere 1.0, und 1.0 habe auf Qwen3.5 und Gemma 4 continued, mid- und post-trainiert. Es ist kein unabhängiges Pretrain.
Schlägt die 397B schon Claude Opus 4.8?
Die Autoren beanspruchen Führung unter offenen Modellen ähnlicher Größe und „on par“ mit Opus auf zwei Agenten-Benches. Terminus-2 liegt darüber, DeepSWE darunter. Keine unabhängige Volltabellen-Wiederholung.
Läuft das 9B wirklich auf dem Telefon?
Offizialtext und GIGAZINE beschreiben ein 9B-Mobile-Quant für iPhone und Android. Gerät-RAM und Tempo stehen nicht als einheitliche Bank. Prüfbar ist das Quant-Paket, nicht dass jedes Telefon die 397B flüssig fährt.