Ornith-1.5 2026: Was 397B-Open-Weights und Selbstcurriculum bedeuten

Ornith-1.5 kam am 19. August mit offenen Gewichten. Hier trennen sich offizielle Zahlen von GIGAZINEs MIT-/Hugging-Face-Notiz.

Am 19. August 2026 legte Ornith drei herunterladbare Open-Weight-Größen vor: ein großes MoE neben den Agentenwerten eines geschlossenen Flaggschiffs, und ein dichtes 9B, das die Autoren auf Telefone quantisieren.

Das Objekt ist Ornith-1.5. Der Offizialblog rahmt Ende-zu-Ende-Selbstverbesserung: das Modell schlägt schwerere Aufgaben vor, schreibt ein aufgabenspezifisches Gerüst und erzeugt Lösungs-Rollouts für RL. Es folgt nur Offizialzahlen plus GIGAZINE — kein Anspruch, ein externes Labor habe einen Opus-Sieg reproduziert.

Ornith-1.0: Selbst-Gerüst 19. August: drei Ornith-1.5-Größen 20. August: GIGAZINE zu MIT / Hugging Face

Was erschien

Der Text sagt, 1.5 erweitere 1.0; 1.0 baue auf Qwen3.5 und Gemma 4 mit Continued Pretraining, Mid- und Post-Training. 1.5 verschiebt die Schleife vom Optimieren von Gerüst und Rollout zum gemeinsamen Optimieren der Aufgabenerzeugung.

397B
Größte MoE-Parameterzahl
86.1
Offiziell: 397B Terminal-Bench 2.1
9B
Dense plus offizielles Mobile-Quant

Prüfbare Angaben

  1. 1

    Die drei Größen sind benannt

    Offiziell: Ornith-1.5-397B (MoE), Ornith-1.5-35B-A3B (MoE, 3B aktiv pro Token), Ornith-1.5-9B (dicht). GIGAZINE nannte zusätzlich Ornith-1.5-9B-Mobile für iPhone und Android.

  2. 2

    397B gegen Opus 4.8 ist gemischt, kein Sweep

    Der Text nennt 86,1 auf Terminal-Bench 2.1 und 56,0 auf DeepSWE, „on par“ mit Opus 4.8 bei 85,0 und 59,0. Terminus-2 liegt darüber, DeepSWE darunter. Gegen GLM-5.2 und DeepSeek-V4-Flash-0731 beanspruchen die Autoren eine Führung unter offenen Modellen ähnlicher Größe.

  3. 3

    Das Curriculum wird erzeugt; Reward hat ein Harttor

    Jeder Zyklus schlägt schwerere Aufgaben vor, schreibt ein Gerüst (Anweisungen, Tools, Zerlegung, Orchestrierung) und erzeugt Rollouts. Aufgabenreward ist Validität V × Frontier-Schwierigkeit D × Neuheit N. V=0 setzt den ganzen Term auf null. Schwierigkeit nutzt die aktuelle Erfolgsrate, Ziel p*=0,2. Alle drei Stufen nutzen GRPO.

01

35B aktiviert wenig und bleibt bei Agentenpunkten hoch

Die Autoren schreiben, 35B-A3B schlage gleich großes Qwen 3.6-35B sowie dichteres Gemma 4-31B und Meta Muse Glimmer-30B: 68,5 gegen 43,4 und 51,7 auf Terminal-Bench 2.1, 79,0 gegen 52,0 und 76,0 auf SWE-bench Verified.

02

9B soll größere dichte Modelle schlagen

9B steht bei 47,0 auf Terminal-Bench 2.1 (Claude Code) und 70,6 auf SWE-bench Verified und soll Gemma 4-31B auf den meisten Tests schlagen. Das ist die Herstellertabelle, kein Dritt-Cluster.

03

Lizenz und Verteilung getrennt lesen

GIGAZINE schrieb MIT und die ornith-ai-Sammlung auf Hugging Face. Der Offizialessay wiederholt die volle Lizenz nicht im selben Absatz. Vor dem Download gilt die Repo-LICENSE.

AussagePrüfbare QuelleLesart
Drei 1.5-Größen am 19. AugustOrnith-Blog; GIGAZINE 20. AugustLieferdatum aus dem Offizialtext
397B TB2.1 86,1 / DeepSWE 56,0Offizielle Tabelle (Fünf-Lauf-Mittel)Hersteller-Eval; kein Opus-Sweep
MIT + Hugging FaceGIGAZINE 20. AugustPressefassung; LICENSE prüfen

Die offizielle Schleife: stärkere Policies erzeugen schwerere, informativere Aufgaben; evolvierende Gerüste holen mehr Fähigkeit; bessere Rollouts liefern das nächste Lernsignal. Methodenclaim, kein externes Audit.

# Official 1.5 loop (2026-08-19)
propose harder tasks
generate / refine scaffold
produce solution rollouts
R_task = V * D(p*=0.2) * N
optimize three stages with GRPO

Lesen und Grenzen

„On par with Opus“ ≠ in jeder Zeile vorn
Auf der eigenen DeepSWE-Spalte liegt 397B hinter Opus 4.8 (56,0 gegen 59,0). Terminal-Bench-Vorsprünge hängen am Harness (Terminus-2 gegen Claude Code).
Ein selbst gemachtes Curriculum kann trotzdem gehackt werden
Der Text definiert einen eigenen Harness-Reward für Aufgabenpassung, Reward-Treue und Hack-Resistenz. Eval-Fußnoten: SWE-bench ohne Git-Historie und Netz, NL2Repo mit gesperrten Repos und pip. Das sind ihre Kontrollen, kein Beweis der Unspielbarkeit.
Offen ist der Checkpoint, nicht die volle Trainingsrechnung
Gewichte, Serving-Notizen und Quants wurden veröffentlicht. Rechen- und Datenspuren des Selbstcurriculums stehen nicht als reproduzierbares Budget.

Fragen zum Gegenprüfen

Ist Ornith-1.5 ein Basismodell von null?

Der Text sagt, 1.5 erweitere 1.0, und 1.0 habe auf Qwen3.5 und Gemma 4 continued, mid- und post-trainiert. Es ist kein unabhängiges Pretrain.

Schlägt die 397B schon Claude Opus 4.8?

Die Autoren beanspruchen Führung unter offenen Modellen ähnlicher Größe und „on par“ mit Opus auf zwei Agenten-Benches. Terminus-2 liegt darüber, DeepSWE darunter. Keine unabhängige Volltabellen-Wiederholung.

Läuft das 9B wirklich auf dem Telefon?

Offizialtext und GIGAZINE beschreiben ein 9B-Mobile-Quant für iPhone und Android. Gerät-RAM und Tempo stehen nicht als einheitliche Bank. Prüfbar ist das Quant-Paket, nicht dass jedes Telefon die 397B flüssig fährt.

Kostenloses Meeting starten