Gemini 3.7 Flash 2026: Was AA-AnalystAgent und 60% pass^5 bedeuten
Google verstärkte am 19. August ein unabhängiges Tabellen-Agenten-Board. Hier trennen sich AA-Zahlen vom Produktpost.
Am 19. August 2026 verstärkte ein Google-Konto ein unabhängiges Board: ein Flash-Modell, als schnellerer günstigerer Workhorse verkauft, lag auf einer Tabellen-und-Dokument-Agentenbank vor mehreren als Flaggschiff geltenden Systemen.
Objekt ist Gemini 3.7 Flash. Artificial Analysis’ AA-AnalystAgent wertet pass^5: jeder Punkt fünfmal, nur alle fünf richtig zählen. Es folgen AA-Board, AA-Notiz vom 13. August, Googles Produktpost und OfficeChai — kein Anspruch, Flash führe Opus oder GPT allgemein.
Was der Test misst
AA schreibt quantitative Fragen eines Business- oder Data-Analysten: 80 Aufgaben in 14 Geschäfts- und Wissenschaftsdomänen, je ein Ordner echter Tabellen und Dokumente, kein gereinigter Satz. Fragen und Schlüssel bleiben bis auf Beispiele privat. Ergebnisse sind ein Solo-Board, nicht im Intelligence Index.
Prüfbare Angaben
- 1
Lieferdatum 13. August; Verstärkung 19. August
Googles Introducing Gemini 3.7 Flash datiert 13. August, etwa drei Wochen nach 3.6 Flash, Workhorse für Coding und Agents. AA nannte AnalystAgent (high) 60% schon am selben Tag. NewsFromGoogle am 19. August: Rang 1, 60%–90% schneller, 2,4× den nächsten Genauigkeitsrivalen.
- 2
Auf diesem Board liegt Flash vor mehreren Flaggschiffen
AA: Flash (high) 60,0%, Opus 5 (max) 53,8%, GPT-5.5 (xhigh) 50,0%. OfficeChai zusätzlich Fable 5 48,8%, GPT-5.6 Sol 47,5%, Grok 4.6 41,3%, Kimi K3 38,8%. Dieses Bench, kein Index-Flip.
- 3
Im allgemeinen Intelligenzindex ist es nicht erste
AA 13. August: Flash (high) 56 im Intelligence Index, hinter Terra und Muse Spark 1.2 (57), knapp vor Sonnet 5 (55). Time per Task 1,7, etwa 40% schneller als Terra (max), Pareto Intelligenz versus Zeit.
Google verkauft auch Tempo und Preis
Der Produktpost: Einführungspreis bis Jahresende $0.75 / 1M Input, $3.75 / 1M Output, ab 1. Januar 2027 $1.50 / $7.50. AA-Modellseite: 1M Kontext, gleicher Inputpreis. Listenpreis, keine Bench-Variable.
AA nannte ein zweites Agenten-Board
13. August: Flash (high) führt AutomationBench-AA (simuliertes SaaS) mit 62,7%, vor Kimi K3 53% und GPT-5.6 Sol 51,2%. Anderer Satz. Nicht zu „überall erste“ falten.
Items bleiben privat, Reproduktion begrenzt
AA hält Fragensatz und Schlüssel privat. Prüfbar ist pass^5 unter dem Laborprotokoll, kein geteilter Ordner. Weniger Kontamination, schwereres Außen-Audit.
| Aussage | Prüfbare Quelle | Lesart |
|---|---|---|
| 3.7 Flash am 13. August | Google-Produktpost; AA-Modellseite | Lieferdatum, kein Start am 19. |
| AnalystAgent pass^5: 60,0% / 53,8% / 50,0% | AA-Board; OfficeChai | Erste hier, nicht im Gesamtindex |
| 2,4× nächster Genauigkeitsrivale | NewsFromGoogle 19. August (via OfficeChai) | Firmenverstärkung; AA nennt auch 1,7 Time per Task |
OfficeChai schrieb: Flash führt den Intelligence Index nicht, hat aber derzeit den stärksten veröffentlichten Anspruch, dieselbe verteidigbare Zahl fünfmal aus unordentlichen Dokumenten zu ziehen. Kommentar, nicht Index-Aufnahme.
# AA-AnalystAgent (reported 2026)
80 tasks × 14 domains
pass^5 = correct on 5/5 runs
Gemini 3.7 Flash (high) 60.0%
Claude Opus 5 (max) 53.8%
GPT-5.5 (xhigh) 50.0%Lesen und Grenzen
- Spezial-Agentenboard ≠ Flaggschiff obsolet
- 3.7 Flash bleibt unter Pro. Google nannte es Workhorse. AnalystAgent-Erste gewinnt nicht automatisch Coding-, Cyber- oder Chat-Boards.
- Hohes pass^5 verfehlt weiter etwa zwei Fünftel
- 60% sind etwa 32 von 80 Aufgaben fünfmal richtig. AA macht Single-Run nicht zur gleichen Headline. Nicht lesen als „60% der Analystenjobs unbeaufsichtigt“.
- Tempo hat zwei Rahmungen
- Google: 60%–90% schneller und 2,4×. AA: Time per Task gegen Terra. Keines ist eine beglaubigte Stoppuhr auf denselben 80 Aufgaben.
Fragen zum Gegenprüfen
Führt Gemini jetzt Opus und GPT insgesamt?
Nein. AA listet Flash (high) im Intelligence Index bei 56, hinter Terra und Muse Spark 1.2 (57). Prüfbar ist der Rang auf AnalystAgent und AutomationBench-AA.
Worin unterscheidet sich pass^5 von gewöhnlicher Genauigkeit?
AA zählt nur, wenn alle fünf Versuche sitzen. Ein Glückstreffer hebt die Headline kaum. Der Satz ist privat, Außenstehende können ihn nicht aus denselben Ordnern neu rechnen.
Wann kam 3.7 Flash, zu welchem Preis?
Google: 13. August, Einführungspreis $0.75 / $3.75 je Million Token bis Ende 2026, ab 1. Januar 2027 $1.50 / $7.50. AA-Modellseite ebenfalls 13. August 2026. Regionen folgen den Offizialseiten.