2026年 Gemini 3.7 Flashとは:AA-AnalystAgent首位とpass^5

8月19日、Googleが独立の表計算エージェント榜を拡散した。AAの数字と製品投稿を分ける。

2026年8月19日、Googleの公式アカウントは独立評価を拡散した。より速く安いFlash帯が、表と文書のエージェント基準で首位に入り、旗艦扱いの閉源モデルをいくつか上回った。

対象は Gemini 3.7 Flash。Artificial AnalysisのAA-AnalystAgentはpass^5で、同じ問を5回走らせ、5回とも正解したときだけ通る。以下はAA榜、8月13日のAA記事、Googleの製品投稿、OfficeChaiの要約であり、「FlashがOpusやGPTを全面的に超えた」とは書かない。

8月13日:3.7 Flash公開、AAはAnalystAgent 60%を既報8月19日:NewsFromGoogleが首位を投稿8月21日:単独榜はFlash (high)を首位のまま

何を測るか

AAは、業務/データ分析者が日常で出会う定量問題だと書く。80問、14のビジネスと科学領域で、各問は実表と文書のフォルダに結び、洗浄済みデータではない。問題と正答は少数の例を除き非公開で汚染を抑える。成績は単独榜で、Intelligence Indexには入らない

60%
AA:Flash (high) pass^5
53.8%
2位:Claude Opus 5 (max)
80
問数。各5回

照合できる表現

  1. 1

    出荷日は8月13日、拡散は19日

    GoogleのIntroducing Gemini 3.7 Flashは8月13日付で、3.6 Flashの約3週間後、coding and agentsのworkhorseだと書いた。AA同日記事はAnalystAgent (high) 60%を既に書いていた。NewsFromGoogleは8月19日に首位と、他上位より60%–90%速い、2.4倍と書いた。

  2. 2

    この榜ではFlashが複数の旗艦より上

    AAはFlash (high) 60.0%、Claude Opus 5 (max) 53.8%、GPT-5.5 (xhigh) 50.0%。OfficeChaiはFable 5 48.8%、GPT-5.6 Sol 47.5%、Grok 4.6 41.3%、Kimi K3 38.8%も列記。この基準であり総指数の逆転ではない。

  3. 3

    一般知能指数では首位ではない

    AA 8月13日:Flash (high)のIntelligence Indexは56で、TerraとMuse Spark 1.2の57より低く、Sonnet 5の55より高い。Time per Task平均1.7でTerra (max)より約40%速く、知力対時間のパレート前線に乗る。

01

Googleも速度と価格を売る

製品投稿は年末までの導入価格をinput $0.75、output $3.75/100万token、2027年1月1日から$1.50/$7.50と書く。AAモデル頁は1M文脈と同一input価格。価格は定価であり、この基準の変数ではない。

02

AAは別のエージェント榜も出した

8月13日記事はAutomationBench-AA(模擬SaaS)でFlash (high) 62.7%、Kimi K3 53%、GPT-5.6 Sol 51.2%と書く。別セットであり「全面首位」に畳んではならない。

03

問題は非公開で再現は限られる

AAは問題と正答を非公開だと書く。照合できるのは独立ラボのプロトコル下のpass^5であり、共有フォルダの再走ではない。汚染は抑えられ、外部監査は難しい。

言い方照合できる出典読み方
3.7 Flashは8月13日公開Google製品投稿;AAモデル頁出荷日。19日発売ではない
AnalystAgent pass^5:60.0%/53.8%/50.0%AA榜;OfficeChaiこの基準の首位。総指数ではない
最も近い精度对手の2.4倍NewsFromGoogle 8月19日(OfficeChai経由)社の拡散。AAはTime per Task 1.7も書く

OfficeChaiは、FlashはIntelligence Indexの首位ではないが、「messyな文書から同じ防御可能な数字を5回出す」点では現時点で最も強い公表成績だと書いた。評論であり、AAがAnalystAgentを総指数に入れたのではない。

# AA-AnalystAgent (reported 2026)
80 tasks × 14 domains
pass^5 = correct on 5/5 runs
Gemini 3.7 Flash (high)  60.0%
Claude Opus 5 (max)      53.8%
GPT-5.5 (xhigh)          50.0%

読み方と境界

専門エージェント榜 ≠ 旗艦が廃れた
3.7 Flashは名称上まだProの下。Googleもworkhorseと書いた。AnalystAgent首位は編碼・サイバー・会話の総榜首位を自動では意味しない。
pass^5が高くても約4割は5回のうち少なくとも1回失敗
60%は約32/80問が5回全正解。AAは単回正答率を同じ見出しにしていない。「分析者の仕事の6割が無人」とは読めない。
速度には二つの枠がある
Googleは60%–90%速いと2.4×。AAはTerra比のTime per Task。どちらも同一80問の第三者公証ストップウォッチではない。

確認したい問い

GeminiはOpusとGPTを総合でリードしたのか。

違う。AA自身のIntelligence IndexはFlash (high)を56とし、TerraとMuse Spark 1.2の57より低い。照合できるのはAnalystAgentとAutomationBench-AAの順位だ。

pass^5は通常の正答率と何が違うか。

AAは5回全正解のときだけ分子に入れると書く。1回の幸運は見出しをほぼ動かさない。問題は非公開で、外部は同じフォルダで再計算できない。

3.7 Flashはいつ出て、いくらか。

Google投稿は8月13日、導入価格$0.75/$3.75/100万tokenを2026年末まで、2027年1月1日から$1.50/$7.50。AAモデル頁も2026年8月13日。地域と入口は公式頁に従う。

無料で会議を開始