2026 Gemini 3.7 Flash是什麼:AA-AnalystAgent第一與pass^5全解析
8月19日 Google 轉發獨立表格分析榜。下文依 AA 榜、AA 評測文與 Google 博文分開能核對的數字。
2026 年 8 月 19 日,Google 官方账号轉發一份獨立評測:自家定位為「更快更便宜」的 Flash 檔,在表格与文檔分析代理基准上排到第一,壓過若干被當作旗舰的闭源模型。
核心对象是 Gemini 3.7 Flash。Artificial Analysis 的 AA-AnalystAgent 用 pass^5:同一题跑五次,必须五次都对才算过。下文只整理 AA 榜、AA 8 月 13 日評測文、Google 8 月 13 日产品博文与 OfficeChai 转述,不寫成「Flash 已全面超过 Opus / GPT」。
測的是什麼
AA 寫:基准針對業務/數據分析師日常會碰到的定量问题,共 80 题、14 個商務與科學域,每题绑一文件夹真实表格与文檔,而不是洗過的乾淨數據集。題集和標準答案除少量示例外不公開,以降低訓練污染;成績單獨成榜,不併入 Intelligence Index。
能核對的幾條口徑
- 1
產品日是 8 月 13 日,傳播高峰在 19 日
Google 博文 Introducing Gemini 3.7 Flash 寫 8 月 13 日發布,稱距 3.6 Flash 约三周,定位「coding and agents」的 workhorse。AA 同日文已寫 AnalystAgent (high) 60%。NewsFromGoogle 8 月 19 日發帖稱榜首,并寫比其他头部模型快 60%–90%、比「最接近的準確率對手」快 2.4 倍。
- 2
這張榜上 Flash 高於若干旗艦
AA 榜寫 Flash (high) 60.0%,隨後是 Claude Opus 5(Adaptive Reasoning, Max Effort)53.8%、GPT-5.5 (xhigh) 50.0%。OfficeChai 另列 Claude Fable 5(fallback)48.8%、GPT-5.6 Sol (max) 47.5%、Grok 4.6 41.3%、Kimi K3 38.8%。這是該基準,不是總榜翻盤。
- 3
總智力指數上它並不是第一
AA 8 月 13 日文:Flash (high) 的 Intelligence Index 為 56,落後 GPT-5.6 Terra (max) 与 Muse Spark 1.2 (xhigh) 的 57,略高於 Claude Sonnet 5 的 55。同文寫平均 Time per Task 1.7,比 Terra (max) 快約 40%,落在「智力對耗時」帕累托前沿。
Google 自己也在推速度敘事
产品博文寫 introductory 價到年底:每百萬 input $0.75、output $3.75,并寫 2027 年 1 月 1 日起改為 $1.50 / $7.50。AA 模型页寫 1M context,input 價與博文一致。價格是官方標價,不是本次基準的自變量。
AA 還報了另一張代理榜
AA 8 月 13 日文寫 Flash (high) 在 AutomationBench-AA(模拟 SaaS 环境的智能体)得 62.7%,高於 Kimi K3 (max) 53% 与 GPT-5.6 Sol (max) 51.2%。這與 AnalystAgent 是兩套題,不宜混成「全面第一」。
題不公開,復現空間有限
AA 寫题集与参考答案私下保存。能核对的是獨立实验室按自有协议跑出的 pass^5,不是每家实验室都能拿同一文件夹重跑。污染風險被刻意壓低,外部審計也更難。
| 說法 | 能核對的來源 | 讀法 |
|---|---|---|
| 3.7 Flash 8 月 13 日發布 | Google 产品博文;AA 模型页 | 產品日,不是 19 日才上市 |
| AnalystAgent pass^5:60.0% / 53.8% / 50.0% | AA 榜;OfficeChai 转述 | 該基準第一,不是總智力第一 |
| 比最接近对手快 2.4 倍 | NewsFromGoogle 8 月 19 日(经 OfficeChai) | 公司傳播口徑,AA 另報 1.7 Time per Task |
OfficeChai 寫:Flash 在 Intelligence Index 上不是领袖,但在「从messy文檔里五次抽出同一个站得住的数字」上目前公布成绩最强。這是評論,不是 AA 把 AnalystAgent 併進總指數。
# AA-AnalystAgent (reported 2026)
80 tasks × 14 domains
pass^5 = correct on 5/5 runs
Gemini 3.7 Flash (high) 60.0%
Claude Opus 5 (max) 53.8%
GPT-5.5 (xhigh) 50.0%
讀法与边界
- 單項代理榜 ≠ 旗艦已被取代
- 3.7 Flash 在命名上仍低於 Pro。Google 博文也把它寫成 workhorse,不是下一版前沿總模型。AnalystAgent 第一不自動等於編碼、網路或聊天總榜第一。
- pass^5 高,仍有四成題五次裡至少錯一次
- 60% 意味著約 32/80 題五次全對。AA 没有在公开页把「一次做对率」寫成同一主指标。不宜讀成「分析師工作已有六成可無人值守」。
- 速度數字有兩套口徑
- Google 社媒寫 60%–90% 更快與 2.4×。AA 寫相对 Terra 的 Time per Task。兩者都不是現場秒表對同一套 80 題的第三方公證賽。
還想核對的問題
這是不是說 Gemini 已經重新領先 Opus 和 GPT?
不是。AA 自己的 Intelligence Index 仍把 Flash (high) 寫在 56,低于 Terra 与 Muse Spark 1.2 的 57。能核对的是 AnalystAgent 与 AutomationBench-AA 两张专项榜上的名次。
pass^5 和普通準確率有何不同?
AA 寫:不是跑一次就計分,而是五次全對才計入分子。一次幸運做對、其餘做錯,對 pass^5 幾乎沒有幫助。題集保密,外部無法用同一資料夾複算。
3.7 Flash 什麼時候上市、多少錢?
Google 博文寫 8 月 13 日,introductory 價 $0.75 / $3.75 每百萬 token,到 2026 年底;2027 年 1 月 1 日起 $1.50 / $7.50。AA 模型页寫 2026 年 8 月 13 日發布。具体地区与产品入口以官方页為准。