2026 Gemini 3.7 Flash是什么:AA-AnalystAgent第一与pass^5全解析

8月19日 Google 转发独立表格分析榜。下文按 AA 榜、AA 评测文与 Google 博文分开能核对的数字。

2026 年 8 月 19 日,Google 官方账号转发一份独立评测:自家定位为「更快更便宜」的 Flash 档,在表格与文档分析代理基准上排到第一,压过若干被当作旗舰的闭源模型。

核心对象是 Gemini 3.7 Flash。Artificial Analysis 的 AA-AnalystAgent 用 pass^5:同一题跑五次,必须五次都对才算过。下文只整理 AA 榜、AA 8 月 13 日评测文、Google 8 月 13 日产品博文与 OfficeChai 转述,不写成「Flash 已全面超过 Opus / GPT」。

8 月 13 日:3.7 Flash 发布,AA 已报 AnalystAgent 60% 8 月 19 日:NewsFromGoogle 转发榜首 8 月 21 日:独立榜仍把 Flash (high) 放在第一

测的是什么

AA 写:基准针对业务/数据分析师日常会碰到的定量问题,共 80 题、14 个商务与科学域,每题绑一文件夹真实表格与文档,而不是洗过的干净数据集。题集和标准答案除少量示例外不公开,以降低训练污染;成绩单独成榜,不并入 Intelligence Index。

60%
官方 AA:Flash (high) pass^5
53.8%
同榜第二:Claude Opus 5 (max)
80
题数;每题 5 次

能核对的几条口径

  1. 1

    产品日是 8 月 13 日,传播高峰在 19 日

    Google 博文 Introducing Gemini 3.7 Flash 写 8 月 13 日发布,称距 3.6 Flash 约三周,定位「coding and agents」的 workhorse。AA 同日文已写 AnalystAgent (high) 60%。NewsFromGoogle 8 月 19 日发帖称榜首,并写比其他头部模型快 60%–90%、比「最接近的准确率对手」快 2.4 倍

  2. 2

    这张榜上 Flash 高于若干旗舰

    AA 榜写 Flash (high) 60.0%,随后是 Claude Opus 5(Adaptive Reasoning, Max Effort)53.8%、GPT-5.5 (xhigh) 50.0%。OfficeChai 另列 Claude Fable 5(fallback)48.8%、GPT-5.6 Sol (max) 47.5%、Grok 4.6 41.3%、Kimi K3 38.8%。这是该基准,不是总榜翻盘。

  3. 3

    总智力指数上它并不是第一

    AA 8 月 13 日文:Flash (high) 的 Intelligence Index 为 56,落后 GPT-5.6 Terra (max) 与 Muse Spark 1.2 (xhigh) 的 57,略高于 Claude Sonnet 5 的 55。同文写平均 Time per Task 1.7,比 Terra (max) 快约 40%,落在「智力对耗时」帕累托前沿。

01

Google 自己也在推速度叙事

产品博文写 introductory 价到年底:每百万 input $0.75、output $3.75,并写 2027 年 1 月 1 日起改为 $1.50 / $7.50。AA 模型页写 1M context,input 价与博文一致。价格是官方标价,不是本次基准的自变量。

02

AA 还报了另一张代理榜

AA 8 月 13 日文写 Flash (high) 在 AutomationBench-AA(模拟 SaaS 环境的智能体)得 62.7%,高于 Kimi K3 (max) 53% 与 GPT-5.6 Sol (max) 51.2%。这与 AnalystAgent 是两套题,不宜混成「全面第一」。

03

题不公开,复现空间有限

AA 写题集与参考答案私下保存。能核对的是独立实验室按自有协议跑出的 pass^5,不是每家实验室都能拿同一文件夹重跑。污染风险被刻意压低,外部审计也更难。

说法能核对的来源读法
3.7 Flash 8 月 13 日发布Google 产品博文;AA 模型页产品日,不是 19 日才上市
AnalystAgent pass^5:60.0% / 53.8% / 50.0%AA 榜;OfficeChai 转述该基准第一,不是总智力第一
比最接近对手快 2.4 倍NewsFromGoogle 8 月 19 日(经 OfficeChai)公司传播口径,AA 另报 1.7 Time per Task

OfficeChai 写:Flash 在 Intelligence Index 上不是领袖,但在「从messy文档里五次抽出同一个站得住的数字」上目前公布成绩最强。这是评论,不是 AA 把 AnalystAgent 并进总指数。

# AA-AnalystAgent (reported 2026)
80 tasks × 14 domains
pass^5 = correct on 5/5 runs
Gemini 3.7 Flash (high)  60.0%
Claude Opus 5 (max)      53.8%
GPT-5.5 (xhigh)          50.0%

读法与边界

单项代理榜 ≠ 旗舰已被取代
3.7 Flash 在命名上仍低于 Pro。Google 博文也把它写成 workhorse,不是下一版前沿总模型。AnalystAgent 第一不自动等于编码、网络或聊天总榜第一。
pass^5 高,仍有四成题五次里至少错一次
60% 意味着约 32/80 题五次全对。AA 没有在公开页把「一次做对率」写成同一主指标。不宜读成「分析师工作已有六成可无人值守」。
速度数字有两套口径
Google 社媒写 60%–90% 更快与 2.4×。AA 写相对 Terra 的 Time per Task。两者都不是现场秒表对同一套 80 题的第三方公证赛。

还想核对的问题

这是不是说 Gemini 已经重新领先 Opus 和 GPT?

不是。AA 自己的 Intelligence Index 仍把 Flash (high) 写在 56,低于 Terra 与 Muse Spark 1.2 的 57。能核对的是 AnalystAgent 与 AutomationBench-AA 两张专项榜上的名次。

pass^5 和普通准确率有何不同?

AA 写:不是跑一次就计分,而是五次全对才计入分子。一次幸运做对、其余做错,对 pass^5 几乎没有帮助。题集保密,外部无法用同一文件夹复算。

3.7 Flash 什么时候上市、多少钱?

Google 博文写 8 月 13 日,introductory 价 $0.75 / $3.75 每百万 token,到 2026 年底;2027 年 1 月 1 日起 $1.50 / $7.50。AA 模型页写 2026 年 8 月 13 日发布。具体地区与产品入口以官方页为准。

免费开始开会