2026 Gemini 3.7 Flash是什么:AA-AnalystAgent第一与pass^5全解析
8月19日 Google 转发独立表格分析榜。下文按 AA 榜、AA 评测文与 Google 博文分开能核对的数字。
2026 年 8 月 19 日,Google 官方账号转发一份独立评测:自家定位为「更快更便宜」的 Flash 档,在表格与文档分析代理基准上排到第一,压过若干被当作旗舰的闭源模型。
核心对象是 Gemini 3.7 Flash。Artificial Analysis 的 AA-AnalystAgent 用 pass^5:同一题跑五次,必须五次都对才算过。下文只整理 AA 榜、AA 8 月 13 日评测文、Google 8 月 13 日产品博文与 OfficeChai 转述,不写成「Flash 已全面超过 Opus / GPT」。
测的是什么
AA 写:基准针对业务/数据分析师日常会碰到的定量问题,共 80 题、14 个商务与科学域,每题绑一文件夹真实表格与文档,而不是洗过的干净数据集。题集和标准答案除少量示例外不公开,以降低训练污染;成绩单独成榜,不并入 Intelligence Index。
能核对的几条口径
- 1
产品日是 8 月 13 日,传播高峰在 19 日
Google 博文 Introducing Gemini 3.7 Flash 写 8 月 13 日发布,称距 3.6 Flash 约三周,定位「coding and agents」的 workhorse。AA 同日文已写 AnalystAgent (high) 60%。NewsFromGoogle 8 月 19 日发帖称榜首,并写比其他头部模型快 60%–90%、比「最接近的准确率对手」快 2.4 倍。
- 2
这张榜上 Flash 高于若干旗舰
AA 榜写 Flash (high) 60.0%,随后是 Claude Opus 5(Adaptive Reasoning, Max Effort)53.8%、GPT-5.5 (xhigh) 50.0%。OfficeChai 另列 Claude Fable 5(fallback)48.8%、GPT-5.6 Sol (max) 47.5%、Grok 4.6 41.3%、Kimi K3 38.8%。这是该基准,不是总榜翻盘。
- 3
总智力指数上它并不是第一
AA 8 月 13 日文:Flash (high) 的 Intelligence Index 为 56,落后 GPT-5.6 Terra (max) 与 Muse Spark 1.2 (xhigh) 的 57,略高于 Claude Sonnet 5 的 55。同文写平均 Time per Task 1.7,比 Terra (max) 快约 40%,落在「智力对耗时」帕累托前沿。
Google 自己也在推速度叙事
产品博文写 introductory 价到年底:每百万 input $0.75、output $3.75,并写 2027 年 1 月 1 日起改为 $1.50 / $7.50。AA 模型页写 1M context,input 价与博文一致。价格是官方标价,不是本次基准的自变量。
AA 还报了另一张代理榜
AA 8 月 13 日文写 Flash (high) 在 AutomationBench-AA(模拟 SaaS 环境的智能体)得 62.7%,高于 Kimi K3 (max) 53% 与 GPT-5.6 Sol (max) 51.2%。这与 AnalystAgent 是两套题,不宜混成「全面第一」。
题不公开,复现空间有限
AA 写题集与参考答案私下保存。能核对的是独立实验室按自有协议跑出的 pass^5,不是每家实验室都能拿同一文件夹重跑。污染风险被刻意压低,外部审计也更难。
| 说法 | 能核对的来源 | 读法 |
|---|---|---|
| 3.7 Flash 8 月 13 日发布 | Google 产品博文;AA 模型页 | 产品日,不是 19 日才上市 |
| AnalystAgent pass^5:60.0% / 53.8% / 50.0% | AA 榜;OfficeChai 转述 | 该基准第一,不是总智力第一 |
| 比最接近对手快 2.4 倍 | NewsFromGoogle 8 月 19 日(经 OfficeChai) | 公司传播口径,AA 另报 1.7 Time per Task |
OfficeChai 写:Flash 在 Intelligence Index 上不是领袖,但在「从messy文档里五次抽出同一个站得住的数字」上目前公布成绩最强。这是评论,不是 AA 把 AnalystAgent 并进总指数。
# AA-AnalystAgent (reported 2026)
80 tasks × 14 domains
pass^5 = correct on 5/5 runs
Gemini 3.7 Flash (high) 60.0%
Claude Opus 5 (max) 53.8%
GPT-5.5 (xhigh) 50.0%
读法与边界
- 单项代理榜 ≠ 旗舰已被取代
- 3.7 Flash 在命名上仍低于 Pro。Google 博文也把它写成 workhorse,不是下一版前沿总模型。AnalystAgent 第一不自动等于编码、网络或聊天总榜第一。
- pass^5 高,仍有四成题五次里至少错一次
- 60% 意味着约 32/80 题五次全对。AA 没有在公开页把「一次做对率」写成同一主指标。不宜读成「分析师工作已有六成可无人值守」。
- 速度数字有两套口径
- Google 社媒写 60%–90% 更快与 2.4×。AA 写相对 Terra 的 Time per Task。两者都不是现场秒表对同一套 80 题的第三方公证赛。
还想核对的问题
这是不是说 Gemini 已经重新领先 Opus 和 GPT?
不是。AA 自己的 Intelligence Index 仍把 Flash (high) 写在 56,低于 Terra 与 Muse Spark 1.2 的 57。能核对的是 AnalystAgent 与 AutomationBench-AA 两张专项榜上的名次。
pass^5 和普通准确率有何不同?
AA 写:不是跑一次就计分,而是五次全对才计入分子。一次幸运做对、其余做错,对 pass^5 几乎没有帮助。题集保密,外部无法用同一文件夹复算。
3.7 Flash 什么时候上市、多少钱?
Google 博文写 8 月 13 日,introductory 价 $0.75 / $3.75 每百万 token,到 2026 年底;2027 年 1 月 1 日起 $1.50 / $7.50。AA 模型页写 2026 年 8 月 13 日发布。具体地区与产品入口以官方页为准。