2026 Gemini 3.7 Flash란: AA-AnalystAgent 1위와 pass^5
8월 19일 Google이 독립 스프레드시트 에이전트 보드를 알렸다. AA 숫자와 제품글을 가른다.
2026년 8월 19일 Google 공식 계정이 독립 리더보드를 알렸다. 더 빠르고 싼 Flash 급이 표·문서 에이전트 벤치에서 1위를 차지하고 플래그십으로 여겨진 폐쇄 모델 여럿을 앞섰다.
대상은 Gemini 3.7 Flash다. Artificial Analysis의 AA-AnalystAgent는 pass^5로, 같은 문항을 다섯 번 돌려 다섯 번 모두 맞아야 통과다. 아래는 AA 보드, 8월 13일 AA 글, Google 제품글, OfficeChai 요약이며 Flash가 Opus나 GPT를 전반적으로 앞섰다고 쓰지 않는다.
무엇을 측정하나
AA는 업무/데이터 분석가가 보면 할 정량 문제라고 쓴다. 80문항, 14개 비즈니스·과학 영역이며 각 문항은 실제 표와 문서 폴더에 묶이고 정제 데이터셋이 아니다. 문항과 정답은 소수 예시 외 비공개로 오염을 줄인다. 성적은 단독 보드이며 Intelligence Index에 들어가지 않는다.
확인할 수 있는 표현
- 1
출시일은 8월 13일, 확산은 19일
Google의 Introducing Gemini 3.7 Flash는 8월 13일자로 3.6 Flash 약 3주 뒤, coding and agents workhorse라고 썼다. AA 같은 날 글은 AnalystAgent (high) 60%를 이미 적었다. NewsFromGoogle은 8월 19일 1위와 다른 상위 대비 60%–90% 빠름, 2.4배를 썼다.
- 2
이 보드에서 Flash가 여러 플래그십보다 위
AA는 Flash (high) 60.0%, Claude Opus 5 (max) 53.8%, GPT-5.5 (xhigh) 50.0%. OfficeChai는 Fable 5 48.8%, GPT-5.6 Sol 47.5%, Grok 4.6 41.3%, Kimi K3 38.8%도 적었다. 이 벤치지 총지수 뒤집기가 아니다.
- 3
일반 지능 지수에서는 1위가 아니다
AA 8월 13일: Flash (high) Intelligence Index는 56으로 Terra와 Muse Spark 1.2의 57보다 낮고 Sonnet 5의 55보다 높다. Time per Task 평균 1.7로 Terra (max)보다 약 40% 빠르며 지능 대 시간 파레토 전선에 있다.
Google도 속도와 가격을 판다
제품글은 연말까지 도입가 input $0.75, output $3.75/100만 토큰, 2027년 1월 1일부터 $1.50/$7.50. AA 모델 페이지는 1M 컨텍스트와 같은 input 가격. 가격은 정가지 이 벤치의 변수가 아니다.
AA는 다른 에이전트 보드도 냈다
8월 13일 글은 AutomationBench-AA(모의 SaaS)에서 Flash (high) 62.7%, Kimi K3 53%, GPT-5.6 Sol 51.2%라고 쓴다. 다른 세트이며 「모든 곳에서 1위」로 접으면 안 된다.
문항은 비공개라 재현이 제한된다
AA는 문항과 정답을 비공개라고 쓴다. 확인할 수 있는 것은 독립 랩 프로토콜의 pass^5이지 공유 폴더 재실행이 아니다. 오염은 줄고 외부 감사는 더 어렵다.
| 표현 | 대조 출처 | 읽는 법 |
|---|---|---|
| 3.7 Flash 8월 13일 출시 | Google 제품글; AA 모델 페이지 | 출시일. 19일 출시가 아님 |
| AnalystAgent pass^5: 60.0%/53.8%/50.0% | AA 보드; OfficeChai | 이 벤치 1위. 총지수 아님 |
| 가장 가까운 정확도 상대의 2.4배 | NewsFromGoogle 8월 19일(OfficeChai 경유) | 회사 확산. AA는 Time per Task 1.7도 적음 |
OfficeChai는 Flash가 Intelligence Index 선두가 아니지만 「지저분한 문서에서 같은 방어 가능한 숫자를 다섯 번 뽑는」 점에서는 현재 가장 강한 공개 성적라고 썼다. 논평이지 AA가 AnalystAgent를 총지수에 넣은 것이 아니다.
# AA-AnalystAgent (reported 2026)
80 tasks × 14 domains
pass^5 = correct on 5/5 runs
Gemini 3.7 Flash (high) 60.0%
Claude Opus 5 (max) 53.8%
GPT-5.5 (xhigh) 50.0%읽는 법과 경계
- 전문 에이전트 보드 ≠ 플래그십이 폐기됨
- 3.7 Flash는 이름상 아직 Pro 아래다. Google도 workhorse라고 썼다. AnalystAgent 1위가 코딩·사이버·채팅 총보드 1위를 자동으로 뜻하지 않는다.
- pass^5가 높아도 약 2/5는 다섯 번 중 한 번은 틀린다
- 60%는 약 32/80문항이 다섯 번 모두 맞음. AA는 1회 정확도를 같은 헤드라인으로 내지 않는다. 「분석 일의 60%가 무인」으로 읽으면 안 된다.
- 속도에는 두 가지 프레이밍이 있다
- Google은 60%–90% 빠름과 2.4×. AA는 Terra 대비 Time per Task. 둘 다 같은 80문항의 제3자 공증 스톱워치가 아니다.
확인하고 싶은 질문
Gemini가 Opus와 GPT를 전반적으로 앞섰나?
아니다. AA 자체 Intelligence Index는 Flash (high)를 56으로 두고 Terra와 Muse Spark 1.2의 57보다 낮다. 확인할 수 있는 것은 AnalystAgent와 AutomationBench-AA 순위다.
pass^5는 보통 정확도와 어떻게 다른가?
AA는 다섯 번 모두 맞아야 분자에 넣는다고 쓴다. 한 번의 행운은 헤드라인을 거의 올리지 않는다. 세트는 비공개라 외부는 같은 폴더로 다시 계산할 수 없다.
3.7 Flash는 언제 나왔고 얼마인가?
Google 글은 8월 13일, 도입가 $0.75/$3.75 per million tokens를 2026년 말까지, 2027년 1월 1일부터 $1.50/$7.50. AA 모델 페이지도 2026년 8월 13일. 지역과 제품 입구는 공식 페이지를 따른다.