2026 Gemini 3.7 Flash란: AA-AnalystAgent 1위와 pass^5

8월 19일 Google이 독립 스프레드시트 에이전트 보드를 알렸다. AA 숫자와 제품글을 가른다.

2026년 8월 19일 Google 공식 계정이 독립 리더보드를 알렸다. 더 빠르고 싼 Flash 급이 표·문서 에이전트 벤치에서 1위를 차지하고 플래그십으로 여겨진 폐쇄 모델 여럿을 앞섰다.

대상은 Gemini 3.7 Flash다. Artificial Analysis의 AA-AnalystAgent는 pass^5로, 같은 문항을 다섯 번 돌려 다섯 번 모두 맞아야 통과다. 아래는 AA 보드, 8월 13일 AA 글, Google 제품글, OfficeChai 요약이며 Flash가 Opus나 GPT를 전반적으로 앞섰다고 쓰지 않는다.

8월 13일: 3.7 Flash 출시, AA가 AnalystAgent 60%를 이미 기록8월 19일: NewsFromGoogle이 1위 게시8월 21일: 단독 보드는 여전히 Flash (high) 1위

무엇을 측정하나

AA는 업무/데이터 분석가가 보면 할 정량 문제라고 쓴다. 80문항, 14개 비즈니스·과학 영역이며 각 문항은 실제 표와 문서 폴더에 묶이고 정제 데이터셋이 아니다. 문항과 정답은 소수 예시 외 비공개로 오염을 줄인다. 성적은 단독 보드이며 Intelligence Index에 들어가지 않는다.

60%
AA: Flash (high) pass^5
53.8%
2위: Claude Opus 5 (max)
80
문항 수. 각 5회

확인할 수 있는 표현

  1. 1

    출시일은 8월 13일, 확산은 19일

    Google의 Introducing Gemini 3.7 Flash는 8월 13일자로 3.6 Flash 약 3주 뒤, coding and agents workhorse라고 썼다. AA 같은 날 글은 AnalystAgent (high) 60%를 이미 적었다. NewsFromGoogle은 8월 19일 1위와 다른 상위 대비 60%–90% 빠름, 2.4배를 썼다.

  2. 2

    이 보드에서 Flash가 여러 플래그십보다 위

    AA는 Flash (high) 60.0%, Claude Opus 5 (max) 53.8%, GPT-5.5 (xhigh) 50.0%. OfficeChai는 Fable 5 48.8%, GPT-5.6 Sol 47.5%, Grok 4.6 41.3%, Kimi K3 38.8%도 적었다. 이 벤치지 총지수 뒤집기가 아니다.

  3. 3

    일반 지능 지수에서는 1위가 아니다

    AA 8월 13일: Flash (high) Intelligence Index는 56으로 Terra와 Muse Spark 1.2의 57보다 낮고 Sonnet 5의 55보다 높다. Time per Task 평균 1.7로 Terra (max)보다 약 40% 빠르며 지능 대 시간 파레토 전선에 있다.

01

Google도 속도와 가격을 판다

제품글은 연말까지 도입가 input $0.75, output $3.75/100만 토큰, 2027년 1월 1일부터 $1.50/$7.50. AA 모델 페이지는 1M 컨텍스트와 같은 input 가격. 가격은 정가지 이 벤치의 변수가 아니다.

02

AA는 다른 에이전트 보드도 냈다

8월 13일 글은 AutomationBench-AA(모의 SaaS)에서 Flash (high) 62.7%, Kimi K3 53%, GPT-5.6 Sol 51.2%라고 쓴다. 다른 세트이며 「모든 곳에서 1위」로 접으면 안 된다.

03

문항은 비공개라 재현이 제한된다

AA는 문항과 정답을 비공개라고 쓴다. 확인할 수 있는 것은 독립 랩 프로토콜의 pass^5이지 공유 폴더 재실행이 아니다. 오염은 줄고 외부 감사는 더 어렵다.

표현대조 출처읽는 법
3.7 Flash 8월 13일 출시Google 제품글; AA 모델 페이지출시일. 19일 출시가 아님
AnalystAgent pass^5: 60.0%/53.8%/50.0%AA 보드; OfficeChai이 벤치 1위. 총지수 아님
가장 가까운 정확도 상대의 2.4배NewsFromGoogle 8월 19일(OfficeChai 경유)회사 확산. AA는 Time per Task 1.7도 적음

OfficeChai는 Flash가 Intelligence Index 선두가 아니지만 「지저분한 문서에서 같은 방어 가능한 숫자를 다섯 번 뽑는」 점에서는 현재 가장 강한 공개 성적라고 썼다. 논평이지 AA가 AnalystAgent를 총지수에 넣은 것이 아니다.

# AA-AnalystAgent (reported 2026)
80 tasks × 14 domains
pass^5 = correct on 5/5 runs
Gemini 3.7 Flash (high)  60.0%
Claude Opus 5 (max)      53.8%
GPT-5.5 (xhigh)          50.0%

읽는 법과 경계

전문 에이전트 보드 ≠ 플래그십이 폐기됨
3.7 Flash는 이름상 아직 Pro 아래다. Google도 workhorse라고 썼다. AnalystAgent 1위가 코딩·사이버·채팅 총보드 1위를 자동으로 뜻하지 않는다.
pass^5가 높아도 약 2/5는 다섯 번 중 한 번은 틀린다
60%는 약 32/80문항이 다섯 번 모두 맞음. AA는 1회 정확도를 같은 헤드라인으로 내지 않는다. 「분석 일의 60%가 무인」으로 읽으면 안 된다.
속도에는 두 가지 프레이밍이 있다
Google은 60%–90% 빠름과 2.4×. AA는 Terra 대비 Time per Task. 둘 다 같은 80문항의 제3자 공증 스톱워치가 아니다.

확인하고 싶은 질문

Gemini가 Opus와 GPT를 전반적으로 앞섰나?

아니다. AA 자체 Intelligence Index는 Flash (high)를 56으로 두고 Terra와 Muse Spark 1.2의 57보다 낮다. 확인할 수 있는 것은 AnalystAgent와 AutomationBench-AA 순위다.

pass^5는 보통 정확도와 어떻게 다른가?

AA는 다섯 번 모두 맞아야 분자에 넣는다고 쓴다. 한 번의 행운은 헤드라인을 거의 올리지 않는다. 세트는 비공개라 외부는 같은 폴더로 다시 계산할 수 없다.

3.7 Flash는 언제 나왔고 얼마인가?

Google 글은 8월 13일, 도입가 $0.75/$3.75 per million tokens를 2026년 말까지, 2027년 1월 1일부터 $1.50/$7.50. AA 모델 페이지도 2026년 8월 13일. 지역과 제품 입구는 공식 페이지를 따른다.

무료로 회의 시작