DeepSeek V4-Flash-Vision-Exp란: 2026 오픈 가중치와 평가
DeepSeek가 첫 V4 시각 체크포인트를 공개했다. 자체 점수는 Opus-4.8과 갈리고, 독립 랩 재현은 아직 없다.
봄 이후 V4는 코드를 쓸 수 있었지만 그림은 못 봤다. 8월 31일 DeepSeek는 시각 체크포인트 가중치를 MIT로 Hugging Face에 올렸다.
검색어는 DeepSeek V4-Flash-Vision-Exp. 텍스트 뼈대는 V4-Flash-0731, 약 3050억 파라미터 희소 MoE. 아래는 TechTimes(2026-09-01)와 모델 카드·표의 대조다. 자체 숫자를 독립 재현으로 다루지 않는다.
가중치에 더해진 것
뼈대는 약 2840억 희소 MoE, 스텝당 약 130억 활성, 43층, 은닉 4096, 백만 토큰 문맥. 256 전문가 중 6개와 공유 전문가. 시각은 32층·1024차원·16헤드, 14×14 패치를 4096으로 맞추고 이미지당 최대 384토큰(과금 한도와 같음). 두 모듈이 약 210억을 더한다.
자체 표를 읽는 법
- 1
하니스는 닫혀 있다
V4-Flash-0731·Opus-4.8 비교는 Harness Minimal Mode, 최대 추론, 온도 1.0, top_p 0.95. 코드 미공개라 외부 랩은 같은 설정을 아직 못 돌린다.
- 2
Opus-4.8과의 갈림
11중 3승: DeepSWE 59.3 대 58.0, Agents' Last Exam 27.3 대 25.7, ZeroBench Pass@5 35.0 대 34.0. Terminal Bench 2.1, Toolathlon-Verified, Chartography는 약 1점 차. NL2Repo 57.7 대 69.7, DSBench-Hard 63.6 대 71.7. 각주: 텍스트 베이스라인은 ApexBench와 Agents' Last Exam에서 멀티모달 입력을 무시한다.
- 3
텍스트는 무너지지 않았다
공식은 텍스트 전용 에이전트에서 「비슷하다」고 쓴다. 표에서는 텍스트 7항 중 6에서 0731을 앞선다(Toolathlon-Verified +5.6, DeepSWE +4.9). Cybergym만 후퇴(75.3 대 76.7). 선례: yage.ai는 V4-Pro 공식 SWE-bench Verified 80.6%를 더 엄한 DeepSWE에서 약 8% pass@1로 떨어뜨렸다. 이번 59.3도 엄한 스위트지만 자체 보고다.
Exp는 생산 안정판이 아니다
DeepSeek는 평가 중인 체크포인트에 Exp를 붙인다. 텍스트 Flash 생산판은 V4-Flash-0731. 안정 시각판이나 FP4 전문가 여부는 미발표.
호스트와 자체 호스트는 위험이 다르다
api.deepseek.com의 프롬프트와 이미지는 중국 서버를 지난다. MIT 가중치 자체 호스트는 그 유출을 끊는다. 이 가중치의 독립 보안 감사는 공개 시점 기준 이름이 인용되지 않았다. Guidelight와 같이 출처에 숫자가 있을 때만 숫자를 쓴다.
| 표현 | 대조 출처 | 읽는 법 |
|---|---|---|
| MIT 약 305B 시각 MoE | Hugging Face 카드 / TechTimes 2026-09-01 | 자체 호스트 가능, 하드웨어가 문 |
| Opus-4.8 대비 11중 3승 | DeepSeek 자체 하니스 | 자체 보고이지 독립 재현이 아님 |
| API 8/21, 가중치 8/31 | OpenRouter / 카드 타임라인 | 10일 관측 창. 0731 당일 공개와 다름 |
TechTimes: 멀티 GPU 청구가 값어치인지는 랩 자체 하니스에 달렸고, 독립 랩은 아직 재현하지 않았다.
# DeepSeek-V4-Flash-Vision-Exp
# weights: 2026-08-31 API: 2026-08-21
id: deepseek-v4-flash-vision-exp
license: MIT
params: ~305B sparse MoE (vision tower + 284B text)
harness: unpublished Harness Minimal Mode
independent_repro: none as of 2026-09-02읽는 법과 경계
- MIT ≠ 단일 GPU 장난감
- 상업 사용과 파인튠은 허용. VRAM과 멀티 GPU가 실제 문. 카드 예에 4×GB300 vLLM이 있다.
- 자체 리드 ≠ 범용 시각 왕관
- 스위트는 소프트웨어 에이전트와 차트 쪽. 장거리 합성은 여전히 Opus-4.8에 뒤진다.
- 회의 제품 설명이 아니다
- 공개와 평가만. 짧은 보드가 필요하면 wbmeet와 방 만들기.
확인하고 싶은 질문
텍스트 V4-Flash-0731과 뭐가 다른가?
텍스트 뼈대는 같다. 시각 인코더와 정렬 층을 더해 총 약 305B. Vision-Exp는 전부 FP8, 0731은 전문가 FP4 가능. Cybergym은 텍스트 베이스라인보다 약간 낮다.
왜 표를 리더보드로 안 보나?
하니스 미공개. 일부 멀티모달 비교에서 텍스트 베이스라인이 이미지를 무시한다. 독립 재현은 아직 없다.
GLM-5.3-Flash와 어떻게 나란히 보나?
둘 다 MIT, 3000억대 멀티모달 MoE. GLM 가중치는 8월 25일. DeepSeek는 API 먼저. 시퀀스가 다르다.
민감 데이터를 호스트 API에 보내도 되나?
규제 업무에서는 보통 안 된다. 중국 서버를 지난다. MIT 가중치 자체 호스트는 유출을 끊지만 독립 보안 감사와는 다르다.