DeepSeek V4-Flash-Vision-Exp란: 2026 오픈 가중치와 평가

DeepSeek가 첫 V4 시각 체크포인트를 공개했다. 자체 점수는 Opus-4.8과 갈리고, 독립 랩 재현은 아직 없다.

봄 이후 V4는 코드를 쓸 수 있었지만 그림은 못 봤다. 8월 31일 DeepSeek는 시각 체크포인트 가중치를 MIT로 Hugging Face에 올렸다.

검색어는 DeepSeek V4-Flash-Vision-Exp. 텍스트 뼈대는 V4-Flash-0731, 약 3050억 파라미터 희소 MoE. 아래는 TechTimes(2026-09-01)와 모델 카드·표의 대조다. 자체 숫자를 독립 재현으로 다루지 않는다.

8월 21일: API8월 25일: GLM-5.3-Flash 가중치8월 31일: Vision-Exp 가중치

가중치에 더해진 것

뼈대는 약 2840억 희소 MoE, 스텝당 약 130억 활성, 43층, 은닉 4096, 백만 토큰 문맥. 256 전문가 중 6개와 공유 전문가. 시각은 32층·1024차원·16헤드, 14×14 패치를 4096으로 맞추고 이미지당 최대 384토큰(과금 한도와 같음). 두 모듈이 약 210억을 더한다.

305B
희소 MoE 총 파라미터(시각 타워 포함)
10
API만 열린 창
0
이름 있는 독립 재현

자체 표를 읽는 법

  1. 1

    하니스는 닫혀 있다

    V4-Flash-0731·Opus-4.8 비교는 Harness Minimal Mode, 최대 추론, 온도 1.0, top_p 0.95. 코드 미공개라 외부 랩은 같은 설정을 아직 못 돌린다.

  2. 2

    Opus-4.8과의 갈림

    11중 3승: DeepSWE 59.3 대 58.0, Agents' Last Exam 27.3 대 25.7, ZeroBench Pass@5 35.0 대 34.0. Terminal Bench 2.1, Toolathlon-Verified, Chartography는 약 1점 차. NL2Repo 57.7 대 69.7, DSBench-Hard 63.6 대 71.7. 각주: 텍스트 베이스라인은 ApexBench와 Agents' Last Exam에서 멀티모달 입력을 무시한다.

  3. 3

    텍스트는 무너지지 않았다

    공식은 텍스트 전용 에이전트에서 「비슷하다」고 쓴다. 표에서는 텍스트 7항 중 6에서 0731을 앞선다(Toolathlon-Verified +5.6, DeepSWE +4.9). Cybergym만 후퇴(75.3 대 76.7). 선례: yage.ai는 V4-Pro 공식 SWE-bench Verified 80.6%를 더 엄한 DeepSWE에서 약 8% pass@1로 떨어뜨렸다. 이번 59.3도 엄한 스위트지만 자체 보고다.

01

평가면이 좁다

측정은 에이전트와 차트이며 넓은 VQA·OCR·과학 시각이 아니다. 소프트웨어 파이프라인에는 유용하고 「볼 수 있나」 일반 주장에는 얇다. 관련: Qwen 가중치, Ornith.

02

Exp는 생산 안정판이 아니다

DeepSeek는 평가 중인 체크포인트에 Exp를 붙인다. 텍스트 Flash 생산판은 V4-Flash-0731. 안정 시각판이나 FP4 전문가 여부는 미발표.

03

호스트와 자체 호스트는 위험이 다르다

api.deepseek.com의 프롬프트와 이미지는 중국 서버를 지난다. MIT 가중치 자체 호스트는 그 유출을 끊는다. 이 가중치의 독립 보안 감사는 공개 시점 기준 이름이 인용되지 않았다. Guidelight와 같이 출처에 숫자가 있을 때만 숫자를 쓴다.

표현대조 출처읽는 법
MIT 약 305B 시각 MoEHugging Face 카드 / TechTimes 2026-09-01자체 호스트 가능, 하드웨어가 문
Opus-4.8 대비 11중 3승DeepSeek 자체 하니스자체 보고이지 독립 재현이 아님
API 8/21, 가중치 8/31OpenRouter / 카드 타임라인10일 관측 창. 0731 당일 공개와 다름

TechTimes: 멀티 GPU 청구가 값어치인지는 랩 자체 하니스에 달렸고, 독립 랩은 아직 재현하지 않았다.

# DeepSeek-V4-Flash-Vision-Exp
# weights: 2026-08-31  API: 2026-08-21
id: deepseek-v4-flash-vision-exp
license: MIT
params: ~305B sparse MoE (vision tower + 284B text)
harness: unpublished Harness Minimal Mode
independent_repro: none as of 2026-09-02

읽는 법과 경계

MIT ≠ 단일 GPU 장난감
상업 사용과 파인튠은 허용. VRAM과 멀티 GPU가 실제 문. 카드 예에 4×GB300 vLLM이 있다.
자체 리드 ≠ 범용 시각 왕관
스위트는 소프트웨어 에이전트와 차트 쪽. 장거리 합성은 여전히 Opus-4.8에 뒤진다.
회의 제품 설명이 아니다
공개와 평가만. 짧은 보드가 필요하면 wbmeet방 만들기.

확인하고 싶은 질문

텍스트 V4-Flash-0731과 뭐가 다른가?

텍스트 뼈대는 같다. 시각 인코더와 정렬 층을 더해 총 약 305B. Vision-Exp는 전부 FP8, 0731은 전문가 FP4 가능. Cybergym은 텍스트 베이스라인보다 약간 낮다.

왜 표를 리더보드로 안 보나?

하니스 미공개. 일부 멀티모달 비교에서 텍스트 베이스라인이 이미지를 무시한다. 독립 재현은 아직 없다.

GLM-5.3-Flash와 어떻게 나란히 보나?

둘 다 MIT, 3000억대 멀티모달 MoE. GLM 가중치는 8월 25일. DeepSeek는 API 먼저. 시퀀스가 다르다.

민감 데이터를 호스트 API에 보내도 되나?

규제 업무에서는 보통 안 된다. 중국 서버를 지난다. MIT 가중치 자체 호스트는 유출을 끊지만 독립 보안 감사와는 다르다.

무료로 회의 시작