DeepSeek V4-Flash-Vision-Exp是什麼:2026開源視覺評測全解析
DeepSeek 把首個 V4 視覺檢查點開源。自報基準對 Opus-4.8 互有勝負,獨立實驗室尚未重現。
V4 系列從春天起就能寫程式,但看不了圖。8 月 31 日 DeepSeek 把視覺檢查點的權重放到 Hugging Face,授權是 MIT。
檢索詞是 DeepSeek V4-Flash-Vision-Exp:約 3050 億參數 的稀疏 MoE,文本骨幹仍是 V4-Flash-0731。以下按 TechTimes 2026-09-01 對模型卡與對照表的核對來寫,不把自報分數當成獨立重現。
權重裡多了什麼
骨幹仍是約 2840 億稀疏 MoE、每步約 130 億啟動、43 層、隱層 4096、百萬 token 上下文;路由 256 專家裡選 6 個,另加共享專家。視覺側是 32 層、1024 維、16 頭編碼器,14×14 像素塊,經對齊層映到 4096 維,每圖最多 384 token——與計費上限一致。兩模組大約再加 210 億參數。
自報表該怎麼讀
- 1
套件未開源
對比 V4-Flash-0731 與 Opus-4.8 用 Harness Minimal Mode,最大推理力度、溫度 1.0、top_p 0.95。套件程式碼未公開,獨立實驗室目前無法按同一配置重跑。
- 2
對 Opus-4.8 的互有勝負
十一項裡三項領先:DeepSWE 59.3 對 58.0、Agents' Last Exam 27.3 對 25.7、ZeroBench Pass@5 35.0 對 34.0。Terminal Bench 2.1、Toolathlon-Verified、Chartography 約差一分。NL2Repo 57.7 對 69.7、DSBench-Hard 63.6 對 71.7。腳註寫明:文本基線在 ApexBench 與 Agents' Last Exam 上會忽略多模態輸入,那兩項的「躍升」有結構性成分。
- 3
文本任務沒有明顯掉點
官方說視覺版在純文本智能體任務上「相當」。表上七項文本裡六項高於 V4-Flash-0731(Toolathlon-Verified +5.6、DeepSWE +4.9)。Cybergym 是唯一相對文本基線的回退(75.3 對 76.7)。先例:yage.ai 曾把 V4-Pro 官方 SWE-bench Verified 80.6% 在更嚴的 DeepSWE 上打到約 8% pass@1。這次 DeepSWE 59.3 用的是更嚴套件,但仍是自報。
評測面偏窄
測的是智能體與讀圖讀表,不是寬泛 VQA、OCR 或理科視覺套件。對寫程式流水線有用,對「通用看圖」說服力有限。同類開源權重敘事見 Qwen 開源權重 與 Ornith 自改進權重。
Exp 不是生產穩定版
DeepSeek 用 Exp 標記仍在評估、尚未定型的檢查點。文本 Flash 的生產版是 V4-Flash-0731。後續是否出穩定視覺版、會不會改回 FP4 專家,官方未宣布。
託管與自託管不是同一風險
api.deepseek.com 的提示與圖片會進中國伺服器。開源權重自託管可避免出站;截至發稿沒有具名的獨立權重安全稽核。和本站 Guidelight 控制評估 一樣:有數字才引用數字。
| 說法 | 能核對的來源 | 讀法 |
|---|---|---|
| MIT 開源約 305B 視覺 MoE | Hugging Face 模型卡 / TechTimes 2026-09-01 | 可自託管,硬體門檻高 |
| 對 Opus-4.8 十一項裡三項領先 | DeepSeek 自有 harness 表 | 自報,非獨立重現 |
| API 8 月 21 日、權重 8 月 31 日 | OpenRouter / 模型卡時間線 | 十天遙測窗口,不同於 0731 當日開源 |
TechTimes:這些權重值不值得上多卡,取決於實驗室自己的 harness——而獨立實驗室尚未重現。
# DeepSeek-V4-Flash-Vision-Exp
# weights: 2026-08-31 API: 2026-08-21
id: deepseek-v4-flash-vision-exp
license: MIT
params: ~305B sparse MoE (vision tower + 284B text)
harness: unpublished Harness Minimal Mode
independent_repro: none as of 2026-09-02讀法與界線
- MIT ≠ 單卡可跑
- 授權允許商用與微調;顯示記憶體與多卡才是門檻。官方舉例含 4×GB300 上的 vLLM。
- 自報領先 ≠ 通用視覺冠軍
- 基準偏軟體智能體與圖表。長程合成任務仍落後 Opus-4.8。
- 新聞頁不是會議產品說明書
- 只解釋發布與評測。若讀完要約短會白板,用 wbmeet 建房,見 如何建立與加入房間。
還想核對的問題
和文本 V4-Flash-0731 差在哪?
文本骨幹相同;多了視覺編碼器與對齊層,總參數約 305B。Vision-Exp 全 FP8,0731 專家可用 FP4。Cybergym 相對文本基線略降。
為什麼不把分數當排行榜?
Harness 未開源;部分多模態對比裡文本基線會忽略圖像。獨立重現尚未發表。
和 GLM-5.3-Flash 如何並列?
都是 MIT、三千億級多模態 MoE。GLM 權重 8 月 25 日;DeepSeek 先 API 再權重。策略不同,不是同一檢查點。
敏感資料能打託管 API 嗎?
多數受監管場景不適合:請求會進中國伺服器。自託管開源權重可去掉出站,但不等於權重已通過獨立安全稽核。