DeepSeek V4-Flash-Vision-Exp是什麼:2026開源視覺評測全解析

DeepSeek 把首個 V4 視覺檢查點開源。自報基準對 Opus-4.8 互有勝負,獨立實驗室尚未重現。

V4 系列從春天起就能寫程式,但看不了圖。8 月 31 日 DeepSeek 把視覺檢查點的權重放到 Hugging Face,授權是 MIT。

檢索詞是 DeepSeek V4-Flash-Vision-Exp:約 3050 億參數 的稀疏 MoE,文本骨幹仍是 V4-Flash-0731。以下按 TechTimes 2026-09-01 對模型卡與對照表的核對來寫,不把自報分數當成獨立重現

8 月 21 日:API8 月 25 日:GLM-5.3-Flash 權重8 月 31 日:Vision-Exp 權重

權重裡多了什麼

骨幹仍是約 2840 億稀疏 MoE、每步約 130 億啟動、43 層、隱層 4096、百萬 token 上下文;路由 256 專家裡選 6 個,另加共享專家。視覺側是 32 層、1024 維、16 頭編碼器,14×14 像素塊,經對齊層映到 4096 維,每圖最多 384 token——與計費上限一致。兩模組大約再加 210 億參數。

305B
稀疏 MoE 總參數(含視覺塔)
10
API 到開源權重的窗口
0
已公布的第三方獨立重現

自報表該怎麼讀

  1. 1

    套件未開源

    對比 V4-Flash-0731 與 Opus-4.8 用 Harness Minimal Mode,最大推理力度、溫度 1.0、top_p 0.95。套件程式碼未公開,獨立實驗室目前無法按同一配置重跑。

  2. 2

    對 Opus-4.8 的互有勝負

    十一項裡三項領先:DeepSWE 59.3 對 58.0、Agents' Last Exam 27.3 對 25.7、ZeroBench Pass@5 35.0 對 34.0。Terminal Bench 2.1、Toolathlon-Verified、Chartography 約差一分。NL2Repo 57.7 對 69.7、DSBench-Hard 63.6 對 71.7。腳註寫明:文本基線在 ApexBench 與 Agents' Last Exam 上會忽略多模態輸入,那兩項的「躍升」有結構性成分。

  3. 3

    文本任務沒有明顯掉點

    官方說視覺版在純文本智能體任務上「相當」。表上七項文本裡六項高於 V4-Flash-0731(Toolathlon-Verified +5.6、DeepSWE +4.9)。Cybergym 是唯一相對文本基線的回退(75.3 對 76.7)。先例:yage.ai 曾把 V4-Pro 官方 SWE-bench Verified 80.6% 在更嚴的 DeepSWE 上打到約 8% pass@1。這次 DeepSWE 59.3 用的是更嚴套件,但仍是自報。

01

評測面偏窄

測的是智能體與讀圖讀表,不是寬泛 VQA、OCR 或理科視覺套件。對寫程式流水線有用,對「通用看圖」說服力有限。同類開源權重敘事見 Qwen 開源權重Ornith 自改進權重

02

Exp 不是生產穩定版

DeepSeek 用 Exp 標記仍在評估、尚未定型的檢查點。文本 Flash 的生產版是 V4-Flash-0731。後續是否出穩定視覺版、會不會改回 FP4 專家,官方未宣布。

03

託管與自託管不是同一風險

api.deepseek.com 的提示與圖片會進中國伺服器。開源權重自託管可避免出站;截至發稿沒有具名的獨立權重安全稽核。和本站 Guidelight 控制評估 一樣:有數字才引用數字。

說法能核對的來源讀法
MIT 開源約 305B 視覺 MoEHugging Face 模型卡 / TechTimes 2026-09-01可自託管,硬體門檻高
對 Opus-4.8 十一項裡三項領先DeepSeek 自有 harness 表自報,非獨立重現
API 8 月 21 日、權重 8 月 31 日OpenRouter / 模型卡時間線十天遙測窗口,不同於 0731 當日開源

TechTimes:這些權重值不值得上多卡,取決於實驗室自己的 harness——而獨立實驗室尚未重現。

# DeepSeek-V4-Flash-Vision-Exp
# weights: 2026-08-31  API: 2026-08-21
id: deepseek-v4-flash-vision-exp
license: MIT
params: ~305B sparse MoE (vision tower + 284B text)
harness: unpublished Harness Minimal Mode
independent_repro: none as of 2026-09-02

讀法與界線

MIT ≠ 單卡可跑
授權允許商用與微調;顯示記憶體與多卡才是門檻。官方舉例含 4×GB300 上的 vLLM。
自報領先 ≠ 通用視覺冠軍
基準偏軟體智能體與圖表。長程合成任務仍落後 Opus-4.8。
新聞頁不是會議產品說明書
只解釋發布與評測。若讀完要約短會白板,用 wbmeet 建房,見 如何建立與加入房間

還想核對的問題

和文本 V4-Flash-0731 差在哪?

文本骨幹相同;多了視覺編碼器與對齊層,總參數約 305B。Vision-Exp 全 FP8,0731 專家可用 FP4。Cybergym 相對文本基線略降。

為什麼不把分數當排行榜?

Harness 未開源;部分多模態對比裡文本基線會忽略圖像。獨立重現尚未發表。

和 GLM-5.3-Flash 如何並列?

都是 MIT、三千億級多模態 MoE。GLM 權重 8 月 25 日;DeepSeek 先 API 再權重。策略不同,不是同一檢查點。

敏感資料能打託管 API 嗎?

多數受監管場景不適合:請求會進中國伺服器。自託管開源權重可去掉出站,但不等於權重已通過獨立安全稽核。

免費開始開會