DeepSeek V4-Flash-Vision-Exp是什么:2026开源视觉评测全解析

DeepSeek 把首个 V4 视觉检查点开源。自报基准对 Opus-4.8 互有胜负,独立实验室尚未复现。

V4 系列从春天起就能写代码,但看不了图。8 月 31 日 DeepSeek 把视觉检查点的权重放到 Hugging Face,许可是 MIT。

检索词是 DeepSeek V4-Flash-Vision-Exp:约 3050 亿参数 的稀疏 MoE,文本骨干仍是 V4-Flash-0731。以下按 TechTimes 2026-09-01 对模型卡与对比表的核对来写,不把自报分数当成独立复现

8 月 21 日:API8 月 25 日:GLM-5.3-Flash 权重8 月 31 日:Vision-Exp 权重

权重里多了什么

骨干仍是约 2840 亿稀疏 MoE、每步约 130 亿激活、43 层、隐层 4096、百万 token 上下文;路由 256 专家里选 6 个,另加共享专家。视觉侧是 32 层、1024 维、16 头编码器,14×14 像素块,经对齐层映到 4096 维,每图最多 384 token——与计费上限一致。两模块大约再加 210 亿参数。

305B
稀疏 MoE 总参数(含视觉塔)
10
API 到开源权重的窗口
0
已公布的第三方独立复现

自报表该怎么读

  1. 1

    套件未开源

    对比 V4-Flash-0731 与 Opus-4.8 用 Harness Minimal Mode,最大推理力度、温度 1.0、top_p 0.95。套件代码未公开,独立实验室目前无法按同一配置重跑。

  2. 2

    对 Opus-4.8 的互有胜负

    十一项里三项领先:DeepSWE 59.3 对 58.0、Agents' Last Exam 27.3 对 25.7、ZeroBench Pass@5 35.0 对 34.0。Terminal Bench 2.1、Toolathlon-Verified、Chartography 约差一分。NL2Repo 57.7 对 69.7、DSBench-Hard 63.6 对 71.7。脚注写明:文本基线在 ApexBench 与 Agents' Last Exam 上会忽略多模态输入,那两项的「跃升」有结构性成分。

  3. 3

    文本任务没有明显掉点

    官方说视觉版在纯文本智能体任务上「相当」。表上七项文本里六项高于 V4-Flash-0731(Toolathlon-Verified +5.6、DeepSWE +4.9)。Cybergym 是唯一相对文本基线的回退(75.3 对 76.7)。先例:yage.ai 曾把 V4-Pro 官方 SWE-bench Verified 80.6% 在更严的 DeepSWE 上打到约 8% pass@1。这次 DeepSWE 59.3 用的是更严套件,但仍是自报。

01

评测面偏窄

测的是智能体与读图读表,不是宽泛 VQA、OCR 或理科视觉套件。对写代码流水线有用,对「通用看图」说服力有限。同类开源权重叙事见 Qwen 开源权重Ornith 自改进权重

02

Exp 不是生产稳定版

DeepSeek 用 Exp 标记仍在评估、尚未定型的检查点。文本 Flash 的生产版是 V4-Flash-0731。后续是否出稳定视觉版、会不会改回 FP4 专家,官方未宣布。

03

托管与自托管不是同一风险

api.deepseek.com 的提示与图片会进中国服务器。开源权重自托管可避免出站;截至发稿没有具名的独立权重安全审计。和本站 Guidelight 控制评估 一样:有数字才引用数字。

说法能核对的来源读法
MIT 开源约 305B 视觉 MoEHugging Face 模型卡 / TechTimes 2026-09-01可自托管,硬件门槛高
对 Opus-4.8 十一项里三项领先DeepSeek 自有 harness 表自报,非独立复现
API 8 月 21 日、权重 8 月 31 日OpenRouter / 模型卡时间线十天遥测窗口,不同于 0731 当日开源

TechTimes:这些权重值不值得上多卡,取决于实验室自己的 harness——而独立实验室尚未复现。

# DeepSeek-V4-Flash-Vision-Exp
# weights: 2026-08-31  API: 2026-08-21
id: deepseek-v4-flash-vision-exp
license: MIT
params: ~305B sparse MoE (vision tower + 284B text)
harness: unpublished Harness Minimal Mode
independent_repro: none as of 2026-09-02

读法与边界

MIT ≠ 单卡可跑
许可允许商用与微调;显存与多卡才是门槛。官方举例含 4×GB300 上的 vLLM。
自报领先 ≠ 通用视觉冠军
基准偏软件智能体与图表。长程合成任务仍落后 Opus-4.8。
新闻页不是会议产品说明书
只解释发布与评测。若读完要约短会白板,用 wbmeet 建房,见 如何创建与加入房间

还想核对的问题

和文本 V4-Flash-0731 差在哪?

文本骨干相同;多了视觉编码器与对齐层,总参数约 305B。Vision-Exp 全 FP8,0731 专家可用 FP4。Cybergym 相对文本基线略降。

为什么不把分数当排行榜?

Harness 未开源;部分多模态对比里文本基线会忽略图像。独立复现尚未发表。

和 GLM-5.3-Flash 如何并列?

都是 MIT、三千亿级多模态 MoE。GLM 权重 8 月 25 日;DeepSeek 先 API 再权重。策略不同,不是同一检查点。

敏感数据能打托管 API 吗?

多数受监管场景不适合:请求会进中国服务器。自托管开源权重可去掉出站,但不等于权重已通过独立安全审计。

免费开始开会