DeepSeek V4-Flash-Vision-Exp是什么:2026开源视觉评测全解析
DeepSeek 把首个 V4 视觉检查点开源。自报基准对 Opus-4.8 互有胜负,独立实验室尚未复现。
V4 系列从春天起就能写代码,但看不了图。8 月 31 日 DeepSeek 把视觉检查点的权重放到 Hugging Face,许可是 MIT。
检索词是 DeepSeek V4-Flash-Vision-Exp:约 3050 亿参数 的稀疏 MoE,文本骨干仍是 V4-Flash-0731。以下按 TechTimes 2026-09-01 对模型卡与对比表的核对来写,不把自报分数当成独立复现。
权重里多了什么
骨干仍是约 2840 亿稀疏 MoE、每步约 130 亿激活、43 层、隐层 4096、百万 token 上下文;路由 256 专家里选 6 个,另加共享专家。视觉侧是 32 层、1024 维、16 头编码器,14×14 像素块,经对齐层映到 4096 维,每图最多 384 token——与计费上限一致。两模块大约再加 210 亿参数。
自报表该怎么读
- 1
套件未开源
对比 V4-Flash-0731 与 Opus-4.8 用 Harness Minimal Mode,最大推理力度、温度 1.0、top_p 0.95。套件代码未公开,独立实验室目前无法按同一配置重跑。
- 2
对 Opus-4.8 的互有胜负
十一项里三项领先:DeepSWE 59.3 对 58.0、Agents' Last Exam 27.3 对 25.7、ZeroBench Pass@5 35.0 对 34.0。Terminal Bench 2.1、Toolathlon-Verified、Chartography 约差一分。NL2Repo 57.7 对 69.7、DSBench-Hard 63.6 对 71.7。脚注写明:文本基线在 ApexBench 与 Agents' Last Exam 上会忽略多模态输入,那两项的「跃升」有结构性成分。
- 3
文本任务没有明显掉点
官方说视觉版在纯文本智能体任务上「相当」。表上七项文本里六项高于 V4-Flash-0731(Toolathlon-Verified +5.6、DeepSWE +4.9)。Cybergym 是唯一相对文本基线的回退(75.3 对 76.7)。先例:yage.ai 曾把 V4-Pro 官方 SWE-bench Verified 80.6% 在更严的 DeepSWE 上打到约 8% pass@1。这次 DeepSWE 59.3 用的是更严套件,但仍是自报。
评测面偏窄
测的是智能体与读图读表,不是宽泛 VQA、OCR 或理科视觉套件。对写代码流水线有用,对「通用看图」说服力有限。同类开源权重叙事见 Qwen 开源权重 与 Ornith 自改进权重。
Exp 不是生产稳定版
DeepSeek 用 Exp 标记仍在评估、尚未定型的检查点。文本 Flash 的生产版是 V4-Flash-0731。后续是否出稳定视觉版、会不会改回 FP4 专家,官方未宣布。
托管与自托管不是同一风险
api.deepseek.com 的提示与图片会进中国服务器。开源权重自托管可避免出站;截至发稿没有具名的独立权重安全审计。和本站 Guidelight 控制评估 一样:有数字才引用数字。
| 说法 | 能核对的来源 | 读法 |
|---|---|---|
| MIT 开源约 305B 视觉 MoE | Hugging Face 模型卡 / TechTimes 2026-09-01 | 可自托管,硬件门槛高 |
| 对 Opus-4.8 十一项里三项领先 | DeepSeek 自有 harness 表 | 自报,非独立复现 |
| API 8 月 21 日、权重 8 月 31 日 | OpenRouter / 模型卡时间线 | 十天遥测窗口,不同于 0731 当日开源 |
TechTimes:这些权重值不值得上多卡,取决于实验室自己的 harness——而独立实验室尚未复现。
# DeepSeek-V4-Flash-Vision-Exp
# weights: 2026-08-31 API: 2026-08-21
id: deepseek-v4-flash-vision-exp
license: MIT
params: ~305B sparse MoE (vision tower + 284B text)
harness: unpublished Harness Minimal Mode
independent_repro: none as of 2026-09-02读法与边界
- MIT ≠ 单卡可跑
- 许可允许商用与微调;显存与多卡才是门槛。官方举例含 4×GB300 上的 vLLM。
- 自报领先 ≠ 通用视觉冠军
- 基准偏软件智能体与图表。长程合成任务仍落后 Opus-4.8。
- 新闻页不是会议产品说明书
- 只解释发布与评测。若读完要约短会白板,用 wbmeet 建房,见 如何创建与加入房间。
还想核对的问题
和文本 V4-Flash-0731 差在哪?
文本骨干相同;多了视觉编码器与对齐层,总参数约 305B。Vision-Exp 全 FP8,0731 专家可用 FP4。Cybergym 相对文本基线略降。
为什么不把分数当排行榜?
Harness 未开源;部分多模态对比里文本基线会忽略图像。独立复现尚未发表。
和 GLM-5.3-Flash 如何并列?
都是 MIT、三千亿级多模态 MoE。GLM 权重 8 月 25 日;DeepSeek 先 API 再权重。策略不同,不是同一检查点。
敏感数据能打托管 API 吗?
多数受监管场景不适合:请求会进中国服务器。自托管开源权重可去掉出站,但不等于权重已通过独立安全审计。