DeepSeek V4-Flash-Vision-Exp 2026: открытые веса и оценки

DeepSeek открыла первый vision-чекпоинт V4. Внутренние баллы делятся с Opus-4.8; независимая лаборатория harness не воспроизвела.

С весеннего релиза V4 умел писать код. Картинку он не видел. 31 августа DeepSeek положила vision-веса под MIT на Hugging Face.

Запрос — DeepSeek V4-Flash-Vision-Exp: разреженный MoE ~305B с текстовым хребтом V4-Flash-0731. Дальше — сверка TechTimes (1 сент. 2026) с карточкой и таблицей. Цифры лаборатории не считаем независимой репродукцией.

21 авг.: API25 авг.: веса GLM-5.3-Flash31 авг.: веса Vision-Exp

Что добавили веса

Хребет — ~284B разреженный MoE, ~13B активных на шаг, 43 слоя, hidden 4096, контекст в миллион токенов; маршрутизация 6 из 256 экспертов плюс общий эксперт. Зрение: 32 слоя, 1024-d, 16 голов, патчи 14×14 в пространство 4096, потолок 384 токена на картинку — тот же, что в тарифе. Два модуля добавляют примерно 21B параметров.

305B
Параметры разреженного MoE (с башней зрения)
10 дн.
Окно только API до весов
0
Названных независимых репродукций

Как читать самоотчёт

  1. 1

    Harness закрыт

    Сравнения с 0731 и Opus-4.8 шли в Harness Minimal Mode, макс. рассуждение, температура 1,0, top_p 0,95. Код не опубликован — внешняя лаборатория пока не может прогнать ту же конфигурацию.

  2. 2

    Раскол против Opus-4.8

    Три победы из одиннадцати: DeepSWE 59,3 против 58,0, Agents’ Last Exam 27,3 против 25,7, ZeroBench Pass@5 35,0 против 34,0. Terminal Bench 2.1, Toolathlon-Verified, Chartography — около пункта. NL2Repo 57,7 против 69,7, DSBench-Hard 63,6 против 71,7. Сноска: текстовая база игнорирует мультимодальный вход на ApexBench и Agents’ Last Exam.

  3. 3

    Текст не просел

    DeepSeek пишет о «сопоставимой» агентной текстовой работе. В таблице Vision-Exp впереди 0731 на шести из семи текстовых бенчей (Toolathlon-Verified +5,6, DeepSWE +4,9). Cybergym — единственная регрессия (75,3 против 76,7). Прецедент: yage.ai снизила vendor SWE-bench Verified 80,6 % у V4-Pro до ~8 % pass@1 на более жёстком DeepSWE. 59,3 — более жёсткий набор и всё ещё самоотчёт.

01

Узкая поверхность оценки

Мерили агентов и чтение графиков, не широкий VQA, OCR или научное зрение. Полезно для софтверных пайплайнов; слабо как общее «умеет видеть». См. веса Qwen и Ornith.

02

Exp — не стабильная прод-версия

Exp помечает чекпоинты ещё на оценке. Прод-текстовый Flash — V4-Flash-0731. Даты стабильного vision и FP4-экспертов на нём нет.

03

Хостинг и свой хост — разные риски

Промпты и картинки на api.deepseek.com идут через серверы в Китае. MIT-веса у себя обрывают этот отток. Именованного независимого аудита безопасности этих весов на момент публикации нет. Как в Guidelight: цифра — только если источник её напечатал.

ФормулировкаПроверяемый источникКак читать
MIT ~305B vision MoEКарточка Hugging Face / TechTimes 2026-09-01Можно свой хост; железо — порог
3 из 11 лидерств против Opus-4.8Своя таблица harness DeepSeekСамоотчёт, не независимая репродукция
API 21 авг., веса 31 авг.OpenRouter / хронология карточкиДесять дней телеметрии, не как 0731 в тот же день

TechTimes: окупаются ли несколько GPU, зависит от собственного harness лаборатории — а независимая лаборатория его ещё не воспроизвела.

# DeepSeek-V4-Flash-Vision-Exp
# weights: 2026-08-31  API: 2026-08-21
id: deepseek-v4-flash-vision-exp
license: MIT
params: ~305B sparse MoE (vision tower + 284B text)
harness: unpublished Harness Minimal Mode
independent_repro: none as of 2026-09-02

Границы

MIT ≠ игрушка на одну GPU
Лицензия разрешает коммерцию и дообучение. VRAM и несколько GPU — настоящий порог. В карточке пример vLLM на 4×GB300.
Vendor-лид ≠ общая корона зрения
Набор смещён к софтверным агентам и графикам. Длинный синтез всё ещё позади Opus-4.8.
Это не бриф про совещания
Только релиз и оценка. Для короткой доски: wbmeet и создайте комнату.

Вопросы для сверки

Чем отличается от текстового V4-Flash-0731?

Тот же текстовый хребет; добавлены энкодер и выравниватель зрения; всего ~305B. Vision-Exp целиком FP8; у 0731 возможны эксперты FP4. Cybergym чуть ниже текстовой базы.

Почему таблица — не рейтинг?

Harness не опубликован. На части мультимодальных пунктов текстовая база игнорирует картинки. Независимых репродукций ещё нет.

Рядом с GLM-5.3-Flash?

Оба MIT, мультимодальные MoE выше 300B. Веса GLM — 25 августа; DeepSeek сначала API. Разная последовательность, разные чекпоинты.

Чувствительные данные в hosted API?

Для регулируемых задач обычно нет: запросы идут через Китай. Свой хост MIT-весов обрывает отток, но это не независимый аудит безопасности.

Начать бесплатную встречу