DeepSeek V4-Flash-Vision-Exp 2026 : poids ouverts et évals

DeepSeek a ouvert le premier checkpoint vision V4. Les scores internes se partagent avec Opus-4.8 ; aucun labo indépendant n’a reproduit le harness.

Depuis le printemps, V4 écrivait du code. Il ne voyait pas une image. Le 31 août, DeepSeek a déposé les poids vision sous MIT sur Hugging Face.

La requête est DeepSeek V4-Flash-Vision-Exp : MoE creux ~305B, ossature texte V4-Flash-0731. Suit ce que TechTimes (1er sept. 2026) recoupe avec la fiche et le tableau. Les chiffres du labo ne valent pas une reproduction indépendante.

21 août : API25 août : poids GLM-5.3-Flash31 août : poids Vision-Exp

Ce que les poids ajoutent

L’ossature reste ~284B MoE creux, ~13B actifs par pas, 43 couches, hidden 4096, contexte d’un million de tokens ; routage 6 experts sur 256 plus un expert partagé. Vision : encodeur 32 couches, 1024-d, 16 têtes, patches 14×14 projetés en 4096, plafond 384 tokens par image — le même que la facturation. Les deux modules ajoutent environ 21B paramètres.

305B
Paramètres MoE creux (tour vision incluse)
10 j
Fenêtre API seule avant les poids
0
Reproductions indépendantes nommées

Lire l’auto-déclaration

  1. 1

    Le harness est fermé

    Les comparaisons à 0731 et Opus-4.8 ont utilisé Harness Minimal Mode, effort max, température 1,0, top_p 0,95. Code non publié : un labo externe ne peut pas encore relancer la même config.

  2. 2

    Partage face à Opus-4.8

    Trois victoires sur onze : DeepSWE 59,3 vs 58,0, Agents’ Last Exam 27,3 vs 25,7, ZeroBench Pass@5 35,0 vs 34,0. Terminal Bench 2.1, Toolathlon-Verified, Chartography à environ un point. NL2Repo 57,7 vs 69,7, DSBench-Hard 63,6 vs 71,7. Note : la baseline texte ignore l’entrée multimodale sur ApexBench et Agents’ Last Exam.

  3. 3

    Le texte n’a pas chuté

    DeepSeek dit une perf « comparable » sur les tâches agent texte. Le tableau place Vision-Exp devant 0731 sur six benches texte sur sept (Toolathlon-Verified +5,6, DeepSWE +4,9). Cybergym est la seule régression (75,3 vs 76,7). Précédent : yage.ai a vu le SWE-bench Verified vendor 80,6 % de V4-Pro tomber vers 8 % pass@1 sur un DeepSWE plus strict. Le 59,3 utilise la suite plus serrée — et reste auto-déclaré.

01

Surface d’éval étroite

Le labo a mesuré l’agentique et la lecture de graphiques, pas un VQA large, l’OCR ou la vision scientifique. Utile pour des pipelines logiciels ; mince comme preuve de « vision générale ». Voir poids Qwen et Ornith.

02

Exp n’est pas une version stable

Exp marque les checkpoints encore évalués. Le Flash texte de production est V4-Flash-0731. Pas de date pour une vision stable ni pour des experts FP4 dessus.

03

Hébergé et auto-hébergé : risques distincts

Prompts et images vers api.deepseek.com transitent par des serveurs en Chine. Les poids MIT chez vous coupent ce flux. Aucun audit de sécurité indépendant nommé n’est cité à la publication. Même règle que Guidelight : un chiffre seulement s’il est imprimé.

FormulationSource vérifiableLecture
MoE vision MIT ~305BFiche Hugging Face / TechTimes 2026-09-01Auto-hébergeable ; le matériel est la porte
3 avances sur 11 vs Opus-4.8Tableau harness DeepSeekDéclaration vendor, pas reproduction indépendante
API 21 août, poids 31 aoûtOpenRouter / chronologie de la ficheFenêtre de télémétrie de dix jours, contrairement à 0731 le jour même

TechTimes : la facture multi-GPU ne se justifie que si l’on croit le harness du labo — et aucun labo indépendant ne l’a encore reproduit.

# DeepSeek-V4-Flash-Vision-Exp
# weights: 2026-08-31  API: 2026-08-21
id: deepseek-v4-flash-vision-exp
license: MIT
params: ~305B sparse MoE (vision tower + 284B text)
harness: unpublished Harness Minimal Mode
independent_repro: none as of 2026-09-02

Limites

MIT ≠ jouet mono-GPU
La licence permet l’usage commercial et le fine-tune. La VRAM et le multi-GPU sont la vraie porte. La fiche cite vLLM sur 4×GB300.
Avance vendor ≠ couronne vision générale
La suite penche agents logiciels et graphiques. La synthèse longue reste derrière Opus-4.8.
Cette page n’est pas une fiche réunion
Sortie et éval seulement. Pour un huddle court : wbmeet et créer une salle.

Questions à recouper

Écart avec le V4-Flash-0731 texte ?

Même ossature texte ; encodeur et aligneur vision ; ~305B au total. Vision-Exp tout FP8 ; 0731 peut user d’experts FP4. Cybergym légèrement sous la baseline texte.

Pourquoi ne pas en faire un classement ?

Harness non publié. Sur certains items multimodaux, la baseline texte ignore les images. Pas encore de reproduction indépendante.

Position face à GLM-5.3-Flash ?

Deux MoE multimodaux MIT au-delà de 300B. Poids GLM le 25 août ; DeepSeek API d’abord. Séquences différentes, checkpoints différents.

Données sensibles vers l’API hébergée ?

En général non en milieu régulé : les requêtes passent par la Chine. Auto-héberger les poids MIT coupe le flux ; ce n’est pas un audit de sécurité indépendant.

Démarrer une réunion gratuite