DeepSeek V4-Flash-Vision-Exp 2026 : poids ouverts et évals
DeepSeek a ouvert le premier checkpoint vision V4. Les scores internes se partagent avec Opus-4.8 ; aucun labo indépendant n’a reproduit le harness.
Depuis le printemps, V4 écrivait du code. Il ne voyait pas une image. Le 31 août, DeepSeek a déposé les poids vision sous MIT sur Hugging Face.
La requête est DeepSeek V4-Flash-Vision-Exp : MoE creux ~305B, ossature texte V4-Flash-0731. Suit ce que TechTimes (1er sept. 2026) recoupe avec la fiche et le tableau. Les chiffres du labo ne valent pas une reproduction indépendante.
Ce que les poids ajoutent
L’ossature reste ~284B MoE creux, ~13B actifs par pas, 43 couches, hidden 4096, contexte d’un million de tokens ; routage 6 experts sur 256 plus un expert partagé. Vision : encodeur 32 couches, 1024-d, 16 têtes, patches 14×14 projetés en 4096, plafond 384 tokens par image — le même que la facturation. Les deux modules ajoutent environ 21B paramètres.
Lire l’auto-déclaration
- 1
Le harness est fermé
Les comparaisons à 0731 et Opus-4.8 ont utilisé Harness Minimal Mode, effort max, température 1,0, top_p 0,95. Code non publié : un labo externe ne peut pas encore relancer la même config.
- 2
Partage face à Opus-4.8
Trois victoires sur onze : DeepSWE 59,3 vs 58,0, Agents’ Last Exam 27,3 vs 25,7, ZeroBench Pass@5 35,0 vs 34,0. Terminal Bench 2.1, Toolathlon-Verified, Chartography à environ un point. NL2Repo 57,7 vs 69,7, DSBench-Hard 63,6 vs 71,7. Note : la baseline texte ignore l’entrée multimodale sur ApexBench et Agents’ Last Exam.
- 3
Le texte n’a pas chuté
DeepSeek dit une perf « comparable » sur les tâches agent texte. Le tableau place Vision-Exp devant 0731 sur six benches texte sur sept (Toolathlon-Verified +5,6, DeepSWE +4,9). Cybergym est la seule régression (75,3 vs 76,7). Précédent : yage.ai a vu le SWE-bench Verified vendor 80,6 % de V4-Pro tomber vers 8 % pass@1 sur un DeepSWE plus strict. Le 59,3 utilise la suite plus serrée — et reste auto-déclaré.
Surface d’éval étroite
Le labo a mesuré l’agentique et la lecture de graphiques, pas un VQA large, l’OCR ou la vision scientifique. Utile pour des pipelines logiciels ; mince comme preuve de « vision générale ». Voir poids Qwen et Ornith.
Exp n’est pas une version stable
Exp marque les checkpoints encore évalués. Le Flash texte de production est V4-Flash-0731. Pas de date pour une vision stable ni pour des experts FP4 dessus.
Hébergé et auto-hébergé : risques distincts
Prompts et images vers api.deepseek.com transitent par des serveurs en Chine. Les poids MIT chez vous coupent ce flux. Aucun audit de sécurité indépendant nommé n’est cité à la publication. Même règle que Guidelight : un chiffre seulement s’il est imprimé.
| Formulation | Source vérifiable | Lecture |
|---|---|---|
| MoE vision MIT ~305B | Fiche Hugging Face / TechTimes 2026-09-01 | Auto-hébergeable ; le matériel est la porte |
| 3 avances sur 11 vs Opus-4.8 | Tableau harness DeepSeek | Déclaration vendor, pas reproduction indépendante |
| API 21 août, poids 31 août | OpenRouter / chronologie de la fiche | Fenêtre de télémétrie de dix jours, contrairement à 0731 le jour même |
TechTimes : la facture multi-GPU ne se justifie que si l’on croit le harness du labo — et aucun labo indépendant ne l’a encore reproduit.
# DeepSeek-V4-Flash-Vision-Exp
# weights: 2026-08-31 API: 2026-08-21
id: deepseek-v4-flash-vision-exp
license: MIT
params: ~305B sparse MoE (vision tower + 284B text)
harness: unpublished Harness Minimal Mode
independent_repro: none as of 2026-09-02Limites
- MIT ≠ jouet mono-GPU
- La licence permet l’usage commercial et le fine-tune. La VRAM et le multi-GPU sont la vraie porte. La fiche cite vLLM sur 4×GB300.
- Avance vendor ≠ couronne vision générale
- La suite penche agents logiciels et graphiques. La synthèse longue reste derrière Opus-4.8.
- Cette page n’est pas une fiche réunion
- Sortie et éval seulement. Pour un huddle court : wbmeet et créer une salle.
Questions à recouper
Écart avec le V4-Flash-0731 texte ?
Même ossature texte ; encodeur et aligneur vision ; ~305B au total. Vision-Exp tout FP8 ; 0731 peut user d’experts FP4. Cybergym légèrement sous la baseline texte.
Pourquoi ne pas en faire un classement ?
Harness non publié. Sur certains items multimodaux, la baseline texte ignore les images. Pas encore de reproduction indépendante.
Position face à GLM-5.3-Flash ?
Deux MoE multimodaux MIT au-delà de 300B. Poids GLM le 25 août ; DeepSeek API d’abord. Séquences différentes, checkpoints différents.
Données sensibles vers l’API hébergée ?
En général non en milieu régulé : les requêtes passent par la Chine. Auto-héberger les poids MIT coupe le flux ; ce n’est pas un audit de sécurité indépendant.