DeepSeek V4-Flash-Vision-Exp 2026: Offene Gewichte und Evals
DeepSeek hat den ersten V4-Vision-Checkpoint offen gelegt. Eigenwerte teilen sich mit Opus-4.8; kein unabhängiges Labor hat den Harness wiederholt.
V4 konnte seit dem Frühjahrsrelease Code schreiben. Bilder sah es nicht. Am 31. August legte DeepSeek die Vision-Gewichte unter MIT auf Hugging Face.
Die Suchphrase ist DeepSeek V4-Flash-Vision-Exp: ein ~305B Sparse-MoE mit Text-Rückgrat V4-Flash-0731. Es folgt, was TechTimes (1. Sep. 2026) mit Card und Tabelle deckt. Vendor-Zahlen gelten hier nicht als unabhängige Replikation.
Was die Gewichte ergänzen
Rückgrat bleibt ~284B Sparse-MoE, ~13B aktiv pro Schritt, 43 Schichten, Hidden 4096, 1-Mio-Token-Kontext; Routing wählt 6 von 256 Experten plus Shared Expert. Vision: 32 Schichten, 1024-d, 16 Köpfe, 14×14-Patches in den 4096-Raum, max. 384 Tokens pro Bild — dieselbe Kappe wie die Abrechnung. Die zwei Module addieren grob 21B Parameter.
Die Selbstauskunft lesen
- 1
Der Harness ist geschlossen
Vergleiche zu 0731 und Opus-4.8 liefen im Harness Minimal Mode, max. Reasoning, Temperatur 1,0, top_p 0,95. Code unveröffentlicht — ein externes Labor kann dieselbe Config noch nicht fahren.
- 2
Split gegen Opus-4.8
Drei von elf Siegen: DeepSWE 59,3 vs. 58,0, Agents’ Last Exam 27,3 vs. 25,7, ZeroBench Pass@5 35,0 vs. 34,0. Terminal Bench 2.1, Toolathlon-Verified, Chartography etwa ein Punkt. NL2Repo 57,7 vs. 69,7, DSBench-Hard 63,6 vs. 71,7. Fußnote: die Text-Baseline ignoriert multimodale Inputs auf ApexBench und Agents’ Last Exam.
- 3
Text ist nicht eingebrochen
DeepSeek schreibt „vergleichbare“ Text-Agent-Leistung. Die Tabelle führt Vision-Exp in sechs von sieben Textbenches vor 0731 (Toolathlon-Verified +5,6, DeepSWE +4,9). Cybergym ist die einzige Regression (75,3 vs. 76,7). Präzedenz: yage.ai sah V4-Pros Vendor-SWE-bench Verified 80,6 % auf strikterem DeepSWE bei ~8 % pass@1. Die 59,3 nutzen die engere Suite — und bleiben Selbstbericht.
Schmale Eval-Fläche
Gemessen wurden Agenten- und Chart-Aufgaben, nicht breites VQA, OCR oder Science-Vision. Nützlich für Software-Pipelines; dünn als allgemeiner Seh-Claim. Verwandt: Qwen-Gewichte, Ornith.
Exp ist nicht produktionsstabil
Exp markiert Checkpoints unter Bewertung. Produktions-Text-Flash ist V4-Flash-0731. Kein Termin für eine stabile Vision-Version oder FP4-Experten darauf.
Hosted und Self-Hosted sind andere Risiken
Prompts und Bilder an api.deepseek.com laufen über Server in China. MIT-Gewichte auf eigener Hardware kappen den Abfluss. Kein namentlich genanntes unabhängiges Sicherheitsaudit dieser Gewichte zum Publikationsstand. Wie bei Guidelight: Zahlen nur, wenn die Quelle sie druckte.
| Aussage | Prüfbare Quelle | Lesart |
|---|---|---|
| MIT ~305B Vision-MoE | Hugging-Face-Card / TechTimes 2026-09-01 | Self-hostbar; Hardware ist die Hürde |
| 3 von 11 Führungen vs. Opus-4.8 | DeepSeeks eigene Harness-Tabelle | Vendor-Bericht, nicht unabhängig reproduziert |
| API 21. Aug., Gewichte 31. Aug. | OpenRouter / Card-Zeitlinie | Zehn-Tage-Telemetrie, anders als Same-Day-0731 |
TechTimes: ob die Gewichte die Multi-GPU-Rechnung wert sind, hängt am eigenen Harness — und kein unabhängiges Labor hat ihn wiederholt.
# DeepSeek-V4-Flash-Vision-Exp
# weights: 2026-08-31 API: 2026-08-21
id: deepseek-v4-flash-vision-exp
license: MIT
params: ~305B sparse MoE (vision tower + 284B text)
harness: unpublished Harness Minimal Mode
independent_repro: none as of 2026-09-02Grenzen
- MIT ≠ Single-GPU-Spielzeug
- Lizenz erlaubt kommerzielle Nutzung und Fine-Tunes. VRAM und Multi-GPU sind die echte Hürde. Die Card nennt vLLM auf 4×GB300.
- Vendor-Lead ≠ allgemeine Vision-Krone
- Die Suite neigt zu Software-Agenten und Charts. Lange Synthese hinkt Opus-4.8 hinterher.
- Keine Meeting-Produktseite
- Nur Release und Eval. Für ein kurzes Board: wbmeet und Raum erstellen.
Fragen zum Gegenprüfen
Unterschied zu Text-V4-Flash-0731?
Gleiches Text-Rückgrat; Vision-Encoder und Aligner; ~305B gesamt. Vision-Exp durchgängig FP8; 0731 kann FP4-Experten. Cybergym leicht unter der Text-Baseline.
Warum keine Rangliste aus der Tabelle?
Harness unveröffentlicht. Bei manchen multimodalen Items ignoriert die Text-Baseline Bilder. Unabhängige Reproduktionen fehlen.
Lage neben GLM-5.3-Flash?
Beide MIT, multimodale MoEs über 300B. GLM-Gewichte am 25. August; DeepSeek erst API, dann Gewichte. Andere Sequenz, anderer Checkpoint.
Sensible Daten an die gehostete API?
Für regulierte Arbeit meist nein: Requests über Server in China. Self-Hosting der MIT-Gewichte entfernt den Abfluss, ersetzt aber kein unabhängiges Audit.