DeepSeek V4-Flash-Vision-Exp 2026: Offene Gewichte und Evals

DeepSeek hat den ersten V4-Vision-Checkpoint offen gelegt. Eigenwerte teilen sich mit Opus-4.8; kein unabhängiges Labor hat den Harness wiederholt.

V4 konnte seit dem Frühjahrsrelease Code schreiben. Bilder sah es nicht. Am 31. August legte DeepSeek die Vision-Gewichte unter MIT auf Hugging Face.

Die Suchphrase ist DeepSeek V4-Flash-Vision-Exp: ein ~305B Sparse-MoE mit Text-Rückgrat V4-Flash-0731. Es folgt, was TechTimes (1. Sep. 2026) mit Card und Tabelle deckt. Vendor-Zahlen gelten hier nicht als unabhängige Replikation.

21. Aug.: API25. Aug.: GLM-5.3-Flash-Gewichte31. Aug.: Vision-Exp-Gewichte

Was die Gewichte ergänzen

Rückgrat bleibt ~284B Sparse-MoE, ~13B aktiv pro Schritt, 43 Schichten, Hidden 4096, 1-Mio-Token-Kontext; Routing wählt 6 von 256 Experten plus Shared Expert. Vision: 32 Schichten, 1024-d, 16 Köpfe, 14×14-Patches in den 4096-Raum, max. 384 Tokens pro Bild — dieselbe Kappe wie die Abrechnung. Die zwei Module addieren grob 21B Parameter.

305B
Sparse-MoE-Parameter (mit Visionsturm)
10 Tage
Nur-API-Fenster vor den Gewichten
0
Genannte unabhängige Reproduktionen

Die Selbstauskunft lesen

  1. 1

    Der Harness ist geschlossen

    Vergleiche zu 0731 und Opus-4.8 liefen im Harness Minimal Mode, max. Reasoning, Temperatur 1,0, top_p 0,95. Code unveröffentlicht — ein externes Labor kann dieselbe Config noch nicht fahren.

  2. 2

    Split gegen Opus-4.8

    Drei von elf Siegen: DeepSWE 59,3 vs. 58,0, Agents’ Last Exam 27,3 vs. 25,7, ZeroBench Pass@5 35,0 vs. 34,0. Terminal Bench 2.1, Toolathlon-Verified, Chartography etwa ein Punkt. NL2Repo 57,7 vs. 69,7, DSBench-Hard 63,6 vs. 71,7. Fußnote: die Text-Baseline ignoriert multimodale Inputs auf ApexBench und Agents’ Last Exam.

  3. 3

    Text ist nicht eingebrochen

    DeepSeek schreibt „vergleichbare“ Text-Agent-Leistung. Die Tabelle führt Vision-Exp in sechs von sieben Textbenches vor 0731 (Toolathlon-Verified +5,6, DeepSWE +4,9). Cybergym ist die einzige Regression (75,3 vs. 76,7). Präzedenz: yage.ai sah V4-Pros Vendor-SWE-bench Verified 80,6 % auf strikterem DeepSWE bei ~8 % pass@1. Die 59,3 nutzen die engere Suite — und bleiben Selbstbericht.

01

Schmale Eval-Fläche

Gemessen wurden Agenten- und Chart-Aufgaben, nicht breites VQA, OCR oder Science-Vision. Nützlich für Software-Pipelines; dünn als allgemeiner Seh-Claim. Verwandt: Qwen-Gewichte, Ornith.

02

Exp ist nicht produktionsstabil

Exp markiert Checkpoints unter Bewertung. Produktions-Text-Flash ist V4-Flash-0731. Kein Termin für eine stabile Vision-Version oder FP4-Experten darauf.

03

Hosted und Self-Hosted sind andere Risiken

Prompts und Bilder an api.deepseek.com laufen über Server in China. MIT-Gewichte auf eigener Hardware kappen den Abfluss. Kein namentlich genanntes unabhängiges Sicherheitsaudit dieser Gewichte zum Publikationsstand. Wie bei Guidelight: Zahlen nur, wenn die Quelle sie druckte.

AussagePrüfbare QuelleLesart
MIT ~305B Vision-MoEHugging-Face-Card / TechTimes 2026-09-01Self-hostbar; Hardware ist die Hürde
3 von 11 Führungen vs. Opus-4.8DeepSeeks eigene Harness-TabelleVendor-Bericht, nicht unabhängig reproduziert
API 21. Aug., Gewichte 31. Aug.OpenRouter / Card-ZeitlinieZehn-Tage-Telemetrie, anders als Same-Day-0731

TechTimes: ob die Gewichte die Multi-GPU-Rechnung wert sind, hängt am eigenen Harness — und kein unabhängiges Labor hat ihn wiederholt.

# DeepSeek-V4-Flash-Vision-Exp
# weights: 2026-08-31  API: 2026-08-21
id: deepseek-v4-flash-vision-exp
license: MIT
params: ~305B sparse MoE (vision tower + 284B text)
harness: unpublished Harness Minimal Mode
independent_repro: none as of 2026-09-02

Grenzen

MIT ≠ Single-GPU-Spielzeug
Lizenz erlaubt kommerzielle Nutzung und Fine-Tunes. VRAM und Multi-GPU sind die echte Hürde. Die Card nennt vLLM auf 4×GB300.
Vendor-Lead ≠ allgemeine Vision-Krone
Die Suite neigt zu Software-Agenten und Charts. Lange Synthese hinkt Opus-4.8 hinterher.
Keine Meeting-Produktseite
Nur Release und Eval. Für ein kurzes Board: wbmeet und Raum erstellen.

Fragen zum Gegenprüfen

Unterschied zu Text-V4-Flash-0731?

Gleiches Text-Rückgrat; Vision-Encoder und Aligner; ~305B gesamt. Vision-Exp durchgängig FP8; 0731 kann FP4-Experten. Cybergym leicht unter der Text-Baseline.

Warum keine Rangliste aus der Tabelle?

Harness unveröffentlicht. Bei manchen multimodalen Items ignoriert die Text-Baseline Bilder. Unabhängige Reproduktionen fehlen.

Lage neben GLM-5.3-Flash?

Beide MIT, multimodale MoEs über 300B. GLM-Gewichte am 25. August; DeepSeek erst API, dann Gewichte. Andere Sequenz, anderer Checkpoint.

Sensible Daten an die gehostete API?

Für regulierte Arbeit meist nein: Requests über Server in China. Self-Hosting der MIT-Gewichte entfernt den Abfluss, ersetzt aber kein unabhängiges Audit.

Kostenloses Meeting starten