Hy4 preview 2026: Tencents 770B, Apache-Gewichte, Blindtest
Tencent öffnete Hy4 preview. SKU 770B/49B, internen Blindtest 2,99/4 und Preview-Mängel getrennt lesen.
Anfang September 2026 hat Tencents Hunyuan-Hy-Team Hy4 preview veröffentlicht: 770B gesamt, etwa 49B aktiv pro Token, 1M Kontext, Gewichte unter Apache 2.0. Die Meldung ist nicht die Parameterzahl, sondern der interne Blindtest — und die Preview-Mängel, die das Labor selbst nennt.
Die Suchbegriffe sind Hy4 preview und 770B / 49B. Grundlage sind Tencents Mitteilung, die Hugging-Face-Karte tencent/Hy4-preview und der ThursdAI-September-Tracker. Manche Recaps datieren den ersten Drop auf den 28. August; kein Lieferdatum erfinden, das die offiziellen Posts nicht drucken. Eine andere offene Flotte in derselben Woche: K2 Horizon.
Was das Labor als Lieferumfang nennt
Das Flaggschiff ist ein sparsames MoE: 770B gesamt, etwa 49B aktiv pro Token. 78 Schichten — dichte FFN in Schicht 1, dann 77 MoE-Schichten mit 256 gerouteten Experten plus einem geteilten, top-8 plus Shared pro Token. Eine native MTP-Schicht (10B gesamt, ~0,7B aktiv) dient der spekulativen Dekodierung. Attention: Gated DSA mit IndexCache; Residuen: iHC über vier Ströme. Vokabular 120832, Kontext 1M.
Die drei Zahlen lesen
- 1
Zuerst die SKU, dann der Schnitt
Serving-Rezepte nennen das vLLM-Image
vllm/vllm-openai:hy4-previewoder SGLanglmsysorg/sglang:hy4-preview, FP8 und 8-Wege-Tensorparallel. Reasoning default high;no_thinkfür direkte Antwort. API-Preise laut Mitteilung: 0,834 / 2,501 / 0,042 USD je Million Token (Input / Output / Cache-Treffer). WorkBuddy und CodeBuddy zwei Wochen kostenlos; Hy3-Freiaccess bis 30. September verlängert. - 2
2,99 ist eine interne Blindnote
163 Tencent-Experten bewerteten 203 Engineering-Aufgaben. Hy4 preview: 2,99 / 4,00. Gegen GLM-5.3: 2,92 (46,8 % Siege / 12,8 % Unentschieden / 40,4 % Niederlagen). Gegen Kimi K3: 2,94 (51,2 / 7,9 / 40,9). Karte und tencent.com stimmen überein. Richter waren Mitarbeiter; die Rubrik ist die des Labors. Kein Aufsichtsbefund, kein Drittrerun.
- 3
Quantzahlen brauchen ein Repo
Die offizielle Karte verweist auf AngelSlim. ThursdAI und die AngelSlim-GGUF-Karte beschreiben STQ1_0 mit etwa 2,38 Bit/Gewicht und etwa 214GB gegen rund 1,5TB unquantisiert. Das ist ein Community-Quant, nicht das Schrumpfen der Apache-Gewichte. Nicht mit dem AA-Index von K2 mischen. Weiteres Open Weight: Qwen3.8-27B.
„Rekursives Self-Improvement“ abwerten
Die Mitteilung sagt, das Modell habe Trainingsmethoden, Datenstrategie, Eval-Rahmen und Operatoren mitoptimiert und der Inferenzdurchsatz sei um 31,8 % gegenüber einer Baseline gestiegen. Es gibt keine Drittreproduktionsrechnung. Labornarrativ, kein unabhängiges Systempapier.
HF-Eval-Zeilen sind kein AA-Index
Die Modellseite hat Zeilen wie Apex Agents und Terminal-Bench. Dieser Text behandelt sie nicht als verifizierten Drittindex. Prüfbar bleiben 770B/49B, Apache 2.0 und der interne Blindtest 2,99/4.
Die Preview listet eigene Mängel
Tencent schreibt zu lange Reasoning-Ketten und Überprüfen, mit Spielraum in Pre- und Post-Training. Rahmen wie Hy3 preview: früh liefern, hören was bricht. Kein GA-Flaggschiff-Anspruch.
| Behauptung | Prüfbare Quelle | Lesart |
|---|---|---|
| 770B / 49B MoE, 1M Kontext | HF-Karte · GitHub Tencent-Hunyuan/Hy4-preview | Architektur laut offizieller Tabelle |
| Blind 2,99 vs 2,92 / 2,94 | Tencent-Post · Karte Built for Productivity | Interne Experten, kein unabhängiger Rerun |
| Apache-2.0-Gewichte | Modellkarte License | LICENSE im Repo vor dem Download |
Tencent: Das ist eine frühe Hy4. In Pre- und Post-Training ist Spielraum. Lieber früh liefern und hören, was bricht — so wurde Hy3 preview besser.
# Hy4 preview · Tencent Hy Team · as of 2026-09
sku: 770B / 49B active # MoE, 1M context
license: Apache-2.0
layers: 78 # 1 dense + 77 MoE
experts: 256 routed + 1 shared; top-8
mtp: 10B / 0.7B active # speculative decode
blind_avg: 2.99/4 # 163 experts, 203 tasks
vs_glm53: 2.92 # 46.8 / 12.8 / 40.4
vs_kimi_k3: 2.94 # 51.2 / 7.9 / 40.9
api_usd_per_m: 0.834 / 2.501 / 0.042Grenzen
- Interner Blindtest ≠ Drittindex
- 2,99 / 2,92 / 2,94 stammen von Tencent-Experten. Nicht als AA Intelligence Index umetikettieren und nicht gegen Vendor-Tabellen geschlossener Labs derselben Woche zum Pokal machen.
- Apache 2.0 ≠ 770B auf einer Box
- Das offizielle Beispiel ist 8-Wege-Tensorparallel plus FP8. AngelSlim-GGUF ist ein anderer Pfad; Tempo und Qualität an der eigenen Last messen.
- Diese Nachrichtenseite ist keine Meeting-Anleitung
- Sie erklärt nur Release und Evals. Für ein kurzes Huddle mit Board: Raum auf wbmeet anlegen, siehe Raum erstellen und beitreten.
Fragen zum Nachprüfen
Ist Hy4 preview der erste Gewichtswurf eines neuen Labors?
Nein. Es kommt vom Hunyuan-/Hy-Team bei Tencent. Die Mitteilung nennt Co-Design mit CodeBuddy, WorkBuddy, Yuanbao und ima sowie eine Hy3-Freiaccess-Verlängerung. Hy4 ist die Preview dieser Generation, kein Gründungsdatum.
Heißt 2,99, es habe GLM-5.3 und Kimi K3 „geschlagen“?
Nicht allein. Der Schnitt liegt nur 0,05–0,07 höher; die GLM-5.3-Siegquote ist 46,8 %, die Niederlagenquote 40,4 %. Tencents Wortlaut: slightly ahead. Richter intern.
Ist das 214GB-Quant der offizielle Default?
Die offizielle Karte liefert AngelSlim und FP8. Die Zahl ~214GB / 2,38 bpw steht auf der AngelSlim-GGUF-Notiz und in Wochenrecaps. Den tatsächlich gezogenen Dateinamen prüfen.
Beweist das, dass Open Weights geschlossene Flaggschiffe eingeholt haben?
Nein. Diese Seite zerlegt nur den prüfbaren Release und die interne Blindformulierung. Geschlossene Vergleiche brauchen eigene Systemkarten und Drittindizes.