Hy4 preview 2026 : 770B Tencent, poids Apache et test à l’aveugle

Tencent a ouvert Hy4 preview. Séparer le SKU 770B/49B, l’aveugle interne 2,99/4 et les limites de preview.

Début septembre 2026, l’équipe Hy de Hunyuan (Tencent) a publié Hy4 preview : 770B au total, environ 49B actifs par token, contexte 1M, poids en Apache 2.0. L’actualité n’est pas le compte de paramètres, mais l’évaluation à l’aveugle interne — et les défauts de preview que le labo a lui-même listés.

La requête est Hy4 preview et 770B / 49B. Cette page suit l’annonce Tencent, la fiche Hugging Face tencent/Hy4-preview et le tracker ThursdAI de septembre. Certains recaps datent le premier dépôt au 28 août ; ne pas inventer une date de sortie que les posts officiels n’impriment pas. Autre flotte ouverte la même semaine : K2 Horizon.

770B / 49B Apache 2.0Aveugle interne 2,99 / 4Officiellement preview

Ce que le labo dit avoir livré

Le vaisseau est un MoE creux : 770B au total, environ 49B actifs par token. 78 couches — FFN dense en couche 1, puis 77 couches MoE avec 256 experts routés plus un partagé, top-8 plus le partagé par token. Une couche MTP native (10B au total, ~0,7B actifs) sert au décodage spéculatif. Attention : Gated DSA avec IndexCache ; résidus : iHC sur quatre flux. Vocabulaire 120832, contexte 1M.

2.99/4
Moyenne aveugle interne
2.92
contre GLM-5.3
2.94
contre Kimi K3

Comment lire les trois chiffres

  1. 1

    Nommer le SKU avant la moyenne

    Les recettes de service citent l’image vLLM vllm/vllm-openai:hy4-preview ou SGLang lmsysorg/sglang:hy4-preview, FP8 et parallélisme tenseur 8 voies. Raisonnement high par défaut ; no_think pour une réponse directe. Prix API annoncés : 0,834 / 2,501 / 0,042 USD par million de tokens (entrée / sortie / cache). WorkBuddy et CodeBuddy gratuits deux semaines ; accès Hy3 prolongé jusqu’au 30 septembre.

  2. 2

    2,99 est une note interne à l’aveugle

    163 experts Tencent ont noté 203 tâches d’ingénierie. Hy4 preview : 2,99 / 4,00. Contre GLM-5.3 : 2,92 (46,8 % de victoires / 12,8 % de nuls / 40,4 % de défaites). Contre Kimi K3 : 2,94 (51,2 / 7,9 / 40,9). La fiche et tencent.com concordent. Juges salariés ; grille du labo. Ni constat régulateur, ni rerun tiers.

  3. 3

    Les chiffres de quantification exigent un dépôt

    La fiche officielle pointe AngelSlim. ThursdAI et la fiche GGUF AngelSlim décrivent un build STQ1_0 à environ 2,38 bits/poids et 214 Go, contre environ 1,5 To non quantifié. Recette communautaire, pas un rétrécissement des poids Apache. Ne pas le fondre avec l’indice AA de K2. Autre page open-weight : Qwen3.8-27B.

01

Décoter l’« auto-amélioration récursive »

L’annonce dit que le modèle a aidé à optimiser méthodes d’entraînement, stratégie de données, cadres d’éval et opérateurs, et que le débit d’inférence a augmenté de 31,8 % face à une baseline. Pas de facture de reproduction tierce. Récit de labo, pas un papier systèmes indépendant.

02

Les lignes d’éval HF ne sont pas un indice AA

La page modèle a hébergé des lignes Apex Agents et Terminal-Bench. Cet article ne les traite pas comme un indice tiers vérifié. Les faits vérifiables restent 770B/49B, Apache 2.0 et l’aveugle interne 2,99/4.

03

La preview liste ses propres défauts

Tencent écrit des chaînes de raisonnement trop longues et une sur-vérification, avec de la marge en pré-entraînement et post-entraînement. Cadre comme Hy3 preview : livrer tôt, écouter ce qui casse. Pas une revendication de vaisseau GA.

AffirmationSource vérifiableLecture
770B / 49B MoE, contexte 1MFiche HF · GitHub Tencent-Hunyuan/Hy4-previewArchitecture selon le tableau officiel
Aveugle 2,99 vs 2,92 / 2,94Post Tencent · fiche Built for ProductivityExperts internes, pas un rerun indépendant
Poids Apache 2.0License de la ficheLire le LICENSE du dépôt avant téléchargement

Tencent : c’est une Hy4 précoce. Il reste de la marge en pré- et post-entraînement. Nous préférons livrer tôt et entendre ce qui casse — c’est ce qui a amélioré Hy3 preview.

# Hy4 preview · Tencent Hy Team · as of 2026-09
sku: 770B / 49B active     # MoE, 1M context
license: Apache-2.0
layers: 78                 # 1 dense + 77 MoE
experts: 256 routed + 1 shared; top-8
mtp: 10B / 0.7B active     # speculative decode
blind_avg: 2.99/4          # 163 experts, 203 tasks
vs_glm53: 2.92             # 46.8 / 12.8 / 40.4
vs_kimi_k3: 2.94           # 51.2 / 7.9 / 40.9
api_usd_per_m: 0.834 / 2.501 / 0.042

Limites

Aveugle interne ≠ indice tiers
2,99 / 2,92 / 2,94 viennent d’experts Tencent. Ne pas les relabeler en Intelligence Index AA, ni en faire un trophée contre les tables constructeur des labos fermés de la même semaine.
Apache 2.0 ≠ 770B sur une seule machine
L’exemple officiel est un parallélisme tenseur 8 voies plus FP8. Le GGUF bas bits AngelSlim est un autre chemin ; mesurer vitesse et qualité sur votre charge.
Cette page n’est pas un mode d’emploi de réunion
Elle n’explique que la sortie et les évals. Pour un huddle court avec tableau, créer une salle sur wbmeet ; voir créer et rejoindre une salle.

Questions à vérifier

Hy4 preview est-il le premier dépôt d’un labo tout neuf ?

Non. Il vient de l’équipe Hunyuan / Hy de Tencent. L’annonce cite aussi le co-design avec CodeBuddy, WorkBuddy, Yuanbao et ima, plus une prolongation d’accès gratuit Hy3. Hy4 est la preview de cette génération, pas une date de fondation.

2,99 veut-il dire qu’il a « battu » GLM-5.3 et Kimi K3 ?

Pas à lui seul. L’écart de moyenne n’est que 0,05–0,07 ; le taux de victoire face à GLM-5.3 est 46,8 %, le taux de défaite 40,4 %. Le libellé officiel est slightly ahead. Juges internes.

Le quant 214 Go est-il le défaut officiel ?

La fiche officielle livre AngelSlim et le FP8. Le chiffre ~214 Go / 2,38 bpw apparaît sur la note GGUF AngelSlim et dans les recaps hebdo. Vérifier le nom de fichier réellement tiré.

Cela prouve-t-il que les poids ouverts ont rattrapé les vaisseaux fermés ?

Non. Cette page ne démonte que la sortie vérifiable et le libellé de l’aveugle interne. Les comparateurs fermés exigent leurs cartes système et des indices tiers.

Démarrer une réunion gratuite