Hy4 preview是什麼:2026年騰訊770B開源與盲測全解析

騰訊放出 Hy4 preview。先分 770B/49B,再讀內部盲測 2.99/4 與 preview 缺陷。

2026 年 9 月初,騰訊 Hunyuan 的 Hy 團隊放出 Hy4 preview:770B 總參、每 token 約啟動 49B 的 MoE,上下文 1M,權重走 Apache 2.0。新聞不在再發明一個參數量,而在官方自己寫的內部盲測,以及他們承認的預覽缺陷。

檢索詞是 Hy4 preview770B / 49B。下文依騰訊官網新聞稿、Hugging Face 的 tencent/Hy4-preview 模型卡,以及 ThursdAI 9 月週報來寫。部分綜述把首發寫到 8 月 28 日;以官方卡與新聞稿為準,不要自行合併成一個船期。同週其他開源艦隊見 K2 Horizon

770B / 49B Apache 2.0內部盲測 2.99 / 4官方稱 preview

官方寫成了什麼

旗艦是稀疏 MoE:總參 770B,每 token 啟動約 49B。骨幹 78 層,第 1 層稠密 FFN,其餘 77 層各有 256 個路由專家加 1 個共享專家,每 token 取 top-8 再加共享專家。另有一層原生 MTP(總參 10B,啟動約 0.7B)給推測解碼。注意力寫 Gated DSA 加 IndexCache,殘差走 iHC,四條殘差流。詞表 120832,上下文 1M。

2.99/4
內部盲測均分
2.92
對照 GLM-5.3
2.94
對照 Kimi K3

怎麼讀這三行數字

  1. 1

    先認 SKU,再談均分

    官方服務建議 vLLM 鏡像 vllm/vllm-openai:hy4-preview 或 SGLang lmsysorg/sglang:hy4-preview,示例用 FP8 加 8 路張量並行。推理預設 high 思維鏈;要直接答可傳 no_think。定價寫在騰訊新聞稿:輸入 0.834、輸出 2.501、快取命中 0.042 美元 / 百萬 token。WorkBuddy / CodeBuddy 上線兩週免費,Hy3 免費延到 9 月 30 日。

  2. 2

    2.99 是廠商內部盲評

    163 名騰訊內部專家評 203 道工程題。Hy4 preview 均分 2.99 / 4.00。對照 GLM-5.3 為 2.92(勝 46.8% / 平 12.8% / 負 40.4%),對照 Kimi K3 為 2.94(勝 51.2% / 平 7.9% / 負 40.9%)。模型卡與官網數字一致。評委是內部員工,量表是實驗室自己的,不是監管結論,也不是第三方複跑。

  3. 3

    量化數字要寫倉庫

    官方卡指向壓縮工具 AngelSlim。ThursdAI 與 AngelSlim 的 GGUF 卡把 STQ1_0 寫成約 2.38 bit/weight、約 214GB,對照未量化約 1.5TB。這是社群量化配方,不是 Apache 權重本身變小。不要和 K2 的 AA 指數揉成一張表。另見 Qwen3.8-27B

01

自報「遞迴自改進」要降權

官網寫模型參與訓練方法、資料策略、評測框架和算子的自動最佳化,並稱推理端到端吞吐相對基線高 31.8%。沒有第三方重現帳單。把它當實驗室自述,不當獨立系統評測。

02

HF 評測行不是 AA 指數

模型頁掛過 Apex Agents、Terminal-Bench 等行。本稿不把那些行寫成已核實的第三方指數。能對上原文的是 770B/49B、Apache 2.0,以及 2.99/4 內部盲評。

03

preview 自己列了缺陷

官方寫推理鏈偏長、過度自檢,預訓練和後訓都還有空間。他們把這代寫成跟 Hy3 preview 一樣的「先出再聽」策略,不是 GA 旗艦聲明。

說法能核對的來源讀法
770B / 49B MoE,1M 上下文HF 模型卡 · GitHub Tencent-Hunyuan/Hy4-preview架構以官方表為準
盲測 2.99 vs 2.92 / 2.94騰訊新聞稿 · 模型卡 Built for Productivity內部專家,不是獨立複跑
Apache 2.0 權重模型卡 License下載前讀倉庫 LICENSE

騰訊:這是 Hy4 的早期版本。預訓練和後訓都還有空間。我們寧可先出、聽哪裡會壞——Hy3 preview 就是這樣變好的。

# Hy4 preview · Tencent Hy Team · as of 2026-09
sku: 770B / 49B active     # MoE, 1M context
license: Apache-2.0
layers: 78                 # 1 dense + 77 MoE
experts: 256 routed + 1 shared; top-8
mtp: 10B / 0.7B active     # speculative decode
blind_avg: 2.99/4          # 163 experts, 203 tasks
vs_glm53: 2.92             # 46.8 / 12.8 / 40.4
vs_kimi_k3: 2.94           # 51.2 / 7.9 / 40.9
api_usd_per_m: 0.834 / 2.501 / 0.042

讀法與邊界

內部盲評 ≠ 第三方指數
2.99 / 2.92 / 2.94 是騰訊內部專家打的分。不要寫成 AA Intelligence Index,也不要和同週閉源旗艦的自報榜直接比皇冠。
Apache 2.0 ≠ 單機就能跑 770B
官方示例是 8 卡張量並行加 FP8。AngelSlim 的低位元 GGUF 是另一條部署路徑,速度與能力損失要以你自己的負載測。
新聞頁不是會議說明書
只解釋發布與評測。要約短會白板,用 wbmeet 建房,見 如何建立與加入房間

還想核對的問題

Hy4 preview 是不是新實驗室的第一套權重?

不是。它由騰訊 Hunyuan / Hy 團隊發布,官網還寫了與 CodeBuddy、WorkBuddy、元寶、ima 的產品共設計,以及 Hy3 的免費延期。Hy4 是這一代的 preview,不是實驗室成立日。

2.99 能不能當成「已超過 GLM-5.3 與 Kimi K3」?

不能單獨當皇冠。均分只高 0.05–0.07,對 GLM-5.3 的勝率 46.8%,負率仍有 40.4%。官方自己寫的是 slightly ahead。評委是內部專家。

214GB 量化是不是官方標配?

官方卡提供的是 AngelSlim 工具鏈和 FP8 檔。約 214GB / 2.38 bpw 出現在 AngelSlim GGUF 說明與週報轉述裡。部署前以你實際拉取的檔名為準。

這能證明開源已經對齊閉源旗艦嗎?

不能。本頁只拆可點開的發布結構與內部盲評口徑。閉源對照要用各自系統卡和第三方指數,不要用這一張內部表代替。

免費開始開會