Hy4 preview是什麼:2026年騰訊770B開源與盲測全解析
騰訊放出 Hy4 preview。先分 770B/49B,再讀內部盲測 2.99/4 與 preview 缺陷。
2026 年 9 月初,騰訊 Hunyuan 的 Hy 團隊放出 Hy4 preview:770B 總參、每 token 約啟動 49B 的 MoE,上下文 1M,權重走 Apache 2.0。新聞不在再發明一個參數量,而在官方自己寫的內部盲測,以及他們承認的預覽缺陷。
檢索詞是 Hy4 preview 與 770B / 49B。下文依騰訊官網新聞稿、Hugging Face 的 tencent/Hy4-preview 模型卡,以及 ThursdAI 9 月週報來寫。部分綜述把首發寫到 8 月 28 日;以官方卡與新聞稿為準,不要自行合併成一個船期。同週其他開源艦隊見 K2 Horizon。
官方寫成了什麼
旗艦是稀疏 MoE:總參 770B,每 token 啟動約 49B。骨幹 78 層,第 1 層稠密 FFN,其餘 77 層各有 256 個路由專家加 1 個共享專家,每 token 取 top-8 再加共享專家。另有一層原生 MTP(總參 10B,啟動約 0.7B)給推測解碼。注意力寫 Gated DSA 加 IndexCache,殘差走 iHC,四條殘差流。詞表 120832,上下文 1M。
怎麼讀這三行數字
- 1
先認 SKU,再談均分
官方服務建議 vLLM 鏡像
vllm/vllm-openai:hy4-preview或 SGLanglmsysorg/sglang:hy4-preview,示例用 FP8 加 8 路張量並行。推理預設 high 思維鏈;要直接答可傳no_think。定價寫在騰訊新聞稿:輸入 0.834、輸出 2.501、快取命中 0.042 美元 / 百萬 token。WorkBuddy / CodeBuddy 上線兩週免費,Hy3 免費延到 9 月 30 日。 - 2
2.99 是廠商內部盲評
163 名騰訊內部專家評 203 道工程題。Hy4 preview 均分 2.99 / 4.00。對照 GLM-5.3 為 2.92(勝 46.8% / 平 12.8% / 負 40.4%),對照 Kimi K3 為 2.94(勝 51.2% / 平 7.9% / 負 40.9%)。模型卡與官網數字一致。評委是內部員工,量表是實驗室自己的,不是監管結論,也不是第三方複跑。
- 3
量化數字要寫倉庫
官方卡指向壓縮工具 AngelSlim。ThursdAI 與 AngelSlim 的 GGUF 卡把 STQ1_0 寫成約 2.38 bit/weight、約 214GB,對照未量化約 1.5TB。這是社群量化配方,不是 Apache 權重本身變小。不要和 K2 的 AA 指數揉成一張表。另見 Qwen3.8-27B。
自報「遞迴自改進」要降權
官網寫模型參與訓練方法、資料策略、評測框架和算子的自動最佳化,並稱推理端到端吞吐相對基線高 31.8%。沒有第三方重現帳單。把它當實驗室自述,不當獨立系統評測。
HF 評測行不是 AA 指數
模型頁掛過 Apex Agents、Terminal-Bench 等行。本稿不把那些行寫成已核實的第三方指數。能對上原文的是 770B/49B、Apache 2.0,以及 2.99/4 內部盲評。
preview 自己列了缺陷
官方寫推理鏈偏長、過度自檢,預訓練和後訓都還有空間。他們把這代寫成跟 Hy3 preview 一樣的「先出再聽」策略,不是 GA 旗艦聲明。
| 說法 | 能核對的來源 | 讀法 |
|---|---|---|
| 770B / 49B MoE,1M 上下文 | HF 模型卡 · GitHub Tencent-Hunyuan/Hy4-preview | 架構以官方表為準 |
| 盲測 2.99 vs 2.92 / 2.94 | 騰訊新聞稿 · 模型卡 Built for Productivity | 內部專家,不是獨立複跑 |
| Apache 2.0 權重 | 模型卡 License | 下載前讀倉庫 LICENSE |
騰訊:這是 Hy4 的早期版本。預訓練和後訓都還有空間。我們寧可先出、聽哪裡會壞——Hy3 preview 就是這樣變好的。
# Hy4 preview · Tencent Hy Team · as of 2026-09
sku: 770B / 49B active # MoE, 1M context
license: Apache-2.0
layers: 78 # 1 dense + 77 MoE
experts: 256 routed + 1 shared; top-8
mtp: 10B / 0.7B active # speculative decode
blind_avg: 2.99/4 # 163 experts, 203 tasks
vs_glm53: 2.92 # 46.8 / 12.8 / 40.4
vs_kimi_k3: 2.94 # 51.2 / 7.9 / 40.9
api_usd_per_m: 0.834 / 2.501 / 0.042讀法與邊界
- 內部盲評 ≠ 第三方指數
- 2.99 / 2.92 / 2.94 是騰訊內部專家打的分。不要寫成 AA Intelligence Index,也不要和同週閉源旗艦的自報榜直接比皇冠。
- Apache 2.0 ≠ 單機就能跑 770B
- 官方示例是 8 卡張量並行加 FP8。AngelSlim 的低位元 GGUF 是另一條部署路徑,速度與能力損失要以你自己的負載測。
- 新聞頁不是會議說明書
- 只解釋發布與評測。要約短會白板,用 wbmeet 建房,見 如何建立與加入房間。
還想核對的問題
Hy4 preview 是不是新實驗室的第一套權重?
不是。它由騰訊 Hunyuan / Hy 團隊發布,官網還寫了與 CodeBuddy、WorkBuddy、元寶、ima 的產品共設計,以及 Hy3 的免費延期。Hy4 是這一代的 preview,不是實驗室成立日。
2.99 能不能當成「已超過 GLM-5.3 與 Kimi K3」?
不能單獨當皇冠。均分只高 0.05–0.07,對 GLM-5.3 的勝率 46.8%,負率仍有 40.4%。官方自己寫的是 slightly ahead。評委是內部專家。
214GB 量化是不是官方標配?
官方卡提供的是 AngelSlim 工具鏈和 FP8 檔。約 214GB / 2.38 bpw 出現在 AngelSlim GGUF 說明與週報轉述裡。部署前以你實際拉取的檔名為準。
這能證明開源已經對齊閉源旗艦嗎?
不能。本頁只拆可點開的發布結構與內部盲評口徑。閉源對照要用各自系統卡和第三方指數,不要用這一張內部表代替。