Hy4 preview是什么:2026年腾讯770B开源与盲测全解析
腾讯放出 Hy4 preview。先分 770B/49B,再读内部盲测 2.99/4 与 preview 缺陷。
2026 年 9 月初,腾讯 Hunyuan 的 Hy 团队放出 Hy4 preview:770B 总参、每 token 约激活 49B 的 MoE,上下文 1M,权重走 Apache 2.0。新闻不在再发明一个参数量,而在官方自己写的内部盲测,以及他们承认的预览缺陷。
检索词是 Hy4 preview 与 770B / 49B。下文按腾讯官网新闻稿、Hugging Face 的 tencent/Hy4-preview 模型卡,以及 ThursdAI 9 月周报来写。部分综述把首发写到 8 月 28 日;以官方卡与新闻稿为准,不要自行合并成一个船期。同周其他开源舰队见 K2 Horizon。
官方写成了什么
旗舰是稀疏 MoE:总参 770B,每 token 激活约 49B。骨干 78 层,第 1 层稠密 FFN,其余 77 层各有 256 个路由专家加 1 个共享专家,每 token 取 top-8 再加共享专家。另有一层原生 MTP(总参 10B,激活约 0.7B)给推测解码。注意力写 Gated DSA 加 IndexCache,残差走 iHC,四条残差流。词表 120832,上下文 1M。
怎么读这三行数字
- 1
先认 SKU,再谈均分
官方服务建议 vLLM 镜像
vllm/vllm-openai:hy4-preview或 SGLanglmsysorg/sglang:hy4-preview,示例用 FP8 加 8 路张量并行。推理默认 high 思维链;要直接答可传no_think。定价写在腾讯新闻稿:输入 0.834、输出 2.501、缓存命中 0.042 美元 / 百万 token。WorkBuddy / CodeBuddy 上线两周免费,Hy3 免费延到 9 月 30 日。 - 2
2.99 是厂商内部盲评
163 名腾讯内部专家评 203 道工程题。Hy4 preview 均分 2.99 / 4.00。对照 GLM-5.3 为 2.92(胜 46.8% / 平 12.8% / 负 40.4%),对照 Kimi K3 为 2.94(胜 51.2% / 平 7.9% / 负 40.9%)。模型卡与官网数字一致。评委是内部员工,量表是实验室自己的,不是监管结论,也不是第三方复跑。
- 3
量化数字要写仓库
官方卡指向压缩工具 AngelSlim。ThursdAI 与 AngelSlim 的 GGUF 卡把 STQ1_0 写成约 2.38 bit/weight、约 214GB,对照未量化约 1.5TB。这是社区量化配方,不是 Apache 权重本身变小。不要和 K2 的 AA 指数揉成一张表。另见 Qwen3.8-27B。
自报「递归自改进」要降权
官网写模型参与训练方法、数据策略、评测框架和算子的自动优化,并称推理端到端吞吐相对基线高 31.8%。没有第三方复现账单。把它当实验室自述,不当独立系统评测。
HF 评测行不是 AA 指数
模型页挂过 Apex Agents、Terminal-Bench 等行。本稿不把那些行写成已核实的第三方指数。能对上原文的是 770B/49B、Apache 2.0、以及 2.99/4 内部盲评。
preview 自己列了缺陷
官方写推理链偏长、过度自检,预训练和后训都还有空间。他们把这代写成跟 Hy3 preview 一样的「先出再听」策略,不是 GA 旗舰声明。
| 说法 | 能核对的来源 | 读法 |
|---|---|---|
| 770B / 49B MoE,1M 上下文 | HF 模型卡 · GitHub Tencent-Hunyuan/Hy4-preview | 架构以官方表为准 |
| 盲测 2.99 vs 2.92 / 2.94 | 腾讯新闻稿 · 模型卡 Built for Productivity | 内部专家,不是独立复跑 |
| Apache 2.0 权重 | 模型卡 License | 下载前读仓库 LICENSE |
腾讯:这是 Hy4 的早期版本。预训练和后训都还有空间。我们宁可先出、听哪里会坏——Hy3 preview 就是这样变好的。
# Hy4 preview · Tencent Hy Team · as of 2026-09
sku: 770B / 49B active # MoE, 1M context
license: Apache-2.0
layers: 78 # 1 dense + 77 MoE
experts: 256 routed + 1 shared; top-8
mtp: 10B / 0.7B active # speculative decode
blind_avg: 2.99/4 # 163 experts, 203 tasks
vs_glm53: 2.92 # 46.8 / 12.8 / 40.4
vs_kimi_k3: 2.94 # 51.2 / 7.9 / 40.9
api_usd_per_m: 0.834 / 2.501 / 0.042读法与边界
- 内部盲评 ≠ 第三方指数
- 2.99 / 2.92 / 2.94 是腾讯内部专家打的分。不要写成 AA Intelligence Index,也不要和同周闭源旗舰的自报榜直接比皇冠。
- Apache 2.0 ≠ 单机就能跑 770B
- 官方示例是 8 卡张量并行加 FP8。AngelSlim 的低比特 GGUF 是另一条部署路径,速度与能力损失要以你自己的负载测。
- 新闻页不是会议说明书
- 只解释发布与评测。要约短会白板,用 wbmeet 建房,见 如何创建与加入房间。
还想核对的问题
Hy4 preview 是不是新实验室的第一套权重?
不是。它由腾讯 Hunyuan / Hy 团队发布,官网还写了与 CodeBuddy、WorkBuddy、元宝、ima 的产品共设计,以及 Hy3 的免费延期。Hy4 是这一代的 preview,不是实验室成立日。
2.99 能不能当成「已超过 GLM-5.3 与 Kimi K3」?
不能单独当皇冠。均分只高 0.05–0.07,对 GLM-5.3 的胜率 46.8%,负率仍有 40.4%。官方自己写的是 slightly ahead。评委是内部专家。
214GB 量化是不是官方标配?
官方卡提供的是 AngelSlim 工具链和 FP8 档。约 214GB / 2.38 bpw 出现在 AngelSlim GGUF 说明与周报转述里。部署前以你实际拉取的文件名为准。
这能证明开源已经对齐闭源旗舰吗?
不能。本页只拆可点开的发布结构与内部盲评口径。闭源对照要用各自系统卡和第三方指数,不要用这一张内部表代替。