Hy4 preview是什么:2026年腾讯770B开源与盲测全解析

腾讯放出 Hy4 preview。先分 770B/49B,再读内部盲测 2.99/4 与 preview 缺陷。

2026 年 9 月初,腾讯 Hunyuan 的 Hy 团队放出 Hy4 preview:770B 总参、每 token 约激活 49B 的 MoE,上下文 1M,权重走 Apache 2.0。新闻不在再发明一个参数量,而在官方自己写的内部盲测,以及他们承认的预览缺陷。

检索词是 Hy4 preview770B / 49B。下文按腾讯官网新闻稿、Hugging Face 的 tencent/Hy4-preview 模型卡,以及 ThursdAI 9 月周报来写。部分综述把首发写到 8 月 28 日;以官方卡与新闻稿为准,不要自行合并成一个船期。同周其他开源舰队见 K2 Horizon

770B / 49B Apache 2.0内部盲测 2.99 / 4官方称 preview

官方写成了什么

旗舰是稀疏 MoE:总参 770B,每 token 激活约 49B。骨干 78 层,第 1 层稠密 FFN,其余 77 层各有 256 个路由专家加 1 个共享专家,每 token 取 top-8 再加共享专家。另有一层原生 MTP(总参 10B,激活约 0.7B)给推测解码。注意力写 Gated DSA 加 IndexCache,残差走 iHC,四条残差流。词表 120832,上下文 1M。

2.99/4
内部盲测均分
2.92
对照 GLM-5.3
2.94
对照 Kimi K3

怎么读这三行数字

  1. 1

    先认 SKU,再谈均分

    官方服务建议 vLLM 镜像 vllm/vllm-openai:hy4-preview 或 SGLang lmsysorg/sglang:hy4-preview,示例用 FP8 加 8 路张量并行。推理默认 high 思维链;要直接答可传 no_think。定价写在腾讯新闻稿:输入 0.834、输出 2.501、缓存命中 0.042 美元 / 百万 token。WorkBuddy / CodeBuddy 上线两周免费,Hy3 免费延到 9 月 30 日。

  2. 2

    2.99 是厂商内部盲评

    163 名腾讯内部专家评 203 道工程题。Hy4 preview 均分 2.99 / 4.00。对照 GLM-5.3 为 2.92(胜 46.8% / 平 12.8% / 负 40.4%),对照 Kimi K3 为 2.94(胜 51.2% / 平 7.9% / 负 40.9%)。模型卡与官网数字一致。评委是内部员工,量表是实验室自己的,不是监管结论,也不是第三方复跑。

  3. 3

    量化数字要写仓库

    官方卡指向压缩工具 AngelSlim。ThursdAI 与 AngelSlim 的 GGUF 卡把 STQ1_0 写成约 2.38 bit/weight、约 214GB,对照未量化约 1.5TB。这是社区量化配方,不是 Apache 权重本身变小。不要和 K2 的 AA 指数揉成一张表。另见 Qwen3.8-27B

01

自报「递归自改进」要降权

官网写模型参与训练方法、数据策略、评测框架和算子的自动优化,并称推理端到端吞吐相对基线高 31.8%。没有第三方复现账单。把它当实验室自述,不当独立系统评测。

02

HF 评测行不是 AA 指数

模型页挂过 Apex Agents、Terminal-Bench 等行。本稿不把那些行写成已核实的第三方指数。能对上原文的是 770B/49B、Apache 2.0、以及 2.99/4 内部盲评。

03

preview 自己列了缺陷

官方写推理链偏长、过度自检,预训练和后训都还有空间。他们把这代写成跟 Hy3 preview 一样的「先出再听」策略,不是 GA 旗舰声明。

说法能核对的来源读法
770B / 49B MoE,1M 上下文HF 模型卡 · GitHub Tencent-Hunyuan/Hy4-preview架构以官方表为准
盲测 2.99 vs 2.92 / 2.94腾讯新闻稿 · 模型卡 Built for Productivity内部专家,不是独立复跑
Apache 2.0 权重模型卡 License下载前读仓库 LICENSE

腾讯:这是 Hy4 的早期版本。预训练和后训都还有空间。我们宁可先出、听哪里会坏——Hy3 preview 就是这样变好的。

# Hy4 preview · Tencent Hy Team · as of 2026-09
sku: 770B / 49B active     # MoE, 1M context
license: Apache-2.0
layers: 78                 # 1 dense + 77 MoE
experts: 256 routed + 1 shared; top-8
mtp: 10B / 0.7B active     # speculative decode
blind_avg: 2.99/4          # 163 experts, 203 tasks
vs_glm53: 2.92             # 46.8 / 12.8 / 40.4
vs_kimi_k3: 2.94           # 51.2 / 7.9 / 40.9
api_usd_per_m: 0.834 / 2.501 / 0.042

读法与边界

内部盲评 ≠ 第三方指数
2.99 / 2.92 / 2.94 是腾讯内部专家打的分。不要写成 AA Intelligence Index,也不要和同周闭源旗舰的自报榜直接比皇冠。
Apache 2.0 ≠ 单机就能跑 770B
官方示例是 8 卡张量并行加 FP8。AngelSlim 的低比特 GGUF 是另一条部署路径,速度与能力损失要以你自己的负载测。
新闻页不是会议说明书
只解释发布与评测。要约短会白板,用 wbmeet 建房,见 如何创建与加入房间

还想核对的问题

Hy4 preview 是不是新实验室的第一套权重?

不是。它由腾讯 Hunyuan / Hy 团队发布,官网还写了与 CodeBuddy、WorkBuddy、元宝、ima 的产品共设计,以及 Hy3 的免费延期。Hy4 是这一代的 preview,不是实验室成立日。

2.99 能不能当成「已超过 GLM-5.3 与 Kimi K3」?

不能单独当皇冠。均分只高 0.05–0.07,对 GLM-5.3 的胜率 46.8%,负率仍有 40.4%。官方自己写的是 slightly ahead。评委是内部专家。

214GB 量化是不是官方标配?

官方卡提供的是 AngelSlim 工具链和 FP8 档。约 214GB / 2.38 bpw 出现在 AngelSlim GGUF 说明与周报转述里。部署前以你实际拉取的文件名为准。

这能证明开源已经对齐闭源旗舰吗?

不能。本页只拆可点开的发布结构与内部盲评口径。闭源对照要用各自系统卡和第三方指数,不要用这一张内部表代替。

免费开始开会