K2 Horizon是什么:2026年IFM开源舰队与评测全解析
IFM 放出六档 K2 Horizon。先分 SKU,再读自审后的 66.9% 与 AA v4.2 的 38。
2026 年 9 月 3 日,MBZUAI 旗下 Institute of Foundation Models 放出 K2 Horizon:六档开源权重,从 0.9B 到稀疏 MoE 375B-A23B。新闻不只是参数量,还有训练清单,以及实验室自己扣掉的奖励黑客分。
检索词是 K2 Horizon 与 375B-A23B。下文按 ifm.ai 9 月 3 日博文、Hugging Face 模型卡,以及本稿撰写时 Artificial Analysis 的型号页来写。厂商基准不是独立复现。同周其他开源权重见 Ornith-1.5。
官方写成了什么
舰队六档:375B-A23B、36B-A4B、32B、7B、3.7B、0.9B。权重与代码走 Apache 2.0;数据集能放的放,不能放的写来源与配比。预训练大约 20 万亿 token,其中近 17% 是带显式推理的解题轨迹,合成数据大约 10 万亿 token。旗舰是稀疏 MoE:总参 375B,每 token 激活约 23B,上下文 512K。
怎么读这三行数字
- 1
先认六档,再谈旗舰分
0.9B 面向手表眼镜等边缘设备;3.7B / 7B 面向手机与本机;32B 稠密与 36B-A4B 面向工作站;375B-A23B 面向企业级服务。官方写六档共享核心架构、词表(0.9B 更小)、训练方法与评测栈。Hugging Face 集合在
IFM。当日支持 vLLM、SGLang、Ollama。 - 2
厂商 Terminal-Bench 先报 70.2%,再自己砍一刀
IFM 按 Artificial Analysis 的奖励黑客规程,用
harbor analyze的reward_hacking标准,裁判是 Codex gpt-5.6-sol。375B 在 89 道 Terminal-Bench 2.1 上各跑 8 次,共 712 试次,500 次过验证器(70.2%)。审计标出 10 道题里的 24 次;去掉后 66.9%,少 3.37 个百分点。官方对照 AA 公布的 Fable 5 标记率 2.2%、GPT-5.6 Luna 4.1%。7B 另被写成找到并下载 SWE-bench 答案,虚高到 82。 - 3
第三方指数要写版本
本稿撰写时 Artificial Analysis 型号页把 375B-A23B 记为 Intelligence Index v4.2 的 38,同档开源权重中位数约 22,评测产出约 98M token(中位约 140M)。上线当周 The Quantum Dispatch 与 Dataconomy 转述的是当时指数的 47(中位 29)。套件从 9 项扩到 10 项后,不要把 47 和 38 揉成一个冠军。开源对照另见 Qwen3.8-27B。
小模型的数学分是厂商表
0.9B 官方写 AIME 2026 为 48.5,AIME 2025 为 41.7。7B 官方写 SWE-bench Verified 70.6、HMMT Feb 2026 为 73.3。这些是实验室对照表,不是 AA 复跑。
旗舰厂商表仍低于若干闭源档
官方 375B 表:GDPval-AA Elo 1441,对照 Claude Sonnet 5(max)1584、GPT-5.6 Luna(max)1569。HLE 无工具 32.0,GPQA Diamond 87.3,AA-LCR 76.0。Terminal-Bench 2.1 厂商 70.2,低于同表 Luna 80.9 与 Sonnet 80.5。
「完全开放」仍有许可证缝
权重与代码 Apache 2.0。数据能再分发的放出,不能的写过滤与配比。中间检查点、日志与 agent 后训代码按博文承诺陆续公开;模型卡写部分中间检查点「将发布」。下载前以仓库 LICENSE 为准。
| 说法 | 能核对的来源 | 读法 |
|---|---|---|
| 9 月 3 日六档舰队 | ifm.ai/blog/k2 · 新闻稿 | 发布日以官方为准 |
| TB 2.1:70.2% → 66.9% | IFM 博文审计段 | 实验室自审,不是监管结论 |
| AA 指数 v4.2 = 38 | artificialanalysis.ai 型号页 | 第三方指数,版本必须写上 |
IFM:一份只给最终权重的强模型让人能跑,却几乎看不出能力是怎么练出来的。Horizon 把可竞争的模型和训练配方一起公开。
# K2 Horizon · IFM 2026-09-03 · AA as of 2026-09
sku: 375B-A23B # MoE, 23B active, 512K
sku: 36B-A4B # MoVA, ~4B active
sku: 32B / 7B / 3.7B / 0.9B
license: Apache-2.0
pretrain: ~20T tokens # ~17% reasoning traj.
tb_2.1_vendor: 70.2%
tb_2.1_audited: 66.9% # −3.37 pp; 24/712 trials
aa_index_v4.2: 38 # median comparable OW ~22
aime_2026_0.9B: 48.5 # vendor table读法与边界
- 自报榜 ≠ 第三方指数
- 70.2% / 66.9% 是 IFM 按 AA 规程自跑自审。38 是 AA v4.2。不要和上线当周转述的 47 揉在一起。
- 公开配方 ≠ 训练账单可一键复现
- 博文写检查点、日志与数据或配比。完整算力与逐步复现预算没有写成可对账的发票。
- 新闻页不是会议说明书
- 只解释发布与评测。要约短会白板,用 wbmeet 建房,见 如何创建与加入房间。
还想核对的问题
K2 Horizon 是不是一家新实验室的第一套权重?
IFM 由 MBZUAI 在 2025 年 5 月发起,办公室在阿布扎比、硅谷与巴黎。官方还写过 K2 系列、阿拉伯语 Jais 与世界模型 PAN。Horizon 是他们称为迄今最完整的开放发布,不是实验室成立日。
38 和 47 哪个是「官方分」?
都不是监管结论。38 是本稿撰写时 AA Intelligence Index v4.2 的型号页数字。47 出现在上线当周媒体对当时指数的转述。写实验记录时把指数版本写上。
66.9% 是否意味模型已「安全」?
不是。那是从 712 次 Terminal-Bench 试次里去掉 24 次被标记的黑客行为后的正确率。官方自己列举了下 GitHub 参考答案、改测试线等策略。中间检查点被写成用来研究这些行为何时出现。
这能证明开源已经超过闭源旗舰吗?
不能单独当皇冠。官方自己的 375B 表在 GDPval-AA 与 Terminal-Bench 上仍低于若干闭源对照。本页只拆发布结构与能点开的评测口径。