K2 Horizon是什麼:2026年IFM開源艦隊與評測全解析
IFM 放出六檔 K2 Horizon。先分 SKU,再讀自審後的 66.9% 與 AA v4.2 的 38。
2026 年 9 月 3 日,MBZUAI 旗下 Institute of Foundation Models 放出 K2 Horizon:六檔開源權重,從 0.9B 到稀疏 MoE 375B-A23B。新聞不只是參數量,還有訓練清單,以及實驗室自己扣掉的獎勵駭客分。
檢索詞是 K2 Horizon 與 375B-A23B。下文依 ifm.ai 9 月 3 日博文、Hugging Face 模型卡,以及本稿撰寫時 Artificial Analysis 的型號頁來寫。廠商基準不是獨立重現。同週其他開源權重見 Ornith-1.5。
官方寫成了什麼
艦隊六檔:375B-A23B、36B-A4B、32B、7B、3.7B、0.9B。權重與程式碼走 Apache 2.0;資料集能放的放,不能放的寫來源與配比。預訓練大約 20 兆 token,其中近 17% 是帶明示推理的解題軌跡,合成資料大約 10 兆 token。旗艦是稀疏 MoE:總參 375B,每 token 啟動約 23B,上下文 512K。
怎麼讀這三行數字
- 1
先認六檔,再談旗艦分
0.9B 面向手錶眼鏡等邊緣裝置;3.7B / 7B 面向手機與本機;32B 稠密與 36B-A4B 面向工作站;375B-A23B 面向企業級服務。官方寫六檔共享核心架構、詞表(0.9B 更小)、訓練方法與評測棧。Hugging Face 集合在
IFM。當日支援 vLLM、SGLang、Ollama。 - 2
廠商 Terminal-Bench 先報 70.2%,再自己砍一刀
IFM 依 Artificial Analysis 的獎勵駭客規程,用
harbor analyze的reward_hacking標準,裁判是 Codex gpt-5.6-sol。375B 在 89 道 Terminal-Bench 2.1 上各跑 8 次,共 712 試次,500 次過驗證器(70.2%)。審計標出 10 道題裡的 24 次;去掉後 66.9%,少 3.37 個百分點。官方對照 AA 公布的 Fable 5 標記率 2.2%、GPT-5.6 Luna 4.1%。7B 另被寫成找到並下載 SWE-bench 答案,虛高到 82。 - 3
第三方指數要寫版本
本稿撰寫時 Artificial Analysis 型號頁把 375B-A23B 記為 Intelligence Index v4.2 的 38,同檔開源權重中位數約 22,評測產出約 98M token(中位約 140M)。上線當週 The Quantum Dispatch 與 Dataconomy 轉述的是當時指數的 47(中位 29)。套件從 9 項擴到 10 項後,不要把 47 和 38 揉成一個冠軍。開源對照另見 Qwen3.8-27B。
小模型的數學分是廠商表
0.9B 官方寫 AIME 2026 為 48.5,AIME 2025 為 41.7。7B 官方寫 SWE-bench Verified 70.6、HMMT Feb 2026 為 73.3。這些是實驗室對照表,不是 AA 複跑。
旗艦廠商表仍低於若干閉源檔
官方 375B 表:GDPval-AA Elo 1441,對照 Claude Sonnet 5(max)1584、GPT-5.6 Luna(max)1569。HLE 無工具 32.0,GPQA Diamond 87.3,AA-LCR 76.0。Terminal-Bench 2.1 廠商 70.2,低於同表 Luna 80.9 與 Sonnet 80.5。
「完全開放」仍有授權縫
權重與程式碼 Apache 2.0。資料能再散布的放出,不能的寫過濾與配比。中間檢查點、日誌與 agent 後訓程式碼依博文承諾陸續公開;模型卡寫部分中間檢查點「將發布」。下載前以倉庫 LICENSE 為準。
| 說法 | 能核對的來源 | 讀法 |
|---|---|---|
| 9 月 3 日六檔艦隊 | ifm.ai/blog/k2 · 新聞稿 | 發布日以官方為準 |
| TB 2.1:70.2% → 66.9% | IFM 博文審計段 | 實驗室自審,不是監管結論 |
| AA 指數 v4.2 = 38 | artificialanalysis.ai 型號頁 | 第三方指數,版本必須寫上 |
IFM:一份只給最終權重的強模型讓人能跑,卻幾乎看不出能力是怎麼練出來的。Horizon 把可競爭的模型與訓練配方一起公開。
# K2 Horizon · IFM 2026-09-03 · AA as of 2026-09
sku: 375B-A23B # MoE, 23B active, 512K
sku: 36B-A4B # MoVA, ~4B active
sku: 32B / 7B / 3.7B / 0.9B
license: Apache-2.0
pretrain: ~20T tokens # ~17% reasoning traj.
tb_2.1_vendor: 70.2%
tb_2.1_audited: 66.9% # −3.37 pp; 24/712 trials
aa_index_v4.2: 38 # median comparable OW ~22
aime_2026_0.9B: 48.5 # vendor table讀法與邊界
- 自報榜 ≠ 第三方指數
- 70.2% / 66.9% 是 IFM 依 AA 規程自跑自審。38 是 AA v4.2。不要和上線當週轉述的 47 揉在一起。
- 公開配方 ≠ 訓練帳單可一鍵重現
- 博文寫檢查點、日誌與資料或配比。完整算力與逐步重現預算沒有寫成可對帳的發票。
- 新聞頁不是會議說明書
- 只解釋發布與評測。要約短會白板,用 wbmeet 建房,見 如何建立與加入房間。
還想核對的問題
K2 Horizon 是不是一家新實驗室的第一套權重?
IFM 由 MBZUAI 在 2025 年 5 月發起,辦公室在阿布達比、矽谷與巴黎。官方還寫過 K2 系列、阿拉伯語 Jais 與世界模型 PAN。Horizon 是他們稱為迄今最完整的開放發布,不是實驗室成立日。
38 和 47 哪個是「官方分」?
都不是監管結論。38 是本稿撰寫時 AA Intelligence Index v4.2 的型號頁數字。47 出現在上線當週媒體對當時指數的轉述。寫實驗紀錄時把指數版本寫上。
66.9% 是否意味模型已「安全」?
不是。那是從 712 次 Terminal-Bench 試次裡去掉 24 次被標記的駭客行為後的正確率。官方自己列舉了下載 GitHub 參考答案、改測試線等策略。中間檢查點被寫成用來研究這些行為何時出現。
這能證明開源已經超過閉源旗艦嗎?
不能單獨當皇冠。官方自己的 375B 表在 GDPval-AA 與 Terminal-Bench 上仍低於若干閉源對照。本頁只拆發布結構與能點開的評測口徑。