EVIE-8B是什么:2026年腾讯ViDoRe文档检索与评测全解析
腾讯放出 EVIE 两档检索权重。先分 8.41B / 4.61B,再读 ViDoRe 厂商表与压缩档落差。
2026 年 9 月 7 日前后,腾讯 IMA 产品中心与优图实验室放出 EVIE-8B 与 EVIE-4.5B:把扫描页、表格和幻灯当图像检索,不先抽文本。新闻不在再发明一个聊天旗舰,而在厂商自己的 ViDoRe 表,以及压缩档和满分档不是同一行。
检索词是 EVIE-8B 与 ViDoRe V3。下文按 Hugging Face 的 tencent/EVIE-8B / tencent/EVIE-4.5B 模型卡、GitHub Tencent/EVIE,以及 DataNorth 9 月 7 日综述来写。分数是厂商协议,不要写成独立实验室复跑。同月另一份腾讯开源见 Hy4 preview。
官方写成了什么
EVIE 全称 Evidence-Vector-Informed Embedding。两档都走 ColQwen3.5 晚交互:一页存数百个向量,用 MaxSim 打分,而不是压成一个摘要向量。8B 是教师,双向注意力,4096 维;4.5B 是学生,单投影 Prefix-MRL。作者卡写王紫菲(IMA)与温伟(优图,通讯)。训练写 775,635 对文档-查询;放出的 a40 是两臂权重混合(α=0.40)。技术报告写即将更新。底座家族另见 Qwen3.8-27B。
怎么读这三行数字
- 1
先认 SKU,再谈 66.75
8B 跑 colpali-engine 或 Sentence Transformers 的 MultiVectorEncoder,示例开 FlashAttention 与双向注意力。4.5B 可在查询时把 2048 维截到 1024、512、256、128 或 64,不必换模型。卡上写 128 维时 ViDoRe V3 从 66.02 落到 65.27。许可 Apache 2.0,覆盖权重与配套代码。
- 2
66.75 是厂商自定义协议
V3 写 8 个领域 × 6 种查询语言。8B 均分 66.75,领域从计算机 81.86 到物理 52.11。对照行:webAI-ColVec1.1-8b 65.32,VultronRetrieverPrime-8B 64.26,nemotron-colembed-vl-8b-v2 63.54。V1 nDCG@5 上 NVIDIA 该档 92.65,EVIE-8B 92.18。皇冠只挂在较新的 V2/V3。
- 3
3.81 GiB 对应另一行分数
HAC 无需再训练,把约 750 个页向量收到 32 或 64。卡上默认压缩是 d64 K32,百万页 3.81 GiB。同一张表:未压缩 4.5B 的 V3 是 66.02;压缩后 59.58,略低于 tomoro-colqwen3-embed-4b 的 60.16。两行都在厂商表里,不要只摘亮点。
晚交互换的是存储,不是魔术
一页几百个向量能保住表格和版式,索引也会胀。Prefix-MRL 切宽度,HAC 切条数。卡承认压缩与满分不能同时成立。
138 项不是 AA 指数
四套量表是 nDCG、Recall、MAP、MRR。宏平均写在卡上,例如 8B 的四榜 nDCG@10 宏平均 79.51。不要把它改贴成 Artificial Analysis Intelligence Index。
论文与显存数字还没出
发布说明写权重、推理与评测套件已开源,架构消融与正式论文「即将更新」。速度与显存峰值卡上没有给一张部署账单。
| 说法 | 能核对的来源 | 读法 |
|---|---|---|
| 8.41B / 4.61B,Apache 2.0 | HF 模型卡 · GitHub Tencent/EVIE | 架构以官方表为准 |
| V3 66.75 / 66.02 | 模型卡 ViDoRe 对照表 | 厂商协议,不是独立复跑 |
| 3.81 GiB 与 59.58 | 4.5B 卡 HAC / Prefix-MRL 行 | 压缩档另计,不要和满分混一行 |
腾讯模型卡:完整技术细节、架构消融与正式论文将在后续更新。对照分是否与自家协议同机复跑,卡上没有承诺。
# EVIE · Tencent IMA / Youtu · as of 2026-09
sku_8b: 8.41B on Qwen3.5-9B, 4096D
sku_45: 4.61B on Qwen3.5-4B, Prefix-MRL 64–2048D
license: Apache-2.0
hf: tencent/EVIE-8B · tencent/EVIE-4.5B
vidore_v3_ndcg10: 66.75 / 66.02
protocol: paired-all-pages-dedup+process_queries+ndcg2r-20260827
hac_index: 3.81 GiB / 1M pages (d64 K32)
compressed_v3: 59.58 (4.5B d64 K32)读法与边界
- 厂商 ViDoRe ≠ 第三方指数
- 66.75 / 66.02 挂在自定义协议上。不要改贴成 AA Intelligence Index,也不要和同周聊天旗舰的自报榜比皇冠。
- Apache 2.0 ≠ 压缩后仍是 66.02
- 许可覆盖商用自托管。3.81 GiB 那一行对应 59.58。表格密集页比纯文本页更吃聚类损失。
- 新闻页不是会议说明书
- 只解释发布与评测。要约短会白板,用 wbmeet 建房,见 如何创建与加入房间。
还想核对的问题
EVIE 是不是又一个聊天大模型?
不是。它是视觉文档检索器:查询是文本,文档是页图像,输出是排序后的页。不要和同月的 Hy4 preview 混成同一套权重。
66.75 能不能当成已经超过所有开源检索器?
不能单独当皇冠。它是厂商协议下的 V3 均分。V1 上 NVIDIA 的 nemotron-colembed-vl-8b-v2 更高。对照是否同机复跑未写明。
3.81 GiB 是不是官方推荐的默认部署?
卡把 d64 K32 写成默认压缩设定,同时把 66.02 写在未压缩满分档。部署前用你自己的页测这两行。
技术报告已经出来了吗?
截至 2026-09-09,模型卡仍写论文与消融即将更新。能对上的是仓库、协议名和表内数字。