EVIE-8B 2026 : recherche documentaire ViDoRe Tencent et évals
Tencent a ouvert deux checkpoints EVIE. Séparer les SKU 8,41B / 4,61B, la table ViDoRe vendeur et la chute de la ligne compressée.
Vers le 7 septembre 2026, le centre produit IMA et le labo Youtu de Tencent ont publié EVIE-8B et EVIE-4.5B : des retrievers qui cherchent pages scannées, tableaux et diapos comme images, sans OCR d’abord. L’actualité n’est pas un autre vaisseau de chat, mais la table ViDoRe du labo — et le fait que le SKU compressé et le score titré sont des lignes différentes.
La requête est EVIE-8B et ViDoRe V3. Cette page suit les fiches Hugging Face tencent/EVIE-8B / tencent/EVIE-4.5B, GitHub Tencent/EVIE et le recap DataNorth du 7 septembre. Les scores tiennent à un protocole vendeur ; ne pas les relabeler en rerun de labo indépendant. Autre dépôt Tencent du mois : Hy4 preview.
Ce que le labo dit avoir livré
EVIE = Evidence-Vector-Informed Embedding. Les deux SKU utilisent l’interaction tardive ColQwen3.5 : des centaines de vecteurs par page, MaxSim, pas un vecteur résumé. Le 8B est professeur (attention bidirectionnelle, 4096-D) ; le 4.5B est élève (Prefix-MRL à une projection). Fiche : Zifei Wang (IMA), Wei Wen (Youtu, correspondant). Entraînement : 775 635 paires document-requête ; a40 est un mélange de deux bras (α=0,40). Papier formel : upcoming. Même famille de base : Qwen3.8-27B.
Comment lire les trois chiffres
- 1
Nommer le SKU avant 66,75
L’exemple 8B passe par colpali-engine ou MultiVectorEncoder de Sentence Transformers, FlashAttention et attention bidirectionnelle. Le 4.5B peut tronquer 2048-D à 1024, 512, 256, 128 ou 64 à la requête, sans second checkpoint. Fiche : 65,27 sur V3 à 128-D, contre 66,02. Licence Apache 2.0.
- 2
66,75 est un protocole vendeur maison
V3 : huit domaines × six langues de requête. Moyenne 8B 66,75, de 81,86 en informatique à 52,11 en physique. Rivaux : webAI-ColVec1.1-8b 65,32, VultronRetrieverPrime-8B 64,26, nemotron-colembed-vl-8b-v2 63,54. V1 nDCG@5 : NVIDIA 92,65, EVIE-8B 92,18. La couronne tient aux tranches V2/V3 plus récentes.
- 3
3,81 Gio correspond à un autre score
HAC n’a pas besoin d’entraînement extra et ramène ~750 vecteurs à 32 ou 64. Le compact par défaut est d64 K32, 3,81 Gio par million de pages. Même table : 4.5B V3 non compressé 66,02 ; compressé 59,58, un peu derrière tomoro-colqwen3-embed-4b à 60,16. Les deux lignes sont Tencent. Ne citer que le highlight.
L’interaction tardive échange du stockage, pas de la magie
Des centaines de vecteurs gardent tableaux et mise en page ; l’index gonfle. Prefix-MRL coupe la largeur, HAC le nombre. La fiche elle-même sépare score compact et score pleine largeur.
138 tâches ne sont pas un indice AA
Familles : nDCG, Recall, MAP, MRR. Les moyennes macro sont sur la fiche — p. ex. 79,51 nDCG@10 sur quatre boards pour le 8B. Ne pas recoller ça en Artificial Analysis Intelligence Index.
Papier et facture mémoire encore absents
L’annonce dit poids, inférence et suite d’éval ouverts ; ablations et papier formel upcoming. Vitesse et VRAM de pic ne sont pas une facture de déploiement.
| Affirmation | Source vérifiable | Lecture |
|---|---|---|
| 8.41B / 4.61B, Apache 2.0 | Fiches HF · GitHub Tencent/EVIE | Architecture selon le tableau officiel |
| V3 66.75 / 66.02 | Table ViDoRe de la fiche | Protocole vendeur, pas un rerun indépendant |
| 3.81 Gio et 59.58 | Fiche 4.5B HAC / Prefix-MRL | Ligne compressée séparée du titre |
Fiche Tencent : détails techniques, ablations et papier formel seront mis à jour. Elle ne promet pas que les scores rivaux ont été rejoués sur la même boîte de protocole.
# EVIE · Tencent IMA / Youtu · as of 2026-09
sku_8b: 8.41B on Qwen3.5-9B, 4096D
sku_45: 4.61B on Qwen3.5-4B, Prefix-MRL 64–2048D
license: Apache-2.0
hf: tencent/EVIE-8B · tencent/EVIE-4.5B
vidore_v3_ndcg10: 66.75 / 66.02
protocol: paired-all-pages-dedup+process_queries+ndcg2r-20260827
hac_index: 3.81 GiB / 1M pages (d64 K32)
compressed_v3: 59.58 (4.5B d64 K32)Limites
- ViDoRe vendeur ≠ indice tiers
- 66,75 / 66,02 tiennent à un protocole maison nommé. Ne pas les relabeler en Intelligence Index AA, ni en faire un trophée contre les tables chat de la même semaine.
- Apache 2.0 ≠ 66,02 après compression
- La licence couvre l’auto-hébergement commercial. La ligne 3,81 Gio vaut 59,58. Les tableaux financiers denses perdent plus au clustering que les rapports textuels.
- Cette page n’est pas un mode d’emploi de réunion
- Elle n’explique que la sortie et les évals. Pour un huddle court avec tableau, créer une salle sur wbmeet ; voir créer et rejoindre une salle.
Questions à vérifier
EVIE est-il un autre LLM de chat ?
Non. C’est un retriever de documents visuels : requête texte, images de pages, pages classées. Ne pas l’empiler sur les poids Hy4 preview du même mois.
66,75 veut-il dire qu’il bat tout retriever ouvert ?
Pas à lui seul. C’est une moyenne V3 sous protocole labo. Le nemotron-colembed-vl-8b-v2 de NVIDIA est plus haut sur V1. Les reruns rivaux sur la même machine ne sont pas revendiqués.
3,81 Gio est-il le déploiement officiel par défaut ?
La fiche étiquette d64 K32 comme compact par défaut et imprime 66,02 sur la ligne non compressée. Mesurer les deux sur vos pages.
Le rapport technique est-il sorti ?
Au 2026-09-09 la fiche dit encore papier et ablations upcoming. Vérifiables : dépôts, nom de protocole, chiffres de table.