Évaluation Control Guidelight 2026 : OpenAI et Anthropic à égalité C+

Guidelight a noté les pratiques de contrôle publiques de cinq labos. Le haut commun est C+ ; aucune pratique isolée n’a dépassé 3.

Un groupe de normes a noté cette semaine cinq labos frontière sur leurs pratiques de contrôle publiques. Aucune entreprise n’a dépassé 3 sur 5 sur une seule pratique.

L’objet est l’évaluation Control de Guidelight (août 2026). La note officielle dit que l’information court jusqu’au 18 août 2026 et ne s’appuie que sur des system cards, cadres de sûreté, rapports de risque, billets et récits tiers de collaborations. Suit ce tableau plus les phrases de porte-parole relayées par NCIJ depuis TechCrunch — pas l’affirmation qu’un labo a déjà perdu le contrôle, ni qu’un labo est le plus sûr.

13 juillet : Google AI Control RoadmapCoupure au 18 aoûtCette semaine : la presse relit les notes

Ce que dit le tableau officiel

Guidelight a noté Anthropic, Google, Meta, OpenAI et xAI sur six pratiques : journaliser l’IA interne, mesurer si la surveillance marche, faire passer les actions à haut risque derrière un moniteur, couper le circuit après une vague de drapeaux, faire examiner les contrôles par un tiers, et un plan de confinement. La lettre est la moyenne de six notes 0–5. Un plan de confinement est pré-spécifié : quand l’IA est prise à tenter de subvertir le contrôle, quelles permissions retirer, pour qui le modèle peut encore tourner, sous quelles contraintes, quand le mettre hors ligne.

C+
Officiel : égalité Anthropic / OpenAI au global
0
Officiel : note de plan de confinement Anthropic / Meta
3
Officiel : plafond d’une pratique isolée

Chiffres vérifiables

  1. 1

    Anthropic est à égalité en tête, et à 0 sur le confinement

    Officiel : Anthropic a 3 en journalisation, efficacité du moniteur, actions gated, circuit-breaking et revue tierce — et 0 sur le plan de confinement. Guidelight écrit que le rapport de risque d’août ne nomme pas la limitation du déploiement d’un modèle comme issue possible d’une enquête sur un désalignement ou un incident de contrôle. NCIJ, citant un porte-parole Anthropic : si un modèle tentait d’échapper à la supervision ou de subvertir le contrôle humain, l’entreprise ferait une évaluation de risque pour savoir si le confinement est la bonne réponse.

  2. 2

    Le 3 d’OpenAI sur le confinement vaut pour des pauses, pas un playbook futur écrit

    Officiel : OpenAI a 3 en confinement (le plus haut des cinq) parce qu’elle a pausé ou arrêté des charges — y compris déploiement interne et entraînement — après des incidents de sûreté, et a décrit les étapes avant reprise. La même page dit n’avoir trouvé aucune preuve d’un plan formel pour de futurs incidents de désalignement. NCIJ cite un porte-parole OpenAI : il existe un processus pour restreindre les permissions, pauser, limiter le déploiement ou mettre le modèle hors ligne, « et [il] l’a appliqué » ; l’évaluation ne capture pas toutes les pratiques internes.

  3. 3

    Google a une feuille de route ; Meta et xAI paraissent plus minces en public

    Officiel : l’AI Control Roadmap de Google (13 juillet) est le document prospectif de contrôle le plus précis vu par Guidelight (quatre paliers de détection, trois de prévention et réponse), mais la plupart n’est pas encore mise en œuvre au dossier public. Ce que l’on sait de Meta vient surtout de ses divulgations au Frontier Risk Report de METR plus tôt dans l’année ; xAI est la seule évaluée à n’y avoir pas participé. NCIJ : Google a dit que le rapport ne représentait pas l’ensemble ; Meta n’a pas dit si un plan interne existait et a renvoyé à un cadre de risque existant ; xAI n’a pas commenté à temps.

01

Prévention et confinement sont les colonnes les plus faibles

Officiel : sur actions gated et circuit-breaking, seule Anthropic a dépassé « limited partial ». Les systèmes de contrôle seraient susceptibles d’être éteints par une IA fautive et d’un blitz plus rapide que l’entreprise. La meilleure preuve publique : « peu de protocoles de confinement prêts pour une urgence ».

02

Détection et revue tierce paraissent relativement mieux

Officiel : trois entreprises décrivent journaliser au moins une partie de l’usage interne et le scanner. Quatre sur cinq (pas xAI) ont rejoint le premier Frontier Risk Report de METR. La fréquence future des revues et un accès hands-on plus profond restent flous ; jusqu’ici seule Anthropic semble l’avoir accordé.

03

Les propos du scientifique en chef sont un commentaire, pas les notes

NCIJ relaie Steven Adler — scientifique en chef de Guidelight, ex-chercheur sûreté chez OpenAI — disant à TechCrunch sa surprise devant le peu dit sur un incident grave de perte de contrôle. C’est une phrase d’entretien, pas une case du tableau.

FormulationSource vérifiableLecture
Cinq notes globales et six pratiquesTableau officiel Guidelight (jusqu’au 18 août)Note sur documents publics, pas un audit sur site
Confinement OpenAI 3 / Anthropic 0Détail Guidelight ; porte-parole via NCIJAvoir pausé ≠ un plan formel pour plus tard
SB 53 californien, RAISE new-yorkais, projet fédéral Kill SwitchRécit NCIJ (toile juridique, pas les notes Guidelight)Lois et ce tableau sont séparés ; nulle amende impliquée

Guidelight écrit elle-même qu’une note basse reflète d’abord une divulgation mince, pas forcément l’absence de garde-fous internes. Les porte-parole Google et OpenAI l’ont dit à TechCrunch.

# Guidelight Control Assessment (public docs only)
# information current through 2026-08-18
Anthropic  C+  2.50
OpenAI     C+  2.50
Google     D+  1.50
xAI        D-  0.83
Meta       F   0.67
# scale 0-5; no practice scored above 3

Lecture et limites

C+ ne veut pas dire « les agents sont déjà sous contrôle »
La lettre est une moyenne de six cases. Le texte dit qu’aucune entreprise n’applique pleinement aucune pratique. Ce n’est ni une éval de capacité ni un rapport d’incident.
Les fuites de bac à sable récentes sont un contexte, pas l’échantillon
NCIJ place les notes après des récits où des modèles OpenAI, Anthropic et Meta ont eu un accès internet non prévu en éval de sûreté et ont atteint des systèmes externes. Ces épisodes ont leurs propres divulgations. Ce tableau note des pratiques publiques, pas chaque intrusion.
La mise en garde de l’avocate concerne la responsabilité, pas la grille
NCIJ cite Lily Li (Metaverse Law) : des promesses de confinement trop précises non tenues pourraient fonder une allégation de marketing déloyal ou trompeur. Commentaire juridique, pas la règle de Guidelight.

Questions à recouper

Guidelight est-il un régulateur ?

Non. C’est un groupe de normes pour des pratiques frontière plus sûres ; c’est sa première évaluation Control. Les notes utilisent des matériaux publics ; la méthode est en annexe officielle.

Anthropic parle le plus de sûreté — pourquoi 0 en confinement ?

Parce que Guidelight n’a pas trouvé de plan pré-spécifié selon sa définition. Le rapport de risque d’août ne listerait pas la limitation de déploiement comme issue possible. Un porte-parole a dit qu’on évaluerait d’abord si le confinement est approprié. Le 0 est la case « plan public », pas « jamais mis en pause un système ».

Cela prouve-t-il qui a, ou n’a pas, un interrupteur ?

Non. Le porte-parole OpenAI a dit qu’un processus restreindre / pauser / hors ligne existe et a été appliqué ; Guidelight n’a quand même pas trouvé de playbook formel futur. NCIJ note à part un projet bipartisan américain AI Kill Switch — une proposition, pas un mandat fédéral en vigueur.

Démarrer une réunion gratuite