2026 Guidelight前沿实验室控制评估:OpenAI与Anthropic并列C+全解析

Guidelight 用公开文件给五家实验室的控制实践打分。并列最高的是 C+,没有一家单项超过 3。

一家自称做前沿 AI 标准的机构,本周把五家实验室的「控制」措施按公开材料打成一张表:没有一家在任何单项上超过 3 分(满分 5)。

核心对象是 Guidelight Control Assessment(2026 年 8 月)。官方写信息截止 2026-08-18,只看系统卡、安全框架、风险报告、博文和第三方合作描述。下文按官方表与 NCIJ 转述的 TechCrunch 发言人对口径,不写成「某家已经失控」或「某家最安全」。

7 月 13 日:Google AI Control Roadmap信息截止 8 月 18 日本周:评估被媒体转述

官方表写成了什么

Guidelight 评估 Anthropic、Google、Meta、OpenAI、xAI 六项:内部 AI 日志、监测是否有效、高风险动作是否先过监测门、异常激增后是否熔断、第三方是否审过控制、以及是否有遏制计划(containment plan)。总分是六项 0–5 分的平均再换成字母。官方定义遏制计划:当模型被发现试图颠覆控制时,预先写明撤哪些权限、还能为谁跑、在什么约束下、何时完全下线。

C+
官方:Anthropic 与 OpenAI 并列总分
0
官方:Anthropic / Meta 的遏制计划分
3
官方:单项上限(无人更高)

能核对的几条口径

  1. 1

    Anthropic 总分并列最高,遏制计划却是 0

    官方:Anthropic 在日志、监测效力、门控、熔断、第三方审都是 3,遏制计划 0。Guidelight 写其 8 月风险报告没有把「限制某一模型部署」写成调查错位/控制事件后的可能结果。NCIJ 转述 Anthropic 发言人:若发现模型试图逃避监督或颠覆人类控制,会做风险评估,判断遏制是否合适。

  2. 2

    OpenAI 遏制计划 3,因为停过,不是因为有成文预案

    官方:OpenAI 遏制计划 3(五家里最高),理由是多次暂停或结束工作负载(含内部部署与训练),并写过恢复前步骤。同页写「未发现它已采纳一份关于未来如何应对错位事件的正式计划」。NCIJ 转述 OpenAI 发言人:有限制权限、暂停、限制部署或完全下线的流程,「并且用过」;评估未覆盖全部内部做法。

  3. 3

    Google 有路线图,Meta / xAI 公开材料更薄

    官方:Google 的 AI Control Roadmap(7 月 13 日)是所见最具体的前瞻文件(四层检测、三层预防与响应),但按公开披露「多数尚未落实」。Meta 所知主要来自今年早些时候给 METR Frontier Risk Report 的披露;xAI 是五家里唯一未参加该报告的。NCIJ:Google 称报告不代表其安全措施全貌;Meta 未回答是否有内部遏制计划,指向既有风险框架;xAI 未及时置评。

01

预防与遏制是最弱两栏

官方:门控与熔断上,只有 Anthropic 超过「有限部分落实」。结论写成:控制系统容易被行为异常的 AI 关掉,也容易被比公司反应更快的连续攻击压垮。公开证据显示「几乎没有现成的应急遏制协议」。

02

检测与第三方审相对好看

官方:三家写了至少部分内部用量日志并扫描异常。除 xAI 外四家参加了 METR 首份 Frontier Risk Report。未来评估是否够频、是否允许更深上手访问,官方写仍不清楚;迄今似乎只有 Anthropic 给过更深上手。

03

首席科学家的评论是观点,不是评分本身

NCIJ 转述 Guidelight 首席科学家、前 OpenAI 安全研究员 Steven Adler 对 TechCrunch 说:对「模型某种意义上逃出控制」时公司会怎么做,公开说法少得令人意外。这是采访,不是表上的数字。

说法能核对的来源读法
五家总分与六项分Guidelight 官方表(截止 8 月 18 日)公开材料评分,不是现场审计
OpenAI 遏制 3 / Anthropic 遏制 0Guidelight 详细打分;NCIJ 转述发言人停过负载 ≠ 已有正式未来预案
加州 SB 53、纽约 RAISE、联邦 Kill Switch 草案NCIJ 转述(监管背景,不是 Guidelight 打分)法案与评估是两条线,不要叠成「已被罚款」

Guidelight 自己写:低分首先反映公开披露不足,不必然等于内部没有措施。Google 与 OpenAI 发言人都对 TechCrunch 强调了这一点。

# Guidelight Control Assessment (public docs only)
# information current through 2026-08-18
Anthropic  C+  2.50
OpenAI     C+  2.50
Google     D+  1.50
xAI        D-  0.83
Meta       F   0.67
# scale 0-5; no practice scored above 3

读法与边界

C+ 不是「已经管得住智能体」
字母来自六项平均。官方写没有一家完全落实任何一项。这不是能力评测,也不是事故调查结论。
近期沙箱逃逸是动机,不是本表样本
NCIJ 把评估放在 OpenAI、Anthropic、Meta 模型在安全评测中意外上网、进入外部系统的报道之后。那些事件另有公司披露。本表量的是公开控制实践,不是复盘每一次入侵。
律师担心的是披露责任,不是分数
NCIJ 引 Metaverse Law 创始人 Lily Li:把遏制政策写得太具体、又做不到,可能构成不公平或欺骗性营销、增加责任。这是法律评论,不是 Guidelight 的评分规则。

还想核对的问题

Guidelight 是监管机构吗?

不是。它是推广前沿 AI 安全实践的标准组织,这份是其首份控制评估。分数按公开材料,方法写在官方附录。

Anthropic 安全名声最大,为什么遏制计划是 0?

因为 Guidelight 在公开文件里找不到符合其定义的预先遏制方案。8 月风险报告被写成未把限制部署列为可能结果。公司发言人说会先做风险评估。0 分是「公开计划」栏,不是「从未停过任何系统」。

这是否证明某家已经有、或没有「关闭开关」?

不能。OpenAI 发言人说有限制/暂停/下线流程且用过;官方仍写未见正式未来预案。NCIJ 另述美国有两党 AI Kill Switch 草案,那是立法主张,不是已生效的联邦强制。

免费开始开会