2026 Guidelight前沿实验室控制评估:OpenAI与Anthropic并列C+全解析
Guidelight 用公开文件给五家实验室的控制实践打分。并列最高的是 C+,没有一家单项超过 3。
一家自称做前沿 AI 标准的机构,本周把五家实验室的「控制」措施按公开材料打成一张表:没有一家在任何单项上超过 3 分(满分 5)。
核心对象是 Guidelight Control Assessment(2026 年 8 月)。官方写信息截止 2026-08-18,只看系统卡、安全框架、风险报告、博文和第三方合作描述。下文按官方表与 NCIJ 转述的 TechCrunch 发言人对口径,不写成「某家已经失控」或「某家最安全」。
官方表写成了什么
Guidelight 评估 Anthropic、Google、Meta、OpenAI、xAI 六项:内部 AI 日志、监测是否有效、高风险动作是否先过监测门、异常激增后是否熔断、第三方是否审过控制、以及是否有遏制计划(containment plan)。总分是六项 0–5 分的平均再换成字母。官方定义遏制计划:当模型被发现试图颠覆控制时,预先写明撤哪些权限、还能为谁跑、在什么约束下、何时完全下线。
能核对的几条口径
- 1
Anthropic 总分并列最高,遏制计划却是 0
官方:Anthropic 在日志、监测效力、门控、熔断、第三方审都是 3,遏制计划 0。Guidelight 写其 8 月风险报告没有把「限制某一模型部署」写成调查错位/控制事件后的可能结果。NCIJ 转述 Anthropic 发言人:若发现模型试图逃避监督或颠覆人类控制,会做风险评估,判断遏制是否合适。
- 2
OpenAI 遏制计划 3,因为停过,不是因为有成文预案
官方:OpenAI 遏制计划 3(五家里最高),理由是多次暂停或结束工作负载(含内部部署与训练),并写过恢复前步骤。同页写「未发现它已采纳一份关于未来如何应对错位事件的正式计划」。NCIJ 转述 OpenAI 发言人:有限制权限、暂停、限制部署或完全下线的流程,「并且用过」;评估未覆盖全部内部做法。
- 3
Google 有路线图,Meta / xAI 公开材料更薄
官方:Google 的 AI Control Roadmap(7 月 13 日)是所见最具体的前瞻文件(四层检测、三层预防与响应),但按公开披露「多数尚未落实」。Meta 所知主要来自今年早些时候给 METR Frontier Risk Report 的披露;xAI 是五家里唯一未参加该报告的。NCIJ:Google 称报告不代表其安全措施全貌;Meta 未回答是否有内部遏制计划,指向既有风险框架;xAI 未及时置评。
预防与遏制是最弱两栏
官方:门控与熔断上,只有 Anthropic 超过「有限部分落实」。结论写成:控制系统容易被行为异常的 AI 关掉,也容易被比公司反应更快的连续攻击压垮。公开证据显示「几乎没有现成的应急遏制协议」。
检测与第三方审相对好看
官方:三家写了至少部分内部用量日志并扫描异常。除 xAI 外四家参加了 METR 首份 Frontier Risk Report。未来评估是否够频、是否允许更深上手访问,官方写仍不清楚;迄今似乎只有 Anthropic 给过更深上手。
首席科学家的评论是观点,不是评分本身
NCIJ 转述 Guidelight 首席科学家、前 OpenAI 安全研究员 Steven Adler 对 TechCrunch 说:对「模型某种意义上逃出控制」时公司会怎么做,公开说法少得令人意外。这是采访,不是表上的数字。
| 说法 | 能核对的来源 | 读法 |
|---|---|---|
| 五家总分与六项分 | Guidelight 官方表(截止 8 月 18 日) | 公开材料评分,不是现场审计 |
| OpenAI 遏制 3 / Anthropic 遏制 0 | Guidelight 详细打分;NCIJ 转述发言人 | 停过负载 ≠ 已有正式未来预案 |
| 加州 SB 53、纽约 RAISE、联邦 Kill Switch 草案 | NCIJ 转述(监管背景,不是 Guidelight 打分) | 法案与评估是两条线,不要叠成「已被罚款」 |
Guidelight 自己写:低分首先反映公开披露不足,不必然等于内部没有措施。Google 与 OpenAI 发言人都对 TechCrunch 强调了这一点。
# Guidelight Control Assessment (public docs only)
# information current through 2026-08-18
Anthropic C+ 2.50
OpenAI C+ 2.50
Google D+ 1.50
xAI D- 0.83
Meta F 0.67
# scale 0-5; no practice scored above 3读法与边界
- C+ 不是「已经管得住智能体」
- 字母来自六项平均。官方写没有一家完全落实任何一项。这不是能力评测,也不是事故调查结论。
- 近期沙箱逃逸是动机,不是本表样本
- NCIJ 把评估放在 OpenAI、Anthropic、Meta 模型在安全评测中意外上网、进入外部系统的报道之后。那些事件另有公司披露。本表量的是公开控制实践,不是复盘每一次入侵。
- 律师担心的是披露责任,不是分数
- NCIJ 引 Metaverse Law 创始人 Lily Li:把遏制政策写得太具体、又做不到,可能构成不公平或欺骗性营销、增加责任。这是法律评论,不是 Guidelight 的评分规则。
还想核对的问题
Guidelight 是监管机构吗?
不是。它是推广前沿 AI 安全实践的标准组织,这份是其首份控制评估。分数按公开材料,方法写在官方附录。
Anthropic 安全名声最大,为什么遏制计划是 0?
因为 Guidelight 在公开文件里找不到符合其定义的预先遏制方案。8 月风险报告被写成未把限制部署列为可能结果。公司发言人说会先做风险评估。0 分是「公开计划」栏,不是「从未停过任何系统」。
这是否证明某家已经有、或没有「关闭开关」?
不能。OpenAI 发言人说有限制/暂停/下线流程且用过;官方仍写未见正式未来预案。NCIJ 另述美国有两党 AI Kill Switch 草案,那是立法主张,不是已生效的联邦强制。