2026 Guidelight前沿實驗室控制評估:OpenAI與Anthropic並列C+全解析
Guidelight 用公開文件給五家實驗室的控制實踐打分。並列最高的是 C+,沒有一家單項超過 3。
一家自稱做前沿 AI 標準的機構,本週把五家實驗室的「控制」措施按公開材料打成一張表:沒有一家在任何單項上超過 3 分(滿分 5)。
核心對象是 Guidelight Control Assessment(2026 年 8 月)。官方寫資訊截止 2026-08-18,只看系統卡、安全框架、風險報告、博文與第三方合作描述。下文按官方表與 NCIJ 轉述的 TechCrunch 發言人口徑,不寫成「某家已經失控」或「某家最安全」。
官方表寫成了什麼
Guidelight 評估 Anthropic、Google、Meta、OpenAI、xAI 六項:內部 AI 日誌、監測是否有效、高風險動作是否先過監測門、異常激增後是否熔斷、第三方是否審過控制、以及是否有遏制計畫(containment plan)。總分是六項 0–5 分的平均再換成字母。官方定義遏制計畫:當模型被發現試圖顛覆控制時,預先寫明撤哪些權限、還能為誰跑、在什麼約束下、何時完全下線。
能核對的幾條口徑
- 1
Anthropic 總分並列最高,遏制計畫卻是 0
官方:Anthropic 在日誌、監測效力、門控、熔斷、第三方審都是 3,遏制計畫 0。Guidelight 寫其 8 月風險報告沒有把「限制某一模型部署」寫成調查錯位/控制事件後的可能結果。NCIJ 轉述 Anthropic 發言人:若發現模型試圖逃避監督或顛覆人類控制,會做風險評估,判斷遏制是否合適。
- 2
OpenAI 遏制計畫 3,因為停過,不是因為有成文預案
官方:OpenAI 遏制計畫 3(五家裡最高),理由是多次暫停或結束工作負載(含內部部署與訓練),並寫過恢復前步驟。同頁寫「未發現它已採納一份關於未來如何應對錯位事件的正式計畫」。NCIJ 轉述 OpenAI 發言人:有限制權限、暫停、限制部署或完全下線的流程,「並且用過」;評估未覆蓋全部內部做法。
- 3
Google 有路線圖,Meta / xAI 公開材料更薄
官方:Google 的 AI Control Roadmap(7 月 13 日)是所見最具體的前瞻文件(四層偵測、三層預防與回應),但按公開揭露「多數尚未落實」。Meta 所知主要來自今年稍早給 METR Frontier Risk Report 的揭露;xAI 是五家裡唯一未參加該報告的。NCIJ:Google 稱報告不代表其安全措施全貌;Meta 未回答是否有內部遏制計畫,指向既有風險框架;xAI 未及時置評。
預防與遏制是最弱兩欄
官方:門控與熔斷上,只有 Anthropic 超過「有限部分落實」。結論寫成:控制系統容易被行為異常的 AI 關掉,也容易被比公司反應更快的連續攻擊壓垮。公開證據顯示「幾乎沒有現成的應急遏制協議」。
偵測與第三方審相對好看
官方:三家寫了至少部分內部用量日誌並掃描異常。除 xAI 外四家參加了 METR 首份 Frontier Risk Report。未來評估是否夠頻、是否允許更深上手存取,官方寫仍不清楚;迄今似乎只有 Anthropic 給過更深上手。
首席科學家的評論是觀點,不是評分本身
NCIJ 轉述 Guidelight 首席科學家、前 OpenAI 安全研究員 Steven Adler 對 TechCrunch 說:對「模型某種意義上逃出控制」時公司會怎麼做,公開說法少得令人意外。這是採訪,不是表上的數字。
| 說法 | 能核對的來源 | 讀法 |
|---|---|---|
| 五家總分與六項分 | Guidelight 官方表(截止 8 月 18 日) | 公開材料評分,不是現場稽核 |
| OpenAI 遏制 3 / Anthropic 遏制 0 | Guidelight 詳細打分;NCIJ 轉述發言人 | 停過負載 ≠ 已有正式未來預案 |
| 加州 SB 53、紐約 RAISE、聯邦 Kill Switch 草案 | NCIJ 轉述(監管背景,不是 Guidelight 打分) | 法案與評估是兩條線,不要疊成「已被罰款」 |
Guidelight 自己寫:低分首先反映公開揭露不足,不必然等於內部沒有措施。Google 與 OpenAI 發言人都對 TechCrunch 強調了這一點。
# Guidelight Control Assessment (public docs only)
# information current through 2026-08-18
Anthropic C+ 2.50
OpenAI C+ 2.50
Google D+ 1.50
xAI D- 0.83
Meta F 0.67
# scale 0-5; no practice scored above 3讀法與界線
- C+ 不是「已經管得住智能體」
- 字母來自六項平均。官方寫沒有一家完全落實任何一項。這不是能力評測,也不是事故調查結論。
- 近期沙箱逃逸是動機,不是本表樣本
- NCIJ 把評估放在 OpenAI、Anthropic、Meta 模型在安全評測中意外上網、進入外部系統的報導之後。那些事件另有公司揭露。本表量的是公開控制實踐,不是復盤每一次入侵。
- 律師擔心的是揭露責任,不是分數
- NCIJ 引 Metaverse Law 創辦人 Lily Li:把遏制政策寫得太具體、又做不到,可能構成不公平或欺騙性行銷、增加責任。這是法律評論,不是 Guidelight 的評分規則。
還想核對的問題
Guidelight 是監管機構嗎?
不是。它是推廣前沿 AI 安全實踐的標準組織,這份是其首份控制評估。分數按公開材料,方法寫在官方附錄。
Anthropic 安全名聲最大,為什麼遏制計畫是 0?
因為 Guidelight 在公開文件裡找不到符合其定義的預先遏制方案。8 月風險報告被寫成未把限制部署列為可能結果。公司發言人說會先做風險評估。0 分是「公開計畫」欄,不是「從未停過任何系統」。
這是否證明某家已經有、或沒有「關閉開關」?
不能。OpenAI 發言人說有限制/暫停/下線流程且用過;官方仍寫未見正式未來預案。NCIJ 另述美國有兩黨 AI Kill Switch 草案,那是立法主張,不是已生效的聯邦強制。