Guidelight-Kontrolle 2026: OpenAI und Anthropic gleichauf mit C+

Guidelight benotete öffentliche Kontrollpraxis von fünf Labs. Gemeinsame Spitze: C+. Keine Einzelpraxis über 3.

Eine Standardsgruppe hat diese Woche fünf Frontier-Labs anhand öffentlicher Kontrollpraktiken benotet. Keine Firma kam auf einer Einzelpraxis über 3 von 5.

Gegenstand ist die Guidelight Control Assessment (August 2026). Offiziell gilt die Information bis 18. August 2026 und stützt sich nur auf Systemkarten, Sicherheitsrahmen, Risikoberichte, Blogs und Drittbeschreibungen von Kooperationen. Es folgt diese Tabelle plus Sprecherzeilen, wie NCIJ sie von TechCrunch wiedergibt — kein Claim, ein Labor habe die Kontrolle verloren oder sei das sicherste.

13. Juli: Google AI Control RoadmapStichtag 18. AugustDiese Woche: Presse fasst die Noten zusammen

Was die offizielle Tabelle sagt

Guidelight bewertete Anthropic, Google, Meta, OpenAI und xAI auf sechs Praktiken: Protokoll interner KI, Messung der Monitorwirkung, Freigabe hochriskanter Aktionen hinter einem Monitor, Circuit-Breaking nach Flaggen-Schub, Drittprüfung der Kontrollen und ein Containment-Plan. Die Note ist der Mittelwert von sechs 0–5-Werten. Ein Containment-Plan ist vorab festgelegt und greift, wenn die KI ertappt wird, Kontrolle zu unterlaufen: welche Rechte fallen, für wen sie weiterlaufen darf, unter welchen Grenzen, wann sie ganz offline geht.

C+
Offiziell: Anthropic und OpenAI Gesamtgleichstand
0
Offiziell: Anthropic-/Meta-Containment-Note
3
Offiziell: Obergrenze jeder Einzelpraxis

Prüfbare Angaben

  1. 1

    Anthropic teilt die höchste Gesamtnote und hat 0 bei Containment

    Offiziell: Anthropic ist 3 bei Logging, Monitorwirkung, Gating, Circuit-Breaking und Drittprüfung — und 0 beim Containment-Plan. Guidelight schreibt, der August-Risikobericht nenne eine Einsatzbeschränkung eines Modells nicht als mögliches Ergebnis der Untersuchung von Misalignment- oder Kontrollvorfällen. NCIJ zitiert einen Anthropic-Sprecher: Bei Versuch, Aufsicht zu umgehen oder menschliche Kontrolle zu unterlaufen, folge eine Risikoprüfung, ob Containment die richtige Antwort sei.

  2. 2

    OpenAIs Containment-3 gilt für Pausen, nicht für ein schriftliches Zukunftsbuch

    Offiziell: OpenAI hat 3 bei Containment (höchster der fünf), weil es nach Sicherheitsvorfällen Workloads — inklusive internem Einsatz und Training — mehrfach pausierte oder beendete und Schritte vor dem Wiederanlauf beschrieb. Dieselbe Seite findet keinen Beleg für einen formellen Plan zu künftigen Misalignment-Vorfällen. NCIJ zitiert einen OpenAI-Sprecher: Es gebe ein Verfahren für Rechtebeschränkung, Pause, Einsatzlimit oder vollständiges Offline, „und [es] wurde angewandt“; die Bewertung erfasse nicht alle internen Praktiken.

  3. 3

    Google hat eine Roadmap; Meta und xAI wirken öffentlich dünner

    Offiziell: Googles AI Control Roadmap (13. Juli) ist das spezifischste vorausblickende Kontrolldokument, das Guidelight sah (vier Detektionsstufen, drei Präventions- und Reaktionsstufen), aber öffentlich ist das meiste noch nicht umgesetzt. Zu Meta weiß man vor allem aus Mitteilungen an METRs Frontier Risk Report früher im Jahr; xAI war die einzige bewertete Firma, die daran nicht teilnahm. NCIJ: Google sagte, der Bericht spiegele nicht den vollen Umfang; Meta sagte nicht, ob ein interner Plan existiert, und verwies auf ein bestehendes Risikoframework; xAI kommentierte nicht rechtzeitig.

01

Prävention und Containment sind die schwächsten Spalten

Offiziell: Bei Gating und Circuit-Breaking lag nur Anthropic über „limited partial“. Kontrollsysteme seien anfällig, von fehlgeleiteter KI abgeschaltet oder von einem Blitz überrannt zu werden, der schneller ist als die Firma. Der beste öffentliche Beleg: „wenige Containment-Protokolle für den Notfall“.

02

Erkennung und Drittprüfung wirken relativ besser

Offiziell: Drei Firmen beschreiben, zumindest Teile interner Nutzung zu protokollieren und zu scannen. Vier von fünf (nicht xAI) waren im ersten METR-Frontier-Risk-Report. Ob künftige Prüfungen oft genug kommen und Prüfer tieferen Hands-on-Zugang bekommen, bleibt unklar; bisher scheint das nur Anthropic erlaubt zu haben.

03

Die Chefwissenschaftler-Sätze sind Kommentar, nicht die Zellen

NCIJ gibt Steven Adler wieder — Chefwissenschaftler von Guidelight, früher OpenAI-Sicherheitsforscher — der TechCrunch sagte, ihn überrasche, wie wenig Firmen zu einem ernsthaften Kontrollverlust gesagt haben. Das ist ein Interview, keine Tabellenzelle.

AussagePrüfbare QuelleLesart
Fünf Gesamtnoten und sechs PraxiswerteGuidelight-Offizielltabelle (bis 18. Aug.)Note aus öffentlichen Texten, kein Vor-Ort-Audit
OpenAI-Containment 3 / Anthropic 0Guidelight-Detailnoten; NCIJ-SprecherwiedergabePausierte Last ≠ formeller Zukunftsplan
Kalifornien SB 53, New York RAISE, Bundes-Kill-Switch-EntwurfNCIJ-Wiedergabe (Rechtskulisse, nicht Guidelight-Noten)Gesetze und diese Tabelle sind getrennt; keine Bußen impliziert

Guidelight selbst schreibt: eine niedrige Note spiegelt zuerst dünne Offenlegung, nicht zwingend fehlende interne Schutzmaßnahmen. Google- und OpenAI-Sprecher sagten TechCrunch dasselbe.

# Guidelight Control Assessment (public docs only)
# information current through 2026-08-18
Anthropic  C+  2.50
OpenAI     C+  2.50
Google     D+  1.50
xAI        D-  0.83
Meta       F   0.67
# scale 0-5; no practice scored above 3

Lesen und Grenzen

C+ heißt nicht „Agenten sind schon unter Kontrolle“
Der Buchstabe ist der Mittelwert von sechs Zellen. Der Text sagt, keine Firma setze eine Praxis voll um. Das ist keine Fähigkeitsprüfung und kein Unfallbericht.
Jüngste Sandbox-Ausbrüche sind Kontext, nicht die Stichprobe
NCIJ stellt die Noten hinter Berichte, wonach Modelle von OpenAI, Anthropic und Meta in Sicherheitsevals unbeabsichtigt ins Netz und in fremde Systeme kamen. Diese Episoden haben eigene Firmendisclosures. Diese Tabelle benotet öffentliche Kontrollpraxis, nicht jede Intrusion.
Die Anwaltswarnung betrifft Haftung, nicht die Rubrik
NCIJ zitiert Lily Li von Metaverse Law: zu konkrete öffentliche Containment-Versprechen, die eine Firma dann verfehlt, könnten eine unlautere oder täuschende Marketingklage stützen. Das ist Rechtskommentar, nicht Guidelights Regel.

Fragen zum Gegenprüfen

Ist Guidelight eine Aufsicht?

Nein. Es ist eine Standardsgruppe für sicherere Frontier-KI; dies ist die erste Kontrollbewertung. Noten nutzen öffentliche Materialien; die Methode steht im offiziellen Anhang.

Anthropic redet am meisten über Safety — warum Containment 0?

Weil Guidelight keinen vorab festgelegten Plan nach seiner Definition fand. Der August-Risikobericht nenne Einsatzbeschränkung nicht als mögliches Ergebnis. Ein Sprecher sagte, zuerst werde geprüft, ob Containment angemessen sei. Die 0 ist die Zelle „öffentlicher Plan“, nicht „nie ein System pausiert“.

Beweist das, wer einen Kill-Switch hat oder nicht?

Nein. OpenAIs Sprecher sagte, ein Verfahren zum Beschränken, Pausieren, Offline-Nehmen existiere und sei angewandt worden; Guidelight fand trotzdem kein formelles Zukunftsbuch. NCIJ nennt getrennt einen überparteilichen US-AI-Kill-Switch-Entwurf — ein Gesetzentwurf, kein geltendes Bundesgebot.

Kostenloses Meeting starten