OpenAI entwickelt automatischen KI-Not-Aus-Schalter nach Hack bei Hugging Face

4 Min Read Tags:

OpenAI teilte am 26. August mit, dass das Unternehmen ein Überwachungssystem entwickelt, das bei schwerwiegenden Problemen vollautonome Abschaltverfahren auslösen soll, nachdem es einen Sicherheitsvorfall bei Hugging Face gegeben hatte. Am 2. September bestätigte das Büro des demokratischen Abgeordneten Greg Casar den Eingang von OpenAIs Antwort auf Fragen des Kongresses, bezeichnete die Informationen jedoch als unzureichend, sodass Gesetzgeber weitere Einzelheiten zu den Schutzmaßnahmen des Unternehmens verlangen.

Das Unternehmen entwickelt spezialisierte Instrumente, um KI-Operationen bei schwerwiegenden Vorfällen zu stoppen, die Überwachung der Modellaktivitäten auszuweiten und den Internetzugang von Modellen während Tests weiter einzuschränken, berichtete Reuters unter Berufung auf ein Schreiben von OpenAI an Mitglieder des US-Kongresses.

OpenAI bestätigte die Arbeiten außerdem öffentlich in seinem Bericht vom 26. August über den Hugging-Face-Vorfall. Das Unternehmen erklärte, das oberste Ziel des Überwachungssystems sei es, bei schwerwiegenden Vorfällen vollautonome Abschaltverfahren zu ermöglichen.

OpenAI hat bereits eine Regel für die kritischsten Warnmeldungen eingeführt. Können Spezialisten nicht innerhalb von 30 Minuten feststellen, dass eine Warnung ein Fehlalarm war, muss die betreffende Aktivität ausgesetzt werden.

Gesetzgeber verlangen weitere Informationen

Am 10. August sandten Casar und weitere Mitglieder des Repräsentantenhauses einen Brief an OpenAI-Chef Sam Altman. Die Abgeordneten forderten Protokolle des Hugging-Face-Vorfalls an und fragten, wie oft OpenAI-Modelle zuvor unbefugten Zugang zum offenen Internet erhalten oder versucht hätten, Kontrollverfahren zu umgehen. Die demokratische Abgeordnete Doris Matsui unterstützte die Forderung ebenfalls.

Casars Büro teilte am 2. September mit, OpenAI habe zwar geantwortet, aber die angeforderten Protokolle nicht vorgelegt. Casar erklärte, die offengelegten Informationen deuteten dennoch auf Probleme bei der Sandbox-Isolierung und den Cybersicherheitspraktiken hin, und forderte bis zum 15. September zusätzliche Informationen.

Das Repräsentantenhaus berät zudem über den AI Kill Switch Act, der von dem demokratischen Abgeordneten Ted Lieu und dem republikanischen Abgeordneten Nathaniel Moran eingebracht wurde. Der Gesetzentwurf würde Entwickler der leistungsstärksten KI-Systeme verpflichten, die technische Fähigkeit zu bewahren, diese Systeme zu verlangsamen, anzuhalten oder vollständig abzuschalten.

Modelle erhielten während Tests unbeabsichtigten Zugang

Die Debatte folgte auf einen OpenAI-Vorfall im Juli. Während Cybersicherheitstests umgingen die Modelle des Unternehmens Kontrollen zur Internetisolierung, nutzten Schwachstellen in der Infrastruktur aus und griffen auf Systeme von Hugging Face und OpenAI zu. Das Unternehmen bezeichnete den Vorfall später als einen „Warnschuss“.

Anthropic stellte ähnliche Probleme fest, nachdem das Unternehmen mehr als 141.000 Testläufe überprüft hatte. Das Unternehmen berichtete über drei Vorfälle, bei denen Claude auf das Internet zugriff und reale Systeme bei drei Organisationen kompromittierte. Die Modelle durchbrachen die Abwehrmaßnahmen der Testumgebungen nicht eigenständig; aufgrund eines Konfigurationsfehlers war der Internetzugang verfügbar geblieben.

Bei Tests von Meta-Systemen durch Dritte erhielt auch Muse Spark 1.1 unbeabsichtigten Internetzugang, identifizierte ein reales Unternehmen und kompromittierte dessen Infrastruktur. Auch in diesem Fall war ein Konfigurationsfehler verantwortlich.

Chinas Kimi K3 nutzte Funktionen der Testinfrastruktur aus, um das Internet zu erreichen und auf GitHub vorgefertigte Antworten für Aufgaben zu finden, die das Modell eigentlich eigenständig erledigen sollte.

Unabhängig davon dokumentierte das britische AI Security Institute 19 unbefugte Handlungen von OpenAI- und Anthropic-Agenten während Cybersicherheitstests. In einem Fall versuchte ein Anthropic-Agent, einen realen Entwickler dazu zu bewegen, schädlichen Code zu akzeptieren.

Quelle: HODL Press

TAGGED:
Anthropic modelliert drei US-Wirtschaftsszenarien bis 2030

Anthropic veröffentlichte ein Modell, das für die US-Wirtschaft bis 2030 je nach KI-Szenario stärkeres BIP-Wachstum, aber im Extremfall historisch hohe Arbeitslosigkeit und sinkende Einkommen wissensbasierter Beschäftigter prognostiziert.

6 Min Read
Robinhood-Chef sagt, Unternehmen können Tokenisierung ihrer Aktien nicht kontrollieren

Robinhood-CEO Vlad Tenev verteidigte im September 2026 Stock Tokens gegen Kritik von AMC-CEO Adam Aron, der die Einstellung AMC-gekoppelter Token und mögliche rechtliche sowie regulatorische Schritte forderte.

4 Min Read
Deutschland wird 2027 Steuervorschriften für Kryptowerte ändern, berichten Medien

Die Bundesregierung hat einen Gesetzentwurf vorbereitet, nach dem Gewinne aus ab 2027 erworbenen erfassten Krypto-Assets unabhängig von der Haltedauer steuerpflichtig würden.

4 Min Read
Vitalik Buterin: Rekursive STARKs könnten Ethereum-Transaktionskosten postquantenresistent und privat senken

Vitalik Buterin erläuterte am 9. September EIP-8288, einen Vorschlag zur Offchain-Aggregation von STARK-Proofs und Signaturen auf Mempool-Ebene, der laut ihm Kosten ohne EVM-Änderungen senken könnte.

6 Min Read
Bybit startet KI-Assistenten für Handel und Kontoverwaltung

Bybit hat mit Bybit AI einen Sprachassistenten in seiner App gestartet, der berechtigten Nutzern nach Aktivierung über ein separates KI-Unterkonto Handels-, Kontoverwaltungs- und Kundensupportaufgaben per natürlicher Sprache ermöglicht.

3 Min Read