OpenAI wird in den kommenden Wochen unsichtbare Wasserzeichen für Textantworten unterstützter Versionen von ChatGPT und Codex in der Europäischen Union einführen. Die Technologie soll dazu beitragen festzustellen, ob Text von OpenAI-Systemen erstellt oder verarbeitet wurde, da Anbieter generativer KI EU-Vorgaben zur maschinenlesbaren Kennzeichnung erzeugter Inhalte erfüllen müssen.
OpenAI führte den Ansatz als Reaktion auf den EU AI Act ein. Die Funktion wird zudem weltweit für API-Kunden verfügbar, die die Wasserzeichenfunktion für bestimmte Modelle freiwillig aktivieren können. Standardmäßig bleibt sie deaktiviert.
Wie textGrain funktioniert
Das System mit dem Namen textGrain platziert ein unsichtbares statistisches Signal in der Wortwahl eines Modells. Ein spezieller Detektor analysiert anschließend den Text, um festzustellen, ob er dieses Signal enthält.
OpenAI zufolge erzielte textGrain ebenso gute oder bessere Ergebnisse als andere getestete Ansätze, darunter SynthID für Text. Das Unternehmen warnte jedoch, dass Laborergebnisse keine gleichartige Wirksamkeit unter realen Bedingungen garantieren.
Bei einer Falschpositivrate von 1 % erkannte der Detektor das Wasserzeichen laut OpenAI in etwa 80 % der 200-Token-Auszüge und in etwa 95 % der 400-Token-Auszüge zu Themen wie Psychologie. Bei Mathematik waren die Erkennungsraten niedriger, weil Modelle bei der Wortwahl weniger Spielraum hatten.
Auch Bearbeitungen beeinträchtigten die Leistung erheblich. Der Austausch von 10 % der Wörter durch Synonyme verringerte die Erkennungsrate von etwa 92 % auf 66 %, während der Austausch von 25 % der Wörter sie auf 17 % senkte.
Wasserzeichen liefern begrenzte Informationen zur Herkunft
OpenAI erklärte, ein Wasserzeichen liefere nur ein begrenztes Signal über die Herkunft eines Textes. Ein Erkennungsergebnis zeige nicht, wie viel des Textes ein Mensch beigesteuert habe, wem der Text gehöre oder wer dafür verantwortlich sei, wer das OpenAI-System genutzt habe, welcher Prompt oder welches Gespräch ihn hervorgebracht habe oder ob die Informationen wahr oder falsch seien.
Das Fehlen eines Wasserzeichens belegt ebenfalls nicht, dass eine Person den Text geschrieben hat. OpenAI zufolge kann die Erkennung fehlschlagen, weil eine Passage zu kurz ist, bearbeitet oder übersetzt wurde, von einem anderen Modell stammt oder vor der Einführung der Technologie erstellt wurde.
Der Zugang zum Detektor wird zunächst beschränkt
OpenAI hat Bewerbungen von zugelassenen Forschern und Fachorganisationen geöffnet, die Zugang zum Detektor beantragen möchten. Das Unternehmen verwies auf die Risiken falsch-positiver und falsch-negativer Ergebnisse und erklärte, es werde zunächst individuell Zugang gewähren, um die Zuverlässigkeit des Systems und verantwortungsvolle Einsatzmöglichkeiten zu bewerten.
Das Unternehmen plant zudem, textGrain als Open Source zu veröffentlichen, damit andere Entwickler eigene Werkzeuge auf Basis der Technologie entwickeln können. OpenAI zufolge ergaben Tests des neuen fortgeschrittenen Astra-Modells keinen signifikanten Unterschied bei Benchmark-Ergebnissen mit und ohne Wasserzeichen.
OpenAI erklärte, keine einzelne Methode könne die Herkunft von Inhalten vollständig verifizieren. Das Unternehmen plant, die Wasserzeichenerkennung weiter zu verbessern, unter anderem durch die Bewertung ihrer Widerstandsfähigkeit gegen Bearbeitung und Übersetzung, und strebt langfristig an, wirksamer zwischen KI-unterstütztem Schreiben und vollständiger KI-Autorschaft zu unterscheiden.
Separat berichtete die Quelle zuvor, dass OpenAI versuchte, 30 Milliarden US-Dollar bei einer Bewertung von 1,4 Billionen US-Dollar aufzunehmen.
Quelle: HODL Press
