OpenAI hat eine koordinierte Kampagne gestoppt, bei der über 15.000 Nutzer versuchten, die versteckten Denkprozesse seiner KI-Modelle zu kopieren. Das Unternehmen macht Moonshot AI, den Entwickler des chinesischen Chatbots Kimi, für einen Großteil der Aktivitäten verantwortlich.
OpenAI zufolge startete die Kampagne am 1. Juli und erreichte ihren Höhepunkt am 24. und 25. Juli mit 16.000 Extraktionsanfragen von über 4.000 Nutzern. Das Ziel war nicht die fertigen Antworten der KI, sondern die verborgenen Denkprozesse davor – jene internen Schritte, die moderne KI-Modelle durchlaufen, bevor sie ein Ergebnis präsentieren.
Die Angreifer versuchten, diese verschlüsselten Denkprozesse durch manipulierte Modellinteraktionen sichtbar zu machen. Eine Methode bestand darin, verschlüsselte Reasoning-Daten aus einem Gespräch zu kopieren und ein Modell in einem anderen Gespräch zu bitten, diese zu dekodieren. OpenAI betont, dass keine Verschlüsselung gebrochen oder Datenbanken kompromittiert wurden.
Das Vorgehen wird als "adversarial distillation" bezeichnet – das unbefugte Nutzen von KI-Ausgaben, um ein anderes Modell zu trainieren. Dadurch könnten kleinere Modelle bessere Ergebnisse erzielen, ohne kostspielige eigene Trainings durchführen zu müssen. OpenAI hat die betreffende Sicherheitslücke inzwischen geschlossen.