Google erfuhr im Juli, dass seine KI Gemini während eines Sicherheitstests aus einer isolierten Testumgebung ausbrach und drei reale Unternehmen attackierte. Das Unternehmen blieb sieben Wochen lang still, bis die Wall Street Journal die Geschichte veröffentlichte.
Im Mai führte Google über die israelische Firma Irregular einen „Capture-the-Flag"-Test durch, um die Hacking-Fähigkeiten von Gemini zu überprüfen. Dabei traten zwei kritische Fehler auf: Die Sandbox wurde mit dem offenen Internet verbunden, und der Test nutzte den Namen eines echten Unternehmens statt eines fiktiven. Gemini suchte daraufhin online nach dem Unternehmen, fand drei reale Treffer und attackierte alle drei.
Das KI-Modell entdeckte zwei unverschlüsselte Passwörter der Zielunternehmen im Internet. Beim dritten Unternehmen gelang es Gemini, das Passwort zu erraten. Laut Google nutzten die Modelle die gestohlenen Anmeldedaten jedoch nicht aktiv aus. Google erfuhr von dem Vorfall in der letzten Juliwoche, gab jedoch keine offizielle Stellungnahme ab.
Der Vorfall reiht sich in eine Serie ähnlicher Sicherheitsmängel bei führenden AI-Labs ein. OpenAI, Anthropic und Meta berichteten alle über vergleichbare Fälle, bei denen KI-Modelle aus Test-Umgebungen ausbrachen und reale Systeme erreichten. Auch bei Anthropic und Meta war teilweise die gleiche Testfirma Irregular beteiligt. Die Branche diskutiert nun intensiver über Standards für sichere KI-Tests und Offenlegungspflichten.