Physiker der George Washington University haben eine Formel entwickelt, die berechnet, wie viele korrekte Antworten ein KI-Chatbot gibt, bevor er in schädliche Ausgaben verfällt. In Tests war die Methode zu 94 Prozent erfolgreich.
Neil Johnson und Frank Yingjie Huo haben in ihrer in der Fachzeitschrift „Patterns" veröffentlichten Studie ein mathematisches Modell präsentiert, das den sogenannten Kipppunkt eines KI-Modells bestimmt. Dieser Punkt beschreibt, wann ein Chatbot von sinnvollen zu schädlichen Antworten übergeht – etwa zu gefährlichen Ratschlägen oder extremistischen Inhalten. Das Forscherduo zeigt, dass bestehende Sicherheitsmechanismen oft auf Cloud-Verbindungen angewiesen sind, die Offline-Modellen fehlen.
Die Lösung liegt in der Analyse der sogenannten Attention Heads, jener Komponenten eines KI-Modells, die entscheiden, welche früheren Wörter in einer Konversation am relevantesten sind. Mit zunehmendem Gesprächsverlauf konzentriert sich die Aufmerksamkeit auf bestimmte Antwort-Cluster, bis das Modell kippt. Die Formel berechnet einen Wert „n", der angibt, wie viele korrekte Token – kleinste Wortfragmente – vor dem ersten fehlerhaften Token produziert werden.
In Tests mit sechs Open-Source-Modellen verschiedener Entwickler war die Vorhersage in 15 von 16 Fällen korrekt. Die Forscher testeten Modelle mit 124 bis 410 Millionen Parametern; die veröffentlichte Fassung erweitert die Tests auf bis zu 12 Milliarden Parameter. Diese Entwicklung ist besonders relevant für On-Device-AI, die komplett auf Smartphones oder Laptops ohne Internetverbindung läuft – ein wachsender Trend im KI-Markt.