OpenAI hat 722 mathematische Manuskripte von einem unveröffentlichten KI-Modell veröffentlicht und behauptet, diese stammen aus einem einzigen Prompt. Mathematiker kritisieren die fehlende Überprüfbarkeit und warnen vor vorschnellen Schlussfolgerungen.
OpenAI veröffentlichte am Dienstag 722 mathematische Arbeiten auf GitHub, die von einem internen, noch nicht freigegebenen KI-Modell stammen sollen. Das Unternehmen behauptet, dass fast alle Ergebnisse aus einem einzigen Prompt mit einem einzelnen KI-Agenten entstanden sind. Die 722 Manuskripte sind in 372 „Familien" verwandter Ergebnisse gruppiert, wobei OpenAI von etwa 4.000 dem Modell gestellten Problemen ausgeht und nur die bedeutsamsten zur Veröffentlichung auswählte.
Die wissenschaftliche Gemeinschaft reagiert skeptisch. Der MIT-Mathematiker Andrew Sutherland kritisiert in der Scientific American, dass Ansprüche über Einzelshot-Lösungen als unverifiziert zu behandeln sind, solange das Modell nicht veröffentlicht wurde: „Wir sollten Belege fordern." Besonders problematisch: Nur 162 der 722 Arbeiten (22 Prozent) wurden in Lean formalisiert – einem System zur automatischen logischen Überprüfung. OpenAI selbst räumt ein, dass einige unformalisierten Ergebnisse Fehler enthalten könnten.
Zusätzlich kritisieren Forscher die fehlende Transparenz. OpenAI veröffentlichte nur gekürzte Zusammenfassungen für zehn Ergebnisse und deaktivierte im Repository die Issue-Funktion sowie Pull Requests. Mathematiker wie Dmitry Rybin äußern bereits Zweifel an einzelnen Beweisen und bezeichnen sie als „unglaublich fremdartige Mathematik". Ohne Modellzugriff und offene Diskussionsmöglichkeiten bleibt die Validierung der Ergebnisse für die Fachwelt derzeit unmöglich.