Das deutsche KI-Unternehmen Black Forest Labs hat FLUX 3 gelauncht – sein erstes Modell, das Videos statt nur Standbilder generiert. Die neue Multimodal-KI lernt gleichzeitig aus Bildern, Videos und Audio und wird bereits in der Robotik eingesetzt.
Black Forest Labs hat FLUX 3 diese Woche in Early Access veröffentlicht. Das Flaggschiff-Modell des deutschen KI-Labs generiert erstmals Videos statt nur statische Bilder und kann Clips bis zu 20 Sekunden Länge mit synchronisiertem Audio produzieren. In direkten Vergleichen bevorzugten Tester FLUX 3 in 77 % der Fälle gegenüber Runway Gen-4.5 und in 93 % gegenüber Luma Ray 3.2.
Das Besondere: FLUX 3 trainiert als sogenanntes Multimodal-Modell – es lernt Bilder, Videos und Audio gleichzeitig in einem einzigen System statt in separaten Tools. Nach Ansicht des Mitgründers Robin Rombach ermöglicht das Verständnis von Videodynamiken auch das Verständnis von Physik: Gewicht, Kontakt und Timing. Diese Fähigkeiten sind zentral für Roboter, die sich in der realen Welt bewegen müssen.
Dieses Konzept mündet in FLUX-mimic, ein Robotik-Modell, das FLUX 3's Video-Engine mit einem leichten Decoder kombiniert. Der Autohersteller Audi testet das System bereits für komplexe Aufgaben wie das Anbringen flexibler Türdichtungen – Arbeiten, bei denen konventionelle Automatisierung bislang scheiterte. Das System reagiert in etwa 101 Millisekunden, was menschlichen visuellen Reflexen entspricht.