Gemini Omni: Googles neues KI-Videomodell, Demos und Nutzung
Gemini Omni ist Googles neues Modell, das nahezu jede Eingabe in Video verwandelt. Sieh dir Demos, Omni Flash, kostenlosen Zugang und den API-Zeitplan an.
Google hat Gemini Omni gerade auf der I/O vorgestellt, und die Kurzfassung ist einfach: Es nimmt fast jede Eingabe, die du ihm gibst - Bilder, Audio, Video, Text, sogar eine grobe Skizze - und verwandelt sie in hochwertiges Video.
Das klingt wie jedes andere Pitch für Videomodelle der letzten zwei Jahre. Ist es aber nicht, und die Demos zeigen warum. Google veröffentlichte fünf Posts nacheinander. Wir haben die Clips eingebettet, damit du selbst urteilen kannst, statt nur eine Zusammenfassung der Zusammenfassung zu lesen.
Lerne Gemini Omni kennen
Die Enthüllung. Ein Modell, jede Eingabe, Video als Ausgabe.
Es versteht Physik, nicht nur Pixel
An dieser Stelle lohnt es sich, langsamer hinzuschauen. Die meisten Videomodelle lernen, wie Szenen aussehen. Googles Anspruch ist, dass Gemini Omni darüber nachdenkt, wie die Welt funktioniert - es verbindet ein intuitives Gefühl für Physik mit Geminis Wissen über die reale Welt. Ausgegossene Flüssigkeit kommt also zur Ruhe, Gewicht landet dort, wo Gewicht landen sollte, und das Ergebnis verhält sich, statt nur gerendert zu wirken.
Jede Eingabe rein, Video raus
Gib ihm Bilder, Audio, Video und Text zusammen. Oder gib ihm eine Zeichnung und lass es deine Vorstellung treffen. Das „omni“ im Namen ist der eigentliche Punkt: Die Eingabeseite ist weit offen, nicht nur ein einzelnes Prompt-Feld.
Bearbeitung ist jetzt ein Gespräch
Für die meisten Menschen ist das der Teil, der sofort sitzt. Du bearbeitest dein eigenes Material, indem du mit dem Modell sprichst. Den Bildausschnitt neu setzen, die Perspektive wechseln, das Licht filmischer machen - über mehrere Runden hinweg. Jede Anweisung baut auf der vorherigen auf, sodass Figuren konsistent bleiben, die Physik hält und die Szene sich merkt, was zuvor passiert ist. Die Timeline voller Keyframes wird zu einem Hin und Her.
Wo und wann du es nutzen kannst
Die veröffentlichte Stufe heißt Gemini Omni Flash, und der Rollout erfolgt in Etappen:
Heute - weltweit für Google AI Plus-, Pro- und Ultra-Abonnenten in der Gemini-App und in Flow by Google.
Diese Woche, kostenlos - in YouTube Shorts und der YouTube Create App.
In den kommenden Wochen - für Entwickler und Unternehmenskunden per API.
Creator können also zuerst direkt damit arbeiten, und die API - der Teil, der wichtig ist, wenn du darauf aufbauen willst - kommt etwas später. (Googles Rollout-Post)
Kurze Einschätzung
Der Physik- und Reasoning-Ansatz ist hier die Wette. Viele Modelle können einen hübschen Fünf-Sekunden-Clip erzeugen. Deutlich weniger halten eine Figur konsistent, während du die Aufnahme viermal hintereinander neu verhandelst. Wenn diese Konsistenz auch außerhalb eines Launch-Reels hält, ist der eigentliche Wandel der Bearbeitungsworkflow, nicht die Generierung.
Es zeigt außerdem, wohin Agent-Arbeit geht. Die interessante Einheit ist nicht mehr ein einzelner Prompt, sondern eine mehrstufige Sitzung, die Zustand behält - genau die Arbeitsform, die Menschen bereits in Kollab nutzen: einem Modell Kontext geben, über mehrere Runden iterieren und den Thread kohärent halten. Ein Modell, das das nativ für Video kann, macht diese Workflows sehr viel konkreter.
FAQ
Was ist Gemini Omni?
Googles neues KI-Modell, das hochwertiges Video aus jeder Eingabe erzeugt - Bildern, Audio, Video, Text oder einer Zeichnung - und bestehendes Video im Gespräch bearbeitet. Es wurde auf der Google I/O angekündigt.
Ist Gemini Omni kostenlos?
Die Stufe Gemini Omni Flash ist ab dieser Woche kostenlos in YouTube Shorts und der YouTube Create App verfügbar. Voller Zugriff startet zuerst für Google AI Plus-, Pro- und Ultra-Abonnenten in der Gemini-App und in Flow by Google.
Wann ist die Gemini Omni API verfügbar?
Google sagt, dass API-Zugang für Entwickler und Unternehmenskunden in den kommenden Wochen nach dem Consumer-Rollout kommt.
Was unterscheidet Gemini Omni von anderen Videomodellen?
Es kombiniert ein intuitives Verständnis von Physik mit Geminis Reasoning über die reale Welt und unterstützt mehrstufige dialogische Bearbeitung, bei der Figuren und Szenenzustand über Anweisungen hinweg konsistent bleiben.
Quelle: offizielle Posts von @Google zu #GoogleIO - Enthüllung, Physik, jede Eingabe, dialogische Bearbeitung, Rollout. Die Clips sind zu Kommentar- und Referenzzwecken eingebettet; alle Rechte liegen bei Google.
