Blog

Gemini Omni: Googles neues KI-Videomodell, Demos und Nutzung

20. Mai 2026deYANAI Insights4 Min. Lesezeit

Gemini Omni ist Googles neues Modell, das nahezu jede Eingabe in Video verwandelt. Sieh dir Demos, Omni Flash, kostenlosen Zugang und den API-Zeitplan an.

Gemini OmniGemini Omni FlashGoogle Gemini OmniKI-VideomodellGemini Omni DemoGemini Omni APIGemini Omni kostenlos

Google hat Gemini Omni gerade auf der I/O vorgestellt, und die Kurzfassung ist einfach: Es nimmt fast jede Eingabe, die du ihm gibst - Bilder, Audio, Video, Text, sogar eine grobe Skizze - und verwandelt sie in hochwertiges Video.

Das klingt wie jedes andere Pitch für Videomodelle der letzten zwei Jahre. Ist es aber nicht, und die Demos zeigen warum. Google veröffentlichte fünf Posts nacheinander. Wir haben die Clips eingebettet, damit du selbst urteilen kannst, statt nur eine Zusammenfassung der Zusammenfassung zu lesen.

Lerne Gemini Omni kennen

Die Enthüllung. Ein Modell, jede Eingabe, Video als Ausgabe.

"Meet Gemini Omni — our new AI model that can create anything from any input, starting with video." — @Google

Es versteht Physik, nicht nur Pixel

An dieser Stelle lohnt es sich, langsamer hinzuschauen. Die meisten Videomodelle lernen, wie Szenen aussehen. Googles Anspruch ist, dass Gemini Omni darüber nachdenkt, wie die Welt funktioniert - es verbindet ein intuitives Gefühl für Physik mit Geminis Wissen über die reale Welt. Ausgegossene Flüssigkeit kommt also zur Ruhe, Gewicht landet dort, wo Gewicht landen sollte, und das Ergebnis verhält sich, statt nur gerendert zu wirken.

Photorealism is table stakes now. Behaving like the real world is the new bar. — @Google

Jede Eingabe rein, Video raus

Gib ihm Bilder, Audio, Video und Text zusammen. Oder gib ihm eine Zeichnung und lass es deine Vorstellung treffen. Das „omni“ im Namen ist der eigentliche Punkt: Die Eingabeseite ist weit offen, nicht nur ein einzelnes Prompt-Feld.

Combine images, audio, video and text — or sketch it. — @Google

Bearbeitung ist jetzt ein Gespräch

Für die meisten Menschen ist das der Teil, der sofort sitzt. Du bearbeitest dein eigenes Material, indem du mit dem Modell sprichst. Den Bildausschnitt neu setzen, die Perspektive wechseln, das Licht filmischer machen - über mehrere Runden hinweg. Jede Anweisung baut auf der vorherigen auf, sodass Figuren konsistent bleiben, die Physik hält und die Szene sich merkt, was zuvor passiert ist. Die Timeline voller Keyframes wird zu einem Hin und Her.

Multi-turn editing where the scene keeps its memory. — @Google

Wo und wann du es nutzen kannst

Die veröffentlichte Stufe heißt Gemini Omni Flash, und der Rollout erfolgt in Etappen:

  • Heute - weltweit für Google AI Plus-, Pro- und Ultra-Abonnenten in der Gemini-App und in Flow by Google.

  • Diese Woche, kostenlos - in YouTube Shorts und der YouTube Create App.

  • In den kommenden Wochen - für Entwickler und Unternehmenskunden per API.

Creator können also zuerst direkt damit arbeiten, und die API - der Teil, der wichtig ist, wenn du darauf aufbauen willst - kommt etwas später. (Googles Rollout-Post)

Kurze Einschätzung

Der Physik- und Reasoning-Ansatz ist hier die Wette. Viele Modelle können einen hübschen Fünf-Sekunden-Clip erzeugen. Deutlich weniger halten eine Figur konsistent, während du die Aufnahme viermal hintereinander neu verhandelst. Wenn diese Konsistenz auch außerhalb eines Launch-Reels hält, ist der eigentliche Wandel der Bearbeitungsworkflow, nicht die Generierung.

Es zeigt außerdem, wohin Agent-Arbeit geht. Die interessante Einheit ist nicht mehr ein einzelner Prompt, sondern eine mehrstufige Sitzung, die Zustand behält - genau die Arbeitsform, die Menschen bereits in Kollab nutzen: einem Modell Kontext geben, über mehrere Runden iterieren und den Thread kohärent halten. Ein Modell, das das nativ für Video kann, macht diese Workflows sehr viel konkreter.

Warte nicht auf die API - erstelle jetzt mit der neuesten Video-KI
Kollab bündelt bereits die neuesten Videomodelle in einem Workspace, mit demselben mehrstufigen, kontextbewahrenden Flow wie oben beschrieben. Ohne Einrichtung.
In Kollab loslegen →

FAQ

Was ist Gemini Omni?

Googles neues KI-Modell, das hochwertiges Video aus jeder Eingabe erzeugt - Bildern, Audio, Video, Text oder einer Zeichnung - und bestehendes Video im Gespräch bearbeitet. Es wurde auf der Google I/O angekündigt.

Ist Gemini Omni kostenlos?

Die Stufe Gemini Omni Flash ist ab dieser Woche kostenlos in YouTube Shorts und der YouTube Create App verfügbar. Voller Zugriff startet zuerst für Google AI Plus-, Pro- und Ultra-Abonnenten in der Gemini-App und in Flow by Google.

Wann ist die Gemini Omni API verfügbar?

Google sagt, dass API-Zugang für Entwickler und Unternehmenskunden in den kommenden Wochen nach dem Consumer-Rollout kommt.

Was unterscheidet Gemini Omni von anderen Videomodellen?

Es kombiniert ein intuitives Verständnis von Physik mit Geminis Reasoning über die reale Welt und unterstützt mehrstufige dialogische Bearbeitung, bei der Figuren und Szenenzustand über Anweisungen hinweg konsistent bleiben.


Quelle: offizielle Posts von @Google zu #GoogleIO - Enthüllung, Physik, jede Eingabe, dialogische Bearbeitung, Rollout. Die Clips sind zu Kommentar- und Referenzzwecken eingebettet; alle Rechte liegen bei Google.

Erforschen Sie dieses Thema weiter

Nutzen Sie diese nächsten Seiten, um vom Artikel zu Produktdetails, Vergleichen und Workflow-Beispielen zu gelangen.

Verwandte Artikel