Gemini Omni : le nouveau modèle vidéo IA de Google, démos et utilisation
Gemini Omni est le nouveau modèle de Google qui transforme toute entrée en vidéo. Voyez les démos, Omni Flash, l’accès gratuit et le calendrier API.
Google vient de présenter Gemini Omni à I/O, et la version en une phrase est simple : il accepte presque n’importe quelle entrée — images, audio, vidéo, texte, même un croquis — et la transforme en vidéo de haute qualité.
Cela ressemble au discours de tous les modèles vidéo des deux dernières années. Ce n’est pourtant pas le cas, et les démos l’expliquent. Google a publié cinq posts à la suite ; nous avons rassemblé les clips pour que vous puissiez juger directement, plutôt que lire le résumé d’un résumé.
Découvrez Gemini Omni
La révélation : un modèle, n’importe quelle entrée, une vidéo en sortie.
Il comprend la physique, pas seulement les pixels
C’est la partie qui mérite qu’on ralentisse. La plupart des modèles vidéo apprennent à quoi ressemblent les scènes. L’affirmation de Google est que Gemini Omni raisonne sur le fonctionnement du monde : il combine une intuition physique avec les connaissances réelles de Gemini. Un liquide versé se stabilise, le poids tombe là où il devrait, et la sortie se comporte au lieu de simplement s’afficher.
N’importe quelle entrée, une vidéo en sortie
Vous pouvez lui donner ensemble des images, de l’audio, de la vidéo et du texte. Ou lui fournir un croquis et le laisser suivre votre intention. Le “omni” du nom est le vrai sujet : le côté entrée est largement ouvert, pas limité à une simple zone de prompt.
Le montage devient une conversation
Pour la plupart des gens, c’est la démo qui marque. Vous modifiez vos propres images en lui parlant : recadrer l’action, changer le point de vue, rendre la lumière plus cinématographique, sur plusieurs tours. Chaque instruction s’appuie sur la précédente, les personnages restent cohérents, la physique tient et la scène se souvient de ce qui précède. La timeline pleine de keyframes devient un échange.
Où et quand l’utiliser
La version lancée s’appelle Gemini Omni Flash, avec un déploiement par étapes :
Aujourd’hui : abonnés Google AI Plus, Pro et Ultra dans le monde, dans l’app Gemini et Flow by Google.
Cette semaine, gratuitement : YouTube Shorts et l’app YouTube Create.
Dans les prochaines semaines : développeurs et clients enterprise via API.
Les créateurs l’essaient donc d’abord ; l’API, la partie importante pour construire dessus, arrive un peu plus tard. (Post de déploiement de Google)
Avis rapide
Le pari ici, c’est physique plus raisonnement. Beaucoup de modèles peuvent produire un joli clip de cinq secondes. Beaucoup moins gardent un personnage cohérent pendant que vous renégociez le plan quatre fois de suite. Si cette cohérence tient hors de la vidéo de lancement, le vrai changement est le workflow de montage, pas la génération.
Cela indique aussi où va le travail agentique. L’unité intéressante n’est plus un prompt isolé, mais une session multi-tour qui garde l’état, exactement la forme de travail déjà menée dans Kollab : donner du contexte au modèle, itérer sur plusieurs tours et garder un thread cohérent. Un modèle qui fait cela nativement pour la vidéo rend ces workflows bien plus concrets.
FAQ
Qu’est-ce que Gemini Omni ?
Le nouveau modèle d’IA de Google qui génère une vidéo de haute qualité à partir de n’importe quelle entrée — images, audio, vidéo, texte ou dessin — et modifie une vidéo existante par conversation. Il a été annoncé à Google I/O.
Gemini Omni est-il gratuit ?
La version Gemini Omni Flash est gratuite dans YouTube Shorts et l’app YouTube Create à partir de cette semaine. L’accès complet arrive d’abord pour les abonnés Google AI Plus, Pro et Ultra dans l’app Gemini et Flow by Google.
Quand l’API Gemini Omni sera-t-elle disponible ?
Google indique que l’accès API pour les développeurs et les entreprises arrivera dans les prochaines semaines, après le déploiement grand public.
Qu’est-ce qui différencie Gemini Omni des autres modèles vidéo ?
Il combine une compréhension intuitive de la physique avec le raisonnement réel de Gemini, et prend en charge un montage conversationnel multi-tour où les personnages et l’état de la scène restent cohérents entre les instructions.
Source : posts officiels de @Google à #GoogleIO — révélation, physique, toute entrée, montage conversationnel et déploiement. Clips intégrés pour commentaire et référence ; tous les droits appartiennent à Google.
