Blogue

Gemini Omni : le nouveau modèle vidéo IA de Google, démos et utilisation

20 mai 2026frYANAI Insights4 min read

Gemini Omni est le nouveau modèle de Google qui transforme toute entrée en vidéo. Voyez les démos, Omni Flash, l’accès gratuit et le calendrier API.

Gemini OmniGemini Omni FlashGoogle Gemini Omnimodèle vidéo IAdémo Gemini OmniAPI Gemini OmniGemini Omni gratuit

Google vient de présenter Gemini Omni à I/O, et la version en une phrase est simple : il accepte presque n’importe quelle entrée — images, audio, vidéo, texte, même un croquis — et la transforme en vidéo de haute qualité.

Cela ressemble au discours de tous les modèles vidéo des deux dernières années. Ce n’est pourtant pas le cas, et les démos l’expliquent. Google a publié cinq posts à la suite ; nous avons rassemblé les clips pour que vous puissiez juger directement, plutôt que lire le résumé d’un résumé.

Découvrez Gemini Omni

La révélation : un modèle, n’importe quelle entrée, une vidéo en sortie.

« Découvrez Gemini Omni, notre nouveau modèle d’IA capable de créer à partir de n’importe quelle entrée, en commençant par la vidéo. » — @Google

Il comprend la physique, pas seulement les pixels

C’est la partie qui mérite qu’on ralentisse. La plupart des modèles vidéo apprennent à quoi ressemblent les scènes. L’affirmation de Google est que Gemini Omni raisonne sur le fonctionnement du monde : il combine une intuition physique avec les connaissances réelles de Gemini. Un liquide versé se stabilise, le poids tombe là où il devrait, et la sortie se comporte au lieu de simplement s’afficher.

Le photoréalisme est désormais le minimum. Se comporter comme le monde réel est le nouveau standard. — @Google

N’importe quelle entrée, une vidéo en sortie

Vous pouvez lui donner ensemble des images, de l’audio, de la vidéo et du texte. Ou lui fournir un croquis et le laisser suivre votre intention. Le “omni” du nom est le vrai sujet : le côté entrée est largement ouvert, pas limité à une simple zone de prompt.

Combinez images, audio, vidéo et texte, ou partez d’un croquis. — @Google

Le montage devient une conversation

Pour la plupart des gens, c’est la démo qui marque. Vous modifiez vos propres images en lui parlant : recadrer l’action, changer le point de vue, rendre la lumière plus cinématographique, sur plusieurs tours. Chaque instruction s’appuie sur la précédente, les personnages restent cohérents, la physique tient et la scène se souvient de ce qui précède. La timeline pleine de keyframes devient un échange.

Montage en plusieurs tours où la scène garde sa mémoire. — @Google

Où et quand l’utiliser

La version lancée s’appelle Gemini Omni Flash, avec un déploiement par étapes :

  • Aujourd’hui : abonnés Google AI Plus, Pro et Ultra dans le monde, dans l’app Gemini et Flow by Google.

  • Cette semaine, gratuitement : YouTube Shorts et l’app YouTube Create.

  • Dans les prochaines semaines : développeurs et clients enterprise via API.

Les créateurs l’essaient donc d’abord ; l’API, la partie importante pour construire dessus, arrive un peu plus tard. (Post de déploiement de Google)

Avis rapide

Le pari ici, c’est physique plus raisonnement. Beaucoup de modèles peuvent produire un joli clip de cinq secondes. Beaucoup moins gardent un personnage cohérent pendant que vous renégociez le plan quatre fois de suite. Si cette cohérence tient hors de la vidéo de lancement, le vrai changement est le workflow de montage, pas la génération.

Cela indique aussi où va le travail agentique. L’unité intéressante n’est plus un prompt isolé, mais une session multi-tour qui garde l’état, exactement la forme de travail déjà menée dans Kollab : donner du contexte au modèle, itérer sur plusieurs tours et garder un thread cohérent. Un modèle qui fait cela nativement pour la vidéo rend ces workflows bien plus concrets.

N’attendez pas l’API : créez maintenant avec la dernière IA vidéo
Kollab rassemble déjà les derniers modèles vidéo dans un workspace, avec le même flux multi-tour qui garde le contexte. Sans configuration.
Commencer à créer dans Kollab →

FAQ

Qu’est-ce que Gemini Omni ?

Le nouveau modèle d’IA de Google qui génère une vidéo de haute qualité à partir de n’importe quelle entrée — images, audio, vidéo, texte ou dessin — et modifie une vidéo existante par conversation. Il a été annoncé à Google I/O.

Gemini Omni est-il gratuit ?

La version Gemini Omni Flash est gratuite dans YouTube Shorts et l’app YouTube Create à partir de cette semaine. L’accès complet arrive d’abord pour les abonnés Google AI Plus, Pro et Ultra dans l’app Gemini et Flow by Google.

Quand l’API Gemini Omni sera-t-elle disponible ?

Google indique que l’accès API pour les développeurs et les entreprises arrivera dans les prochaines semaines, après le déploiement grand public.

Qu’est-ce qui différencie Gemini Omni des autres modèles vidéo ?

Il combine une compréhension intuitive de la physique avec le raisonnement réel de Gemini, et prend en charge un montage conversationnel multi-tour où les personnages et l’état de la scène restent cohérents entre les instructions.


Source : posts officiels de @Google à #GoogleIO — révélation, physique, toute entrée, montage conversationnel et déploiement. Clips intégrés pour commentaire et référence ; tous les droits appartiennent à Google.

Continuer à explorer ce sujet

Utilisez ces pages suivantes pour passer de l’article aux détails produit, comparaisons et exemples de workflows.

Articles liés