Gemini Omni: novo modelo de vídeo com IA do Google, demos e como usar
Gemini Omni é o novo modelo do Google que transforma qualquer entrada em vídeo. Veja demos oficiais, o que faz o Omni Flash, se é grátis e quando chega a API.
O Google apresentou o Gemini Omni no I/O, e a versão em uma frase é simples: ele aceita quase qualquer entrada — imagens, áudio, vídeo, texto ou até um rascunho — e transforma tudo em vídeo de alta qualidade.
Isso parece o discurso de qualquer modelo de vídeo dos últimos dois anos. Mas não é, e as demos explicam por quê. O Google publicou cinco posts seguidos; reunimos os clipes para você julgar diretamente, não ler o resumo de outro resumo.
Conheça o Gemini Omni
A revelação: um modelo, qualquer entrada, vídeo como saída.
Ele entende física, não apenas pixels
Esta é a parte que merece atenção. A maioria dos modelos de vídeo aprende como as cenas parecem. A afirmação do Google é que o Gemini Omni raciocina sobre como o mundo funciona, combinando uma intuição física com o conhecimento real do Gemini. Assim, um líquido derramado se acomoda, o peso cai onde deveria e o resultado se comporta, não apenas renderiza.
Qualquer entrada entra, vídeo sai
Você pode fornecer imagens, áudio, vídeo e texto juntos. Ou entregar um desenho e deixar o modelo seguir sua visão. O “omni” no nome é o ponto real: o lado da entrada está aberto, não preso a uma única caixa de prompt.
Editar agora é uma conversa
Para a maioria das pessoas, esta é a demo que realmente impressiona. Você edita seu próprio material falando com ele: reenquadra a ação, muda o ponto de vista, deixa a luz mais cinematográfica, tudo em vários turnos. Cada instrução se apoia na anterior, então os personagens continuam consistentes, a física se mantém e a cena lembra o que veio antes. A timeline cheia de keyframes vira uma conversa.
Onde e quando você pode usar
A versão de lançamento se chama Gemini Omni Flash, com rollout em etapas:
Hoje: assinantes Google AI Plus, Pro e Ultra no mundo todo, no app Gemini e no Flow by Google.
Esta semana, grátis: YouTube Shorts e o app YouTube Create.
Nas próximas semanas: desenvolvedores e clientes enterprise via API.
Criadores testam primeiro; a API, a parte importante para quem vai construir em cima, chega um pouco depois. (Post de rollout do Google)
Leitura rápida
A aposta aqui é física mais raciocínio. Muitos modelos fazem um clipe bonito de cinco segundos. Bem menos conseguem manter um personagem consistente enquanto você renegocia o plano quatro vezes seguidas. Se essa consistência se sustentar fora do vídeo de lançamento, a mudança real é o fluxo de edição, não a geração.
Isso também aponta para onde vai o trabalho com agentes. A unidade interessante deixa de ser um prompt isolado e passa a ser uma sessão multi-turno que lembra estado, exatamente o formato de trabalho que as pessoas já executam no Kollab: dar contexto ao modelo, iterar por vários turnos e manter o thread coerente. Um modelo que faz isso nativamente para vídeo torna esses fluxos muito mais concretos.
FAQ
O que é Gemini Omni?
O novo modelo de IA do Google que gera vídeo de alta qualidade a partir de qualquer entrada — imagens, áudio, vídeo, texto ou desenho — e edita vídeo existente por conversa. Foi anunciado no Google I/O.
Gemini Omni é grátis?
A versão Gemini Omni Flash é grátis no YouTube Shorts e no app YouTube Create a partir desta semana. O acesso completo chega primeiro a assinantes Google AI Plus, Pro e Ultra no app Gemini e no Flow by Google.
Quando a API do Gemini Omni fica disponível?
O Google diz que o acesso via API para desenvolvedores e empresas chega nas próximas semanas, depois do rollout para consumidores.
O que diferencia o Gemini Omni de outros modelos de vídeo?
Ele combina uma compreensão intuitiva de física com o raciocínio do mundo real do Gemini e suporta edição conversacional multi-turno, mantendo personagens e estado de cena consistentes entre instruções.
Fonte: posts oficiais de @Google no #GoogleIO — revelação, física, qualquer entrada, edição conversacional e rollout. Clipes incorporados para comentário e referência; todos os direitos pertencem ao Google.
