Gemini Omni: il nuovo modello video AI di Google, demo e come usarlo
Gemini Omni è il nuovo modello di Google che trasforma quasi qualsiasi input in video. Guarda demo, Omni Flash, accesso gratuito e tempistiche API.
Google ha appena presentato Gemini Omni sul palco dell’I/O, e la versione in una frase è semplice: prende quasi qualunque input tu gli dia - immagini, audio, video, testo, persino uno schizzo grezzo - e lo trasforma in video di alta qualità.
Sembra il pitch di ogni altro modello video degli ultimi due anni. Non lo è, e il motivo sono le demo. Google ha pubblicato cinque post di fila. Abbiamo raccolto le clip così puoi giudicarle direttamente, invece di leggere il riassunto di un riassunto.
Ecco Gemini Omni
La presentazione. Un modello, qualsiasi input, video in uscita.
Capisce la fisica, non solo i pixel
Questa è la parte su cui vale la pena rallentare. La maggior parte dei modelli video impara l’aspetto delle scene. La tesi di Google è che Gemini Omni ragiona su come funziona il mondo: unisce un senso intuitivo della fisica alla conoscenza del mondo reale di Gemini. Così un liquido versato si assesta, il peso cade dove dovrebbe cadere, e l’output si comporta in modo plausibile invece di limitarsi a essere renderizzato.
Qualsiasi input dentro, video fuori
Puoi dargli insieme immagini, audio, video e testo. Oppure consegnargli un disegno e lasciare che segua la tua visione. L’“omni” nel nome è il punto vero: il lato input è aperto, non una singola casella di prompt.
Il montaggio è diventato una conversazione
Per la maggior parte delle persone è questa la demo che colpisce. Modifichi il tuo girato parlando con il modello. Ricomporre l’azione, cambiare punto di vista, rendere la luce più cinematografica - lungo più turni. Ogni istruzione si appoggia alla precedente, così i personaggi restano coerenti, la fisica regge e la scena ricorda ciò che è successo prima. La timeline piena di keyframe diventa uno scambio avanti e indietro.
Dove e quando puoi usarlo
Il livello distribuito si chiama Gemini Omni Flash, e il rollout è graduale:
Da oggi - per gli abbonati Google AI Plus, Pro e Ultra in tutto il mondo, nell’app Gemini e in Flow by Google.
Questa settimana, gratis - su YouTube Shorts e nell’app YouTube Create.
Nelle prossime settimane - per sviluppatori e clienti enterprise via API.
Quindi i creator lo provano per primi, mentre l’API - la parte che conta se vuoi costruirci sopra - arriva poco dopo. (Post di rollout di Google)
Valutazione rapida
La scommessa qui è l’angolo fisica più ragionamento. Molti modelli possono creare una bella clip di cinque secondi. Molti meno riescono a mantenere coerente un personaggio mentre rinegozi l’inquadratura quattro volte di fila. Se la coerenza regge fuori da un reel di lancio, il vero cambio è il workflow di editing, non la generazione.
Indica anche dove sta andando il lavoro con gli agenti. L’unità interessante smette di essere un singolo prompt e diventa una sessione multi-turno che conserva lo stato - esattamente la forma di lavoro che le persone già svolgono dentro Kollab: dare contesto a un modello, iterare per più turni, mantenere coerente il thread. Un modello che lo fa nativamente per il video rende quei workflow molto più concreti.
FAQ
Che cos’è Gemini Omni?
Il nuovo modello AI di Google che genera video di alta qualità da qualsiasi input - immagini, audio, video, testo o un disegno - e modifica video esistenti tramite conversazione. È stato annunciato a Google I/O.
Gemini Omni è gratis?
Il livello Gemini Omni Flash è gratuito su YouTube Shorts e nell’app YouTube Create a partire da questa settimana. L’accesso completo arriva prima agli abbonati Google AI Plus, Pro e Ultra nell’app Gemini e in Flow by Google.
Quando sarà disponibile l’API di Gemini Omni?
Google dice che l’accesso API per sviluppatori e aziende arriverà nelle prossime settimane dopo il rollout consumer.
Cosa rende Gemini Omni diverso dagli altri modelli video?
Combina una comprensione intuitiva della fisica con il ragionamento sul mondo reale di Gemini, e supporta editing conversazionale multi-turno in cui personaggi e stato della scena restano coerenti tra le istruzioni.
Fonte: post ufficiali di @Google a #GoogleIO - presentazione, fisica, qualsiasi input, editing conversazionale, rollout. Le clip sono incorporate per commento e riferimento; tutti i diritti appartengono a Google.
