Google tõi välja Gemini Omni: videot saab nüüd muuta vestlusega
Google esitles Gemini Omni Flashi, esimest mudelit uues Gemini Omni perekonnas. Ettevõte kirjeldab seda süsteemina, kus Gemini multimodaalne mõistmine ühendatakse genereerimisega: kasutaja võib anda teksti, pildi, video või heli ja saada uue video ning seejärel muuta seda tavaliste fraasidega. Käivitus algab videost, kuid Google ütleb, et Omni perekond peaks hiljem toetama ka teisi väljundvorminguid, sealhulgas pilte ja heli.
Esmalt jõuab Gemini Omni Flash Gemini rakendusse, Google Flow’sse ja YouTube Shortsi. Google AI Plus, Pro ja Ultra tellijatele rullitakse mudel Gemini ja Flow kaudu välja üle maailma, Shorts Remixi ja YouTube Create’i sees on see alates sellest nädalast tasuta saadaval. Lähinädalatel lubab Google tuua Omni arendajate ja äriklientideni API kaudu.
Montaaž ilma ajajooneta
Teate kõige arusaadavam osa on vestluslik videotöötlus. Google näitab stsenaariume, kus kasutaja võtab lähtevideo ja palub materjali muuta: teha skulptuur mullidest, muuta tegevust stseenis, lisada objekt, viia muusik teise keskkonda, muuta kaameranurka või sünkroonida valgus muusikaga. Tähtis on, et parandused võivad käia ahelana: iga järgmine käsk toetub eelmisele ning mudel püüab säilitada tegelasi, füüsikat ja stseeni konteksti.
See erineb harjumuspärasest video nullist genereerimisest. Paljude inimeste jaoks on kasulikum mitte saada juhuslikult ilusat klippi, vaid võtta oma materjal ja viia see kiiresti soovitud kujule: eemaldada üleliigne, muuta stiili, lisada efekt, muuta visand selgitavaks videoks või kohandada idee lühivideoks. Seetõttu on Omni tähtis mitte järjekordse ilusate demode võistlusena, vaid sammuna montaaži poole kavatsuse kaudu, ilma et peaks tundma professionaalset liidest.
Miks YouTube on siin oluline
Eraldi tähendus on YouTube Shortsil. YouTube kirjutab, et Omni lubab remiksida sobivaid Shortse: kasutaja saab lisada päringuid ja pilte, muuta stseeni, panna ennast autori kõrvale või arendada kellegi teise videot uues suunas, samal ajal peaks lähtevideo kontekst säilima. Lühivideoplatvormi jaoks on see tugev käik: AI-montaaž muutub mitte eraldi rakenduseks, vaid tuttava vaatamise ja remiksimise voo osaks.
Loojatele on see korraga võimalus ja uus pingeallikas. Videoid saab lihtsamini ümber teha, mis tähendab, et ideed kopeeritakse, stiliseeritakse ja levivad platvormide vahel kiiremini. Google lubab SynthID vesimärke, Content Credentialsi, linke originaalvideole, võimalust visuaalne remiks välja lülitada ja likeness-tuvastuse tööriista laiendamist üle 18-aastastele autoritele. Need piirangud ei ole dekoratiivsed: mida odavamaks muutub veenev video, seda olulisem on aru saada, kust see tuli ja kes lubas seda kasutada.
Mida see muudab
Gemini Omni näitab, kuhu generatiivse video turg pärast esimesi vau-klippe liigub. Peamine konkurents nihkub küsimuselt „kas mudel suudab teha ilusa stseeni“ küsimusele „kas mudel suudab juhitavalt muuta juba olemasolevat materjali“. Äri, hariduse, reklaami, blogijate ja tavakasutajate jaoks on see praktilisem: videot saab mitte ainult genereerida, vaid parandada iteratsioonidena, nagu teksti vestluses.
Samas piirab Google lubadusi praegu ettevaatlikult. Kõne ja heli muutmist väljaspool oma avatare ettevõte alles testib, API ilmub hiljem ning ligipääs ja funktsioonid sõltuvad tellimusest ja piirkonnast. Kuid suund on juba nähtav: AI-video lakkab olemast eraldi laboridemonstratsioon ja muutub osaks massitoodetest, kus küsimuse „kuidas seda teha“ asemel tuleb üha sagedamini küsimus „mida täpselt ma tahan muuta“.













