Google kiirendab Gemma 4 mudelit 3 korda: miks kohalikud mudelid muutuvad reageerivamaks
Google kiirendab Gemma 4 mudelit 3 korda: miks kohalikud mudelid muutuvad reageerivamaks
Google tõi Gemma 4 perekonnale välja uue kiirendusmehhanismi — Multi-Token Prediction drafters ehk MTP-drafterid. Ettevõtte väitel võib see teha mudeli inferentsi kuni kolm korda kiiremaks, ilma et vastuste kvaliteet või arutlus halveneks. Lihtsamalt: mudel ei kirjuta enam ainult üht tekstijuppi korraga, vaid saab väikeselt abiliselt korraga mitme järgmise jupi mustandi ja kontrollib selle kiiresti üle.
See ei ole aprillikuise Gemma 4 reliisi kordus, millest Neuro.ee kirjutas kui Google’i katsest muuta avatud mudelid arendajate jaotuskanaliks. Nüüd on tähtis teine kiht: mitte „milline mudel on targem“, vaid „kui kiiresti ta vastab päris seadmes“. Kohalike mudelite, mobiilirakenduste ja AI-agentide jaoks otsustab see tihti rohkem kui järjekordne protsendipunkt testides.
Mis on inferents ja miks see aeglustub
Inferents on hetk, mil keelemudel on juba treenitud ja vastab kasutaja päringule. Kui vestlusbot kirjutab lauset, ei võta ta seda valmis failist: ta ennustab samm-sammult järgmist tokenit — väikest tekstifragmenti, mõnikord sõna, mõnikord sõnaosa või märki.
Klassikaline suur keelemudel töötab järjest: loob ühe tokeni, selle põhjal järgmise, siis veel ühe. See on töökindel, kuid aeglane. Isegi kui jätk on üsna ilmne, kulutab mudel iga järgmise jupi jaoks täisväärtusliku arvutuskäigu.
Sellest tekib viivitus — aeg päringu ja nähtava vastuse vahel. Pika teksti puhul on see tüütu. Häälassistendi, koodiredaktori või agendi puhul, mis peab planeerima kümneid järjestikuseid samme, muutub viivitus peamiseks kasutajakogemuse takistuseks: mudel võib olla tark, kuid tundub nagu inimene, kes mõtleb iga sõna järel.
Kuidas speculative decoding töötab
MTP-drafterid kasutavad tehnikat nimega speculative decoding ehk spekulatiivne dekodeerimine. Idee on argine: väike ja kiire mudel teeb mustandi, suur mudel kontrollib, kas on nõus.
Skeem on järgmine. Põhimudel Gemma 4 vastutab kvaliteedi eest. Tema kõrval töötab kerge drafter ehk mustandmudel, mis pakub ette mitu järgmist tokenit. Seejärel kontrollib põhimudel kogu pakutud lõiku paralleelselt ühe läbimisega. Kui mustand kattub sellega, mida suur mudel ise valiks, võetakse korraga vastu mitu tokenit. Kui ei kattu, paneb põhimudel õige tokeni ja mustand jätkab sellest.
Oluline on, et kvaliteet ei peaks langema, sest lõplik kontroll jääb suurele mudelile. Drafter ei asenda Gemma 4, vaid säästab aega ilmsete jätkude pealt. Google rõhutab eraldi, et kiirendus tuleb ilma inferentsi kvaliteedi ja arutlusloogika halvenemiseta.
Miks MTP on tavalisest mustandist kiirem
Multi-Token Prediction on arhitektuur, kus mustand ei ole lihtsalt eraldi väike mudel suure kõrval. Gemma 4 puhul on see tihedalt põhiprotsessi sisse ehitatud: ta kasutab osa juba arvutatud sisemisest infost ja ühist sisendiesituste tabelit.
Siin on tähtis veel üks mõiste — KV cache. Kui mudel loeb päringut ja juba loodud teksti, salvestab ta vaheandmeid konteksti kohta, et mitte kõike iga uue tokeni juures nullist arvutada. MTP saab osa sellest infost taaskasutada ning seetõttu on mustandi tegemine odavam kui täiesti eraldi abimudeli jooksutamine.
Praktiliselt tähendab see, et kiirendus ei tule maagilisest „vähem mõtlemisest“, vaid paremast töökorraldusest. Suur mudel teeb endiselt lõpliku otsuse, kuid ei raiska iga ilmselge tokeni peale sama palju järjestikust aega.
Miks see arendajatele korda läheb
Arendaja jaoks on inferentsikiirus väga konkreetne kulurida. Kui kohalik mudel vastab kaks või kolm korda kiiremini, muutuvad võimalikuks kasutajaliidesed, mis varem tundusid liiga venivad: reaalajas kirjutamisabi, koodiparandused, dokumendianalüüs, häälsuhtlus, kohaliku failiagendi mitmesammulised töövood.
Sama oluline on riistvara. Kõik ei taha või saa saata andmeid pilve. Kohalik AI on vajalik privaatsuse, latentsuse, hinna ja võrguühenduseta töö jaoks. Kui Gemma 4 kiireneb ilma kvaliteeti kaotamata, võib väiksem seade tunduda suurema mudeli väärilisena.
See on eriti tähtis agentidele. Agent ei tee tavaliselt ühte vastust, vaid kümneid väikseid samme: loeb faili, plaanib, kutsub tööriista, kontrollib tulemust, parandab, kirjutab järgmise käsu. Iga tokeni viivitus korrutub kogu ahelas. Kiirem dekodeerimine teeb agendid vähem „mõtlikuks“ ja rohkem tööriista moodi.
Suurem pilt
Gemma 4 MTP-drafterid näitavad, et AI-võidujooks ei käi ainult mudeli suuruse ja benchmark’ide ümber. Järgmine praktiline hüpe võib tulla sellest, kui sama kvaliteediga vastus jõuab kasutajani kiiremini, odavamalt ja väiksemas seadmes.
Google’i jaoks on see ka strateegiline samm avatud mudelite maailmas. Kui Gemma ei ole ainult saadaval, vaid ka mugav ja kiire käivitada, muutub ta arendajatele realistlikumaks valikuks. Kohaliku AI turul võidab sageli mitte kõige efektsem demo, vaid mudel, mida on lihtne päris rakendusse panna.
Kokkuvõte on lihtne: kolm korda kiirem inferents ei tee mudelit automaatselt targemaks, kuid teeb selle palju kasutatavamaks. Ja AI-ajastul on kasutatavus sageli see koht, kus laborivõime muutub päris tooteks.
- blog.googleAccelerating Gemma 4: faster inference with multi-token prediction drafters
- ai.google.devSpeed-up Gemma 4 with Multi-Token Prediction
- arxiv.orgFast Inference from Transformers via Speculative Decoding
- huggingface.coGemma 4 - a google Collection
- commons.wikimedia.orgCover image source: Google Headquarters Google Logo













