Tagasi
5. mai 2026, kell 19:45 AI Google Gemma LLM Local AI Developers Google Blog; Google AI for Developers; arXiv; Hugging Face; Wikimedia Commons

Google kiirendab Gemma 4 mudelit 3 korda: miks kohalikud mudelid muutuvad reageerivamaks

Google kiirendab Gemma 4 mudelit 3 korda: miks kohalikud mudelid muutuvad reageerivamaks

Google kiirendab Gemma 4 mudelit 3 korda: miks kohalikud mudelid muutuvad reageerivamaks

Google tõi Gemma 4 perekonnale välja uue kiirendusmehhanismi — Multi-Token Prediction drafters ehk MTP-drafterid. Ettevõtte väitel võib see teha mudeli inferentsi kuni kolm korda kiiremaks, ilma et vastuste kvaliteet või arutlus halveneks. Lihtsamalt: mudel ei kirjuta enam ainult üht tekstijuppi korraga, vaid saab väikeselt abiliselt korraga mitme järgmise jupi mustandi ja kontrollib selle kiiresti üle.

See ei ole aprillikuise Gemma 4 reliisi kordus, millest Neuro.ee kirjutas kui Google’i katsest muuta avatud mudelid arendajate jaotuskanaliks. Nüüd on tähtis teine kiht: mitte „milline mudel on targem“, vaid „kui kiiresti ta vastab päris seadmes“. Kohalike mudelite, mobiilirakenduste ja AI-agentide jaoks otsustab see tihti rohkem kui järjekordne protsendipunkt testides.

Mis on inferents ja miks see aeglustub

Inferents on hetk, mil keelemudel on juba treenitud ja vastab kasutaja päringule. Kui vestlusbot kirjutab lauset, ei võta ta seda valmis failist: ta ennustab samm-sammult järgmist tokenit — väikest tekstifragmenti, mõnikord sõna, mõnikord sõnaosa või märki.

Klassikaline suur keelemudel töötab järjest: loob ühe tokeni, selle põhjal järgmise, siis veel ühe. See on töökindel, kuid aeglane. Isegi kui jätk on üsna ilmne, kulutab mudel iga järgmise jupi jaoks täisväärtusliku arvutuskäigu.

Sellest tekib viivitus — aeg päringu ja nähtava vastuse vahel. Pika teksti puhul on see tüütu. Häälassistendi, koodiredaktori või agendi puhul, mis peab planeerima kümneid järjestikuseid samme, muutub viivitus peamiseks kasutajakogemuse takistuseks: mudel võib olla tark, kuid tundub nagu inimene, kes mõtleb iga sõna järel.

Kuidas speculative decoding töötab

MTP-drafterid kasutavad tehnikat nimega speculative decoding ehk spekulatiivne dekodeerimine. Idee on argine: väike ja kiire mudel teeb mustandi, suur mudel kontrollib, kas on nõus.

Skeem on järgmine. Põhimudel Gemma 4 vastutab kvaliteedi eest. Tema kõrval töötab kerge drafter ehk mustandmudel, mis pakub ette mitu järgmist tokenit. Seejärel kontrollib põhimudel kogu pakutud lõiku paralleelselt ühe läbimisega. Kui mustand kattub sellega, mida suur mudel ise valiks, võetakse korraga vastu mitu tokenit. Kui ei kattu, paneb põhimudel õige tokeni ja mustand jätkab sellest.

Oluline on, et kvaliteet ei peaks langema, sest lõplik kontroll jääb suurele mudelile. Drafter ei asenda Gemma 4, vaid säästab aega ilmsete jätkude pealt. Google rõhutab eraldi, et kiirendus tuleb ilma inferentsi kvaliteedi ja arutlusloogika halvenemiseta.

Miks MTP on tavalisest mustandist kiirem

Multi-Token Prediction on arhitektuur, kus mustand ei ole lihtsalt eraldi väike mudel suure kõrval. Gemma 4 puhul on see tihedalt põhiprotsessi sisse ehitatud: ta kasutab osa juba arvutatud sisemisest infost ja ühist sisendiesituste tabelit.

Siin on tähtis veel üks mõiste — KV cache. Kui mudel loeb päringut ja juba loodud teksti, salvestab ta vaheandmeid konteksti kohta, et mitte kõike iga uue tokeni juures nullist arvutada. MTP saab osa sellest infost taaskasutada ning seetõttu on mustandi tegemine odavam kui täiesti eraldi abimudeli jooksutamine.

Praktiliselt tähendab see, et kiirendus ei tule maagilisest „vähem mõtlemisest“, vaid paremast töökorraldusest. Suur mudel teeb endiselt lõpliku otsuse, kuid ei raiska iga ilmselge tokeni peale sama palju järjestikust aega.

Miks see arendajatele korda läheb

Arendaja jaoks on inferentsikiirus väga konkreetne kulurida. Kui kohalik mudel vastab kaks või kolm korda kiiremini, muutuvad võimalikuks kasutajaliidesed, mis varem tundusid liiga venivad: reaalajas kirjutamisabi, koodiparandused, dokumendianalüüs, häälsuhtlus, kohaliku failiagendi mitmesammulised töövood.

Sama oluline on riistvara. Kõik ei taha või saa saata andmeid pilve. Kohalik AI on vajalik privaatsuse, latentsuse, hinna ja võrguühenduseta töö jaoks. Kui Gemma 4 kiireneb ilma kvaliteeti kaotamata, võib väiksem seade tunduda suurema mudeli väärilisena.

See on eriti tähtis agentidele. Agent ei tee tavaliselt ühte vastust, vaid kümneid väikseid samme: loeb faili, plaanib, kutsub tööriista, kontrollib tulemust, parandab, kirjutab järgmise käsu. Iga tokeni viivitus korrutub kogu ahelas. Kiirem dekodeerimine teeb agendid vähem „mõtlikuks“ ja rohkem tööriista moodi.

Suurem pilt

Gemma 4 MTP-drafterid näitavad, et AI-võidujooks ei käi ainult mudeli suuruse ja benchmark’ide ümber. Järgmine praktiline hüpe võib tulla sellest, kui sama kvaliteediga vastus jõuab kasutajani kiiremini, odavamalt ja väiksemas seadmes.

Google’i jaoks on see ka strateegiline samm avatud mudelite maailmas. Kui Gemma ei ole ainult saadaval, vaid ka mugav ja kiire käivitada, muutub ta arendajatele realistlikumaks valikuks. Kohaliku AI turul võidab sageli mitte kõige efektsem demo, vaid mudel, mida on lihtne päris rakendusse panna.

Kokkuvõte on lihtne: kolm korda kiirem inferents ei tee mudelit automaatselt targemaks, kuid teeb selle palju kasutatavamaks. Ja AI-ajastul on kasutatavus sageli see koht, kus laborivõime muutub päris tooteks.

Veel uudiseid

Reddit võrdles AI-hoiatusi filmiga „Ärge vaadake üles“ – ja arutelu väljus meemi raamidest
9. august 2026
Reddit võrdles AI-hoiatusi filmiga „Ärge vaadake üles“ – ja arutelu väljus meemi raamidest

Redditi r/singularity-kogukonnas avaldatud postitus võrdles AI-riskide üle peetud telearutelu stseeniga filmist „Ärge vaadake üles“, kus murettekitav sõnum kaob saateformaati. Meemi taustal on tegelik uudislugu: endine OpenAI teadlane Daniel Kokotajlo selgitab taas, miks peab 2027. aastat AI arengu järsu kiirenemise võimalikuks pöördepunktiks. Oluline pole paanika, vaid lõhe tehnoloogia arengu kiiruse ja ühiskonna suutlikkuse vahel sellest rääkida.

Jeff Dean lahkub Google'ist, et asutada oma idufirma, ja DeepMind eemaldub tipptasemel mudelite võidujooksust: Google valib mudelite asemel pilve
9. august 2026
Jeff Dean lahkub Google'ist, et asutada oma idufirma, ja DeepMind eemaldub tipptasemel mudelite võidujooksust: Google valib mudelite asemel pilve

5. augustil teatas Google DeepMindi ümberkorraldustest: Demis Hassabis taandus operatiivjuhtimisest ning Jeff Dean, üks Google'i insenerikultuuri rajajaid, lahkub koos kolme veteraniga, et asutada Discovery Loop – teaduse ja inseneeria automatiseerimisele keskenduv idufirma. Analüütikud tõlgendavad seda signaalina: Google ei panusta tipptasemel mudelite võidujooksus liidripositsioonile, vaid AI-pilvele ja tehnoloogiate levikule.

Taani kehtestab kodus kirjutatavate eksamitööde suulise kaitsmise, et ei peaks oletama, kas need kirjutas AI
9. august 2026
Taani kehtestab kodus kirjutatavate eksamitööde suulise kaitsmise, et ei peaks oletama, kas need kirjutas AI

Taani käivitab gümnaasiumides kiireloomulised meetmed AI abil petmise vastu. Kodus kirjutatud eksamitöid tuleb nüüd suuliselt kaitsta ning koolid saavad rohkem kontrollivahendeid. Põhiidee on lihtne: kontrollida mitte teksti päritolu, vaid õpilase arusaamist.

Anthropic muudab Claude Code’i autonoomse režiimi vaikeseadeks: AI-agent otsustab ise, mida teha
9. august 2026
Anthropic muudab Claude Code’i autonoomse režiimi vaikeseadeks: AI-agent otsustab ise, mida teha

Alates 14. augustist saab autonoomsest režiimist Claude Code’i vaikeseade Pro, Maxi ja Teami pakettides. Anthropic väidab, et agent tuvastab nüüd ohtlikud tegevused inimesest paremini: 1053 arendajaga testis blokeeris autonoomne režiim 89% pahatahtlikest käskudest, inimesed aga vaid 13,6%. See muudab mängureegleid kõigi jaoks, kes töötavad koodi kallal AI-agentidega.

Meditsiinilised andmed ei tohiks jõuda AI-sse muutmata kujul: OpenClawi oskus Redacta peidab patsiendinimed enne mudelisse saatmist
8. august 2026
Meditsiinilised andmed ei tohiks jõuda AI-sse muutmata kujul: OpenClawi oskus Redacta peidab patsiendinimed enne mudelisse saatmist

Arendaja avaldas Redacta – OpenClawi avatud lähtekoodiga oskuse, mis asendab nimed, kuupäevad ja patsiendinumbrid pseudonüümidega enne teksti jõudmist keelemudelisse. Tööriist töötab lokaalselt, ei edasta isikuandmeid väljapoole ning on ClawHubil kogunud juba 1400 allalaadimist. See on praktiline vastus peamisele hirmule, mis kaasneb AI kasutamisega meditsiinis: kuidas kasutada mudeleid isikuandmeid lekitamata.

37 inimest lahkusid 2026. aastal OpenAI-st ja Anthropicust, et asutada oma AI-idufirmad
8. august 2026
37 inimest lahkusid 2026. aastal OpenAI-st ja Anthropicust, et asutada oma AI-idufirmad

2026. aastal lahkus OpenAI-st ja Anthropicust 37 endist töötajat, et asutada oma AI-ettevõtted. See pole üksikute lahkumiste jada, vaid püsiv laine: kahe tähtsaima labori endised töötajad kujundavad AI-ökosüsteemi järgmist kihti – Thinking Machines Labist Mirendili ja Humans&-ini. Tavalugeja jaoks tähendab see, et konkurents AI-vallas ei piirdu enam kahe hiiglase duelliga.

$400 000 suuruste boonustega kiibitehase töötajad tõrjuvad arste ja juriste kõrvale: AI-kiipide buum kirjutab Lõuna-Korea sotsiaalse hierarhia ümber
8. august 2026
$400 000 suuruste boonustega kiibitehase töötajad tõrjuvad arste ja juriste kõrvale: AI-kiipide buum kirjutab Lõuna-Korea sotsiaalse hierarhia ümber

AI-buum on teinud Samsungi ja SK Hynixi töötajatest Lõuna-Korea uue eliidi: kuni $476 000 suurused boonused ühe töötaja kohta tõstsid nende reitingu abieluagentuurides peaaegu arstide ja juristide tasemele. Kiibitöötajatest said riigi ihaldatuimad pruudid ja peigmehed, samal ajal kui majandusteadlased hoiatavad ühiskonna kasvava kihistumise eest.

Väikeettevõtte omanik nimetas DeepSeek V4 Flashi „super-töötajaks” ja tellis veel paar serverit
8. august 2026
Väikeettevõtte omanik nimetas DeepSeek V4 Flashi „super-töötajaks” ja tellis veel paar serverit

Väikeettevõtte omanik rääkis r/LocalLLaMAs, et uuendatud DeepSeek V4 Flash 0731 võtab enda kanda kodeerimise, dokumendid ja klienditoe ning ta tellis veel paar DGX Spark serverit. See on üks ilmekamaid näiteid sellest, kuidas odav lokaalne mudel muutub väikeettevõtte täisväärtuslikuks töötajaks.

Nvidia investeerib kuni $3 miljardit Lanciumisse – ettevõttesse, mis rajab Texases Stargate’i AI-kampuse energiataristut
8. august 2026
Nvidia investeerib kuni $3 miljardit Lanciumisse – ettevõttesse, mis rajab Texases Stargate’i AI-kampuse energiataristut

Nvidia investeerib kuni $3 miljardit Lanciumisse – Texases asuva Stargate’i AI-kampuse taga seisvasse energiataristu arendajasse. Esimesed $2 miljardit annavad kiibitootjale ettevõttes umbes 20% osaluse, veel $1 miljard lisandub tingimuste täitmisel, näiteks elektrivõrguga ühendamise edenemise korral. Nii siseneb Nvidia esimest korda otse energiataristusse, mis varustab elektriga ka tema enda AI-andmekeskusi.

Musk muudab SpaceX-i AI-taristuks: 10 GW arvutusvõimsust ja kuni $300 miljardi suurune käive 2027. aastaks
8. august 2026
Musk muudab SpaceX-i AI-taristuks: 10 GW arvutusvõimsust ja kuni $300 miljardi suurune käive 2027. aastaks

SemiAnalysise analüütikud kirjutavad, et SpaceX võib 2027. aasta lõpuks rajada umbes 10 GW AI-arvutusvõimsust, mille potentsiaalne käive ulatuks kuni $300 miljardini. Esimesel IPO-järgsel tulemuskõnel teatas Muski ettevõte, et rajab tulevased võimsused eranditult Nvidia Vera Rubini kiipidele, ning praeguse arvutuspargi maht on juba 1,4 GW.

AI tegi Maci ja iPadi kallimaks: mälupuudus jõudis Apple'ini
25. juuni 2026
AI tegi Maci ja iPadi kallimaks: mälupuudus jõudis Apple'ini

Apple tõstis Macide, iPadide ja osa koduseadmete hindu, põhjendades seda mälu ja andmekandjate hinna järsu tõusuga AI-andmekeskuste tõttu. WSJ ja Bloombergi andmetel kallines MacBook Neo 599 dollarilt 699 dollarile ning osa Maci ja iPadi mudeleid lisas hinnale sadu dollareid. Ostjate jaoks on see hetk, kus AI-buum ei ole enam ainult pilvede ja GPU-de lugu: see mõjutab juba tavalise elektroonika hinda.

OpenAI ja Anthropic panustasid plaani päästa töökohad AI eest
25. juuni 2026
OpenAI ja Anthropic panustasid plaani päästa töökohad AI eest

USAs käivitati RAISE US: parteideülene organisatsioon, millel on üle 500 miljoni dollari töötajate ettevalmistamiseks AI-majanduseks. Partnerite seas on OpenAI Foundation, Anthropic, Amazon, Microsoft, IBM, Bank of America ja teised suured tööandjad. Turule on see märk, et automatiseerimisvaidlus liigub prognoosidelt pilootidele: osariigid ja ettevõtted hakkavad kontrollima, millised meetmed aitavad inimestel päriselt tööst mitte välja kukkuda.