Tagasi
17. mai 2026, kell 06:00 AI Open Source Local LLM llama.cpp Qwen Inference GitHub / Reddit r/LocalLLaMA

Kohalikud AI-mudelid said kiirendi: llama.cpp lisas MTP ja tegi Qweni märgatavalt kiiremaks

Kohalikud AI-mudelid said kiirendi: llama.cpp lisas MTP ja tegi Qweni märgatavalt kiiremaks

Kohalikud AI-mudelid said kiirendi: llama.cpp lisas MTP ja tegi Qweni märgatavalt kiiremaks

llama.cpp-sse liideti MTP ehk Multi Token Predictioni tugi. Kohaliku AI maailmast väljaspool võib see kõlada nagu järjekordne GitHubi sügavustest pärit lühend, kuid mõte on üsna maine: mudelid õpivad vastama kiiremini ilma eraldi väikese draft-mudelita, mida varem tuli speculative decoding’u jaoks sageli kõrvale lisada.

Tavaline LLM kirjutab vastust tokeni kaupa: ennustab järgmise tekstijupi, lisab selle konteksti ja liigub edasi. MTP lubab mudelil ette pakkuda mitu järgmist tokenit. Seejärel otsustab põhikontroll, millised neist päriselt sobivad. Kui ennustus on õige, hüppab genereerimine mitmest sammust korraga üle. Kui ei ole, visatakse üleliigne ära ja mudel jätkab tavakiirusel.

Peamine uudis ei ole teoorias, vaid selles, et see jõudis nüüd llama.cpp-sse - ühte tähtsaimasse tööriista open-weight mudelite käitamiseks kohalikes arvutites, tööjaamades ja väikestes serverites. Selle kaudu elavad kodused assistendid, kohalikud vestlusliidesed, eksperimendid koodimudelitega ja ettevõttekomplektid, kus andmeid ei taheta pilve saata.

Mida täpselt lisati

Tugi tuli PR #22673 kaudu. Autor testis mehhanismi Qwen3.6 27B ja Qwen3.6 35B-A3B peal. PR-i kirjelduses on kirjas, et MTP-mudel laaditakse samast GGUF-failist. See on oluline detail: kasutaja ei pea eraldi otsima väikest abimudelit, seda põhimudeliga sünkroonima ja lootma, et kogu kooslus seadistustes laiali ei jookse.

Sisuliselt asub järgmiste tokenite mustandkontuur toetatud mudeli sees või selle kõrval samas failis. Seetõttu paistab MTP massilise kohaliku kasutuse jaoks mugavam kui klassikaline kahe mudeli skeem. Laadid alla õige GGUF-i, lülitad vajalikud parameetrid sisse ja saad võimaluse kiirenduseks ilma liigse inseneriköögita.

See ei ole siiski maagiline turborežiim kõigile vanadele kaaludele. Mudel peab olema treenitud või kokku pandud MTP-peadega. Kui arhitektuuris neid ei ole, ei pane ainuüksi uus llama.cpp seda äkki kaks korda kiiremini kirjutama. Vaja on sobivaid komplekte, õigeid parameetreid ja edasist optimeerimist runtime’is.

Kui palju kiirem

Esimesed numbrid on märgatavad. PR-i benchmark’ides võtsid üheksa testülesannet Qwen3.6-ga ilma MTP-ta umbes 201 sekundit ja kiirus püsis ligikaudu 7 tokeni juures sekundis. MTP ja kuni kolme draft-tokeniga mahtusid samad ülesanded umbes 84 sekundi sisse. Mõnes stsenaariumis tõusis kiirus 16-22 tokenini sekundis.

Autor kirjutab ka, et stabiilses režiimis aktsepteeriti 72-75% ennustatud tokenitest. Just sellest sõltub võit: mida sagedamini mustandtokenid langevad kokku sellega, mida põhimudel on valmis vastu võtma, seda vähem samme tuleb teha järjestikku.

Piirangud on samuti otse välja öeldud. Tulemus sõltub mudelist, riistvarast, vastuse pikkusest, seadistustest ja paralleelsusest. PR märgib eraldi, et prompt’i töötlemine võib MTP-ga aeglustuda embedding’ute seadme ja hosti vahel liigutamise tõttu ning paralleelne dekodeerimine pole veel täielikult optimeeritud. Seega aus sõnastus ei ole „kõigil läks kolm korda kiiremaks“, vaid „sobivate mudelite jaoks tekkis reaalne tee genereerimise kahekordseks kiirendamiseks“.

Miks see oluline on

Kohalikud mudelid kaotavad pilvemudelitele sageli mitte ainult kvaliteedis, vaid ka kiiruse tunnetuses. Kasutaja võib olla valmis privaatsuse, hinna või kontrolli nimel keerukamat paigaldust taluma, kuid aeglane vastus muudab kasuliku tööriista kiiresti entusiastide mänguasjaks.

MTP tabab just seda nõrka kohta. Kui 27B või 35B mudel hakkab kohalikul riistvaral vastama pilvevestlusele lähemal tempol, muutub praktiliste stsenaariumide hulk: koodiassistent tööarvutis, privaatne dokumentide analüüs, kohalik automatsiooniagent, ettevõtte sisemine abiline ilma andmeid välisele pakkujale saatmata.

Eraldi on kõnekas, et testid käivad Qwen3.6 peal. Hiina open-weight mudelid ei paista benchmark’ides enam ammu eksootikana: Qweni, DeepSeeki ja naaberperekondi kasutatakse koodi, analüüsi, tõlke ja kohalike agentide jaoks. Kui MTP just seal hästi kinnistub, ei võida üks repo, vaid märgatav osa kohalikust ökosüsteemist.

Suur AI-võidujooks paistab tavaliselt uute mudelite väljalasetest. Päriselus on sama tähtis inference’i võidujooks: kui palju vastus maksab, kui kaua see aega võtab ja kas kõike saab käitada ilma pilve-API-ta. MTP tugi llama.cpp-s ei ole kohaliku AI lõplik võit, vaid kasulik insenerisamm selle poole, et tugev mudel oma arvutis vastaks mitte „kunagi hiljem“, vaid kohe.

Veel uudiseid

Reddit võrdles AI-hoiatusi filmiga „Ärge vaadake üles“ – ja arutelu väljus meemi raamidest
9. august 2026
Reddit võrdles AI-hoiatusi filmiga „Ärge vaadake üles“ – ja arutelu väljus meemi raamidest

Redditi r/singularity-kogukonnas avaldatud postitus võrdles AI-riskide üle peetud telearutelu stseeniga filmist „Ärge vaadake üles“, kus murettekitav sõnum kaob saateformaati. Meemi taustal on tegelik uudislugu: endine OpenAI teadlane Daniel Kokotajlo selgitab taas, miks peab 2027. aastat AI arengu järsu kiirenemise võimalikuks pöördepunktiks. Oluline pole paanika, vaid lõhe tehnoloogia arengu kiiruse ja ühiskonna suutlikkuse vahel sellest rääkida.

Jeff Dean lahkub Google'ist, et asutada oma idufirma, ja DeepMind eemaldub tipptasemel mudelite võidujooksust: Google valib mudelite asemel pilve
9. august 2026
Jeff Dean lahkub Google'ist, et asutada oma idufirma, ja DeepMind eemaldub tipptasemel mudelite võidujooksust: Google valib mudelite asemel pilve

5. augustil teatas Google DeepMindi ümberkorraldustest: Demis Hassabis taandus operatiivjuhtimisest ning Jeff Dean, üks Google'i insenerikultuuri rajajaid, lahkub koos kolme veteraniga, et asutada Discovery Loop – teaduse ja inseneeria automatiseerimisele keskenduv idufirma. Analüütikud tõlgendavad seda signaalina: Google ei panusta tipptasemel mudelite võidujooksus liidripositsioonile, vaid AI-pilvele ja tehnoloogiate levikule.

Taani kehtestab kodus kirjutatavate eksamitööde suulise kaitsmise, et ei peaks oletama, kas need kirjutas AI
9. august 2026
Taani kehtestab kodus kirjutatavate eksamitööde suulise kaitsmise, et ei peaks oletama, kas need kirjutas AI

Taani käivitab gümnaasiumides kiireloomulised meetmed AI abil petmise vastu. Kodus kirjutatud eksamitöid tuleb nüüd suuliselt kaitsta ning koolid saavad rohkem kontrollivahendeid. Põhiidee on lihtne: kontrollida mitte teksti päritolu, vaid õpilase arusaamist.

Anthropic muudab Claude Code’i autonoomse režiimi vaikeseadeks: AI-agent otsustab ise, mida teha
9. august 2026
Anthropic muudab Claude Code’i autonoomse režiimi vaikeseadeks: AI-agent otsustab ise, mida teha

Alates 14. augustist saab autonoomsest režiimist Claude Code’i vaikeseade Pro, Maxi ja Teami pakettides. Anthropic väidab, et agent tuvastab nüüd ohtlikud tegevused inimesest paremini: 1053 arendajaga testis blokeeris autonoomne režiim 89% pahatahtlikest käskudest, inimesed aga vaid 13,6%. See muudab mängureegleid kõigi jaoks, kes töötavad koodi kallal AI-agentidega.

Meditsiinilised andmed ei tohiks jõuda AI-sse muutmata kujul: OpenClawi oskus Redacta peidab patsiendinimed enne mudelisse saatmist
8. august 2026
Meditsiinilised andmed ei tohiks jõuda AI-sse muutmata kujul: OpenClawi oskus Redacta peidab patsiendinimed enne mudelisse saatmist

Arendaja avaldas Redacta – OpenClawi avatud lähtekoodiga oskuse, mis asendab nimed, kuupäevad ja patsiendinumbrid pseudonüümidega enne teksti jõudmist keelemudelisse. Tööriist töötab lokaalselt, ei edasta isikuandmeid väljapoole ning on ClawHubil kogunud juba 1400 allalaadimist. See on praktiline vastus peamisele hirmule, mis kaasneb AI kasutamisega meditsiinis: kuidas kasutada mudeleid isikuandmeid lekitamata.

37 inimest lahkusid 2026. aastal OpenAI-st ja Anthropicust, et asutada oma AI-idufirmad
8. august 2026
37 inimest lahkusid 2026. aastal OpenAI-st ja Anthropicust, et asutada oma AI-idufirmad

2026. aastal lahkus OpenAI-st ja Anthropicust 37 endist töötajat, et asutada oma AI-ettevõtted. See pole üksikute lahkumiste jada, vaid püsiv laine: kahe tähtsaima labori endised töötajad kujundavad AI-ökosüsteemi järgmist kihti – Thinking Machines Labist Mirendili ja Humans&-ini. Tavalugeja jaoks tähendab see, et konkurents AI-vallas ei piirdu enam kahe hiiglase duelliga.

$400 000 suuruste boonustega kiibitehase töötajad tõrjuvad arste ja juriste kõrvale: AI-kiipide buum kirjutab Lõuna-Korea sotsiaalse hierarhia ümber
8. august 2026
$400 000 suuruste boonustega kiibitehase töötajad tõrjuvad arste ja juriste kõrvale: AI-kiipide buum kirjutab Lõuna-Korea sotsiaalse hierarhia ümber

AI-buum on teinud Samsungi ja SK Hynixi töötajatest Lõuna-Korea uue eliidi: kuni $476 000 suurused boonused ühe töötaja kohta tõstsid nende reitingu abieluagentuurides peaaegu arstide ja juristide tasemele. Kiibitöötajatest said riigi ihaldatuimad pruudid ja peigmehed, samal ajal kui majandusteadlased hoiatavad ühiskonna kasvava kihistumise eest.

Väikeettevõtte omanik nimetas DeepSeek V4 Flashi „super-töötajaks” ja tellis veel paar serverit
8. august 2026
Väikeettevõtte omanik nimetas DeepSeek V4 Flashi „super-töötajaks” ja tellis veel paar serverit

Väikeettevõtte omanik rääkis r/LocalLLaMAs, et uuendatud DeepSeek V4 Flash 0731 võtab enda kanda kodeerimise, dokumendid ja klienditoe ning ta tellis veel paar DGX Spark serverit. See on üks ilmekamaid näiteid sellest, kuidas odav lokaalne mudel muutub väikeettevõtte täisväärtuslikuks töötajaks.

Nvidia investeerib kuni $3 miljardit Lanciumisse – ettevõttesse, mis rajab Texases Stargate’i AI-kampuse energiataristut
8. august 2026
Nvidia investeerib kuni $3 miljardit Lanciumisse – ettevõttesse, mis rajab Texases Stargate’i AI-kampuse energiataristut

Nvidia investeerib kuni $3 miljardit Lanciumisse – Texases asuva Stargate’i AI-kampuse taga seisvasse energiataristu arendajasse. Esimesed $2 miljardit annavad kiibitootjale ettevõttes umbes 20% osaluse, veel $1 miljard lisandub tingimuste täitmisel, näiteks elektrivõrguga ühendamise edenemise korral. Nii siseneb Nvidia esimest korda otse energiataristusse, mis varustab elektriga ka tema enda AI-andmekeskusi.

Musk muudab SpaceX-i AI-taristuks: 10 GW arvutusvõimsust ja kuni $300 miljardi suurune käive 2027. aastaks
8. august 2026
Musk muudab SpaceX-i AI-taristuks: 10 GW arvutusvõimsust ja kuni $300 miljardi suurune käive 2027. aastaks

SemiAnalysise analüütikud kirjutavad, et SpaceX võib 2027. aasta lõpuks rajada umbes 10 GW AI-arvutusvõimsust, mille potentsiaalne käive ulatuks kuni $300 miljardini. Esimesel IPO-järgsel tulemuskõnel teatas Muski ettevõte, et rajab tulevased võimsused eranditult Nvidia Vera Rubini kiipidele, ning praeguse arvutuspargi maht on juba 1,4 GW.

AI tegi Maci ja iPadi kallimaks: mälupuudus jõudis Apple'ini
25. juuni 2026
AI tegi Maci ja iPadi kallimaks: mälupuudus jõudis Apple'ini

Apple tõstis Macide, iPadide ja osa koduseadmete hindu, põhjendades seda mälu ja andmekandjate hinna järsu tõusuga AI-andmekeskuste tõttu. WSJ ja Bloombergi andmetel kallines MacBook Neo 599 dollarilt 699 dollarile ning osa Maci ja iPadi mudeleid lisas hinnale sadu dollareid. Ostjate jaoks on see hetk, kus AI-buum ei ole enam ainult pilvede ja GPU-de lugu: see mõjutab juba tavalise elektroonika hinda.

OpenAI ja Anthropic panustasid plaani päästa töökohad AI eest
25. juuni 2026
OpenAI ja Anthropic panustasid plaani päästa töökohad AI eest

USAs käivitati RAISE US: parteideülene organisatsioon, millel on üle 500 miljoni dollari töötajate ettevalmistamiseks AI-majanduseks. Partnerite seas on OpenAI Foundation, Anthropic, Amazon, Microsoft, IBM, Bank of America ja teised suured tööandjad. Turule on see märk, et automatiseerimisvaidlus liigub prognoosidelt pilootidele: osariigid ja ettevõtted hakkavad kontrollima, millised meetmed aitavad inimestel päriselt tööst mitte välja kukkuda.