Tagasi
2. mai 2026, kell 06:55 DeepSeek AI Models Benchmarks Open Source AI Agents Safety NIST / CAISI

USA standardiinstituut: Hiina AI-mudelid jäävad ChatGPT-st ja Claude’ist umbes kaheksa kuud maha ning vahe kasvab

USA standardiinstituut: Hiina AI-mudelid jäävad ChatGPT-st ja Claude’ist umbes kaheksa kuud maha ning vahe kasvab

USA standardiinstituut: Hiina AI-mudelid jäävad ChatGPT-st ja Claude’ist umbes kaheksa kuud maha ning vahe kasvab

USA riikliku standardi- ja tehnoloogiainstituudi NIST juures tegutsev AI Safety Institute’i järglane CAISI avaldas hinnangu DeepSeek V4 Pro mudelile ning jõudis Hiina jaoks ebamugava järelduseni: nende mõõtmistes on see küll tugevaim Hiina mudel, kuid üldvõimekuselt jääb see USA eesliinist umbes kaheksa kuud maha. CAISI võrdluses paistab DeepSeek V4 Pro olevat lähemal GPT-5-le kui uuematele OpenAI GPT-5.5 ja Anthropic Opus 4.6 mudelitele.

See ei tühista DeepSeeki edu. Pigem näitab see kahte eri tõde korraga: suletud riiklikes ja agentsetes testides jääb Hiina eesliin endiselt maha, samal ajal kui avatud kaaludega mudelite seas on DeepSeek taas üks peamisi tegijaid.

Mida CAISI täpselt testis

CAISI hindas DeepSeek V4 Prot viies valdkonnas: küberturvalisus, tarkvarainseneeria, loodusteadused, abstraktne arutlus ja matemaatika. Osa teste oli avalik, osa suletud või poolsuletud, sealhulgas ARC-AGI-2 semi-private ning sisemine PortBench, mis mõõdab konsoolitööriistade ülekandmist programmeerimiskeelte vahel.

Tavalistel benchmark’idel on pilt segane. Matemaatikas jääb DeepSeek V4 Pro napilt alla: 97% OTIS-AIME-2025 testis, 96% PUMaC 2024-s ja 96% SMT 2025-s. GPQA-Diamondis sai mudel 90%, mis asetab selle Opus 4.6 ja GPT-5.4 mini lähedale.

Ent agentsemates ja suletumates testides tuleb vahe selgemalt välja. CTF-Archive-Diamondis sai DeepSeek V4 Pro 32% GPT-5.5 71% vastu. PortBenchis oli tulemus 44% võrreldes GPT-5.5 78% ja Opus 4.6 60%-ga. ARC-AGI-2 semi-private testis oli DeepSeekil 46%, GPT-5.5-l 79% ja Opus 4.6-l 63%. CAISI koondatud IRT-hinnang oli DeepSeek V4 Pro puhul 800±28, Opus 4.6-l 999±27 ja GPT-5.5-l 1260±28.

Miks see järeldus erineb DeepSeeki enda raportist

DeepSeeki enda andmetel paistab V4 Pro olevat ligikaudu Opus 4.6 ja GPT-5.4 tasemel ehk mudelitega, mis tulid välja umbes kaks kuud tagasi. CAISI väidab aga, et ettevalitud kontrollide komplektis, kuhu kuulusid ka mitteavalikud testid, on mudel lähemal GPT-5-le, mille väljalaskest on möödas umbes kaheksa kuud.

See vahe on oluline. Avalikud benchmark’id näitavad üha sagedamini mitte ainult mudeli tugevust, vaid ka seda, kui hästi laborid on õppinud tuntud skaalade järgi optimeerima. CAISI rõhutab eraldi, et teste ei valitud tagantjärele tulemuste põhjal, vaid kasutati eelnevalt määratud komplekti.

Just seetõttu on NIST-i graafik tähtsam kui üks võitude ja kaotuste tabel. Koondregressioonis jooksevad USA avalikult välja toodud mudelid Hiina omadest kõrgemal ning Hiina eesliini trendijoon ei jõua veel järele. Kui seda lugeda kui võidujooksu kaarti, liigub DeepSeek kiiresti, kuid liidrid kiirendavad samuti.

Teine vaade: avatud kaaludega mudelite tipus on DeepSeek taas eesotsas

Artificial Analysis annab DeepSeek V4 Prole märksa soodsama hinnangu. Nende Intelligence Indexis sai mudel 52 punkti — kümme rohkem kui DeepSeek V3.2 — ning tõusis avatud kaaludega arutlusmudelite seas teisele kohale, jäädes alla vaid Kimi K2.6-le. V4 Flash kogus 47 punkti ja näib oma mõõtme kohta samuti tugev.

Veel olulisem on agentne kiht. Artificial Analysise GDPval-AA testis, mis mõõdab reaalseid töövoopõhiseid agentülesandeid, sai DeepSeek V4 Pro tulemuseks 1554 ning edestas Kimi K2.6, GLM-5.1, GLM-5 ja MiniMax-M2.7 mudeleid. Tiimidele, kellel pole vaja maailma absoluutset parimat mudelit, vaid tugevat avatud töömootorit, on see kaalukas argument.

Sellel liidripositsioonil on siiski oma hind. Artificial Analysis märgib väga kõrget hallutsinatsioonitaset: V4 Prol 94% ja V4 Flashil 96% olukordades, kus mudel tegelikult vastust ei tea. Lisaks kulutas V4 Pro Intelligence Indexi läbimiseks 190 miljonit väljundtokenit ja V4 Flash 240 miljonit. Madal hind tokeni kohta aitab, kuid ei muuda olematuks tõsiasja, et pikkades arutlusahelates võib mudel väljundmahu tõttu kalliks osutuda.

Mida see turule tähendab

Neuro.ee varasem artikkel DeepSeek V4 Pro API-käivituse kohta rääkis hinnasurvest ja soovist saada AI-integratsioonide mugavaks kihiks. NIST-i uus hinnang lisab sellele loole piirangu: odav ja ühilduv API ei tähenda automaatselt võrdsust parimate suletud mudelitega, eriti agentsetes, küberturbe- ja inseneriülesannetes.

Ettevõtete jaoks on järeldus praktiline. DeepSeek V4 Pro võib olla tugev valik seal, kus olulised on hind, avatud kaalud, mitme pakkuja juures juurutamine ja hea agentne sooritus avatud mudelite seas. Kuid ülesannetes, kus vea hind on kõrge — turve, teaduslikud järeldused, juriidilised või meditsiinilised protsessid, autonoomsed koodimuudatused — ei saa kõrget hallutsinatsioonitaset ja mahajäämust suletud testides pidada väikeseks puuduseks.

Neuro.ee toimetuse hinnang: DeepSeek on endiselt üks olulisemaid mängijaid mudelivõidujooksus, kuid NIST näitab üsna hästi, kus jookseb piir „odava tugeva alternatiivi“ ja „päris eesliini“ vahel. Suurim intriig ei ole enam selles, kas Hiina suudab teha muljetavaldavaid mudeleid. Suudab küll. Küsimus on selles, kas avatud Hiina tehisintellektipakk suudab tippmudeleid püüda kiiremini, kui OpenAI ja Anthropic latti taas kaugemale nihutavad.

Veel uudiseid

Reddit võrdles AI-hoiatusi filmiga „Ärge vaadake üles“ – ja arutelu väljus meemi raamidest
9. august 2026
Reddit võrdles AI-hoiatusi filmiga „Ärge vaadake üles“ – ja arutelu väljus meemi raamidest

Redditi r/singularity-kogukonnas avaldatud postitus võrdles AI-riskide üle peetud telearutelu stseeniga filmist „Ärge vaadake üles“, kus murettekitav sõnum kaob saateformaati. Meemi taustal on tegelik uudislugu: endine OpenAI teadlane Daniel Kokotajlo selgitab taas, miks peab 2027. aastat AI arengu järsu kiirenemise võimalikuks pöördepunktiks. Oluline pole paanika, vaid lõhe tehnoloogia arengu kiiruse ja ühiskonna suutlikkuse vahel sellest rääkida.

Jeff Dean lahkub Google'ist, et asutada oma idufirma, ja DeepMind eemaldub tipptasemel mudelite võidujooksust: Google valib mudelite asemel pilve
9. august 2026
Jeff Dean lahkub Google'ist, et asutada oma idufirma, ja DeepMind eemaldub tipptasemel mudelite võidujooksust: Google valib mudelite asemel pilve

5. augustil teatas Google DeepMindi ümberkorraldustest: Demis Hassabis taandus operatiivjuhtimisest ning Jeff Dean, üks Google'i insenerikultuuri rajajaid, lahkub koos kolme veteraniga, et asutada Discovery Loop – teaduse ja inseneeria automatiseerimisele keskenduv idufirma. Analüütikud tõlgendavad seda signaalina: Google ei panusta tipptasemel mudelite võidujooksus liidripositsioonile, vaid AI-pilvele ja tehnoloogiate levikule.

Taani kehtestab kodus kirjutatavate eksamitööde suulise kaitsmise, et ei peaks oletama, kas need kirjutas AI
9. august 2026
Taani kehtestab kodus kirjutatavate eksamitööde suulise kaitsmise, et ei peaks oletama, kas need kirjutas AI

Taani käivitab gümnaasiumides kiireloomulised meetmed AI abil petmise vastu. Kodus kirjutatud eksamitöid tuleb nüüd suuliselt kaitsta ning koolid saavad rohkem kontrollivahendeid. Põhiidee on lihtne: kontrollida mitte teksti päritolu, vaid õpilase arusaamist.

Anthropic muudab Claude Code’i autonoomse režiimi vaikeseadeks: AI-agent otsustab ise, mida teha
9. august 2026
Anthropic muudab Claude Code’i autonoomse režiimi vaikeseadeks: AI-agent otsustab ise, mida teha

Alates 14. augustist saab autonoomsest režiimist Claude Code’i vaikeseade Pro, Maxi ja Teami pakettides. Anthropic väidab, et agent tuvastab nüüd ohtlikud tegevused inimesest paremini: 1053 arendajaga testis blokeeris autonoomne režiim 89% pahatahtlikest käskudest, inimesed aga vaid 13,6%. See muudab mängureegleid kõigi jaoks, kes töötavad koodi kallal AI-agentidega.

Meditsiinilised andmed ei tohiks jõuda AI-sse muutmata kujul: OpenClawi oskus Redacta peidab patsiendinimed enne mudelisse saatmist
8. august 2026
Meditsiinilised andmed ei tohiks jõuda AI-sse muutmata kujul: OpenClawi oskus Redacta peidab patsiendinimed enne mudelisse saatmist

Arendaja avaldas Redacta – OpenClawi avatud lähtekoodiga oskuse, mis asendab nimed, kuupäevad ja patsiendinumbrid pseudonüümidega enne teksti jõudmist keelemudelisse. Tööriist töötab lokaalselt, ei edasta isikuandmeid väljapoole ning on ClawHubil kogunud juba 1400 allalaadimist. See on praktiline vastus peamisele hirmule, mis kaasneb AI kasutamisega meditsiinis: kuidas kasutada mudeleid isikuandmeid lekitamata.

37 inimest lahkusid 2026. aastal OpenAI-st ja Anthropicust, et asutada oma AI-idufirmad
8. august 2026
37 inimest lahkusid 2026. aastal OpenAI-st ja Anthropicust, et asutada oma AI-idufirmad

2026. aastal lahkus OpenAI-st ja Anthropicust 37 endist töötajat, et asutada oma AI-ettevõtted. See pole üksikute lahkumiste jada, vaid püsiv laine: kahe tähtsaima labori endised töötajad kujundavad AI-ökosüsteemi järgmist kihti – Thinking Machines Labist Mirendili ja Humans&-ini. Tavalugeja jaoks tähendab see, et konkurents AI-vallas ei piirdu enam kahe hiiglase duelliga.

$400 000 suuruste boonustega kiibitehase töötajad tõrjuvad arste ja juriste kõrvale: AI-kiipide buum kirjutab Lõuna-Korea sotsiaalse hierarhia ümber
8. august 2026
$400 000 suuruste boonustega kiibitehase töötajad tõrjuvad arste ja juriste kõrvale: AI-kiipide buum kirjutab Lõuna-Korea sotsiaalse hierarhia ümber

AI-buum on teinud Samsungi ja SK Hynixi töötajatest Lõuna-Korea uue eliidi: kuni $476 000 suurused boonused ühe töötaja kohta tõstsid nende reitingu abieluagentuurides peaaegu arstide ja juristide tasemele. Kiibitöötajatest said riigi ihaldatuimad pruudid ja peigmehed, samal ajal kui majandusteadlased hoiatavad ühiskonna kasvava kihistumise eest.

Väikeettevõtte omanik nimetas DeepSeek V4 Flashi „super-töötajaks” ja tellis veel paar serverit
8. august 2026
Väikeettevõtte omanik nimetas DeepSeek V4 Flashi „super-töötajaks” ja tellis veel paar serverit

Väikeettevõtte omanik rääkis r/LocalLLaMAs, et uuendatud DeepSeek V4 Flash 0731 võtab enda kanda kodeerimise, dokumendid ja klienditoe ning ta tellis veel paar DGX Spark serverit. See on üks ilmekamaid näiteid sellest, kuidas odav lokaalne mudel muutub väikeettevõtte täisväärtuslikuks töötajaks.

Nvidia investeerib kuni $3 miljardit Lanciumisse – ettevõttesse, mis rajab Texases Stargate’i AI-kampuse energiataristut
8. august 2026
Nvidia investeerib kuni $3 miljardit Lanciumisse – ettevõttesse, mis rajab Texases Stargate’i AI-kampuse energiataristut

Nvidia investeerib kuni $3 miljardit Lanciumisse – Texases asuva Stargate’i AI-kampuse taga seisvasse energiataristu arendajasse. Esimesed $2 miljardit annavad kiibitootjale ettevõttes umbes 20% osaluse, veel $1 miljard lisandub tingimuste täitmisel, näiteks elektrivõrguga ühendamise edenemise korral. Nii siseneb Nvidia esimest korda otse energiataristusse, mis varustab elektriga ka tema enda AI-andmekeskusi.

Musk muudab SpaceX-i AI-taristuks: 10 GW arvutusvõimsust ja kuni $300 miljardi suurune käive 2027. aastaks
8. august 2026
Musk muudab SpaceX-i AI-taristuks: 10 GW arvutusvõimsust ja kuni $300 miljardi suurune käive 2027. aastaks

SemiAnalysise analüütikud kirjutavad, et SpaceX võib 2027. aasta lõpuks rajada umbes 10 GW AI-arvutusvõimsust, mille potentsiaalne käive ulatuks kuni $300 miljardini. Esimesel IPO-järgsel tulemuskõnel teatas Muski ettevõte, et rajab tulevased võimsused eranditult Nvidia Vera Rubini kiipidele, ning praeguse arvutuspargi maht on juba 1,4 GW.

AI tegi Maci ja iPadi kallimaks: mälupuudus jõudis Apple'ini
25. juuni 2026
AI tegi Maci ja iPadi kallimaks: mälupuudus jõudis Apple'ini

Apple tõstis Macide, iPadide ja osa koduseadmete hindu, põhjendades seda mälu ja andmekandjate hinna järsu tõusuga AI-andmekeskuste tõttu. WSJ ja Bloombergi andmetel kallines MacBook Neo 599 dollarilt 699 dollarile ning osa Maci ja iPadi mudeleid lisas hinnale sadu dollareid. Ostjate jaoks on see hetk, kus AI-buum ei ole enam ainult pilvede ja GPU-de lugu: see mõjutab juba tavalise elektroonika hinda.

OpenAI ja Anthropic panustasid plaani päästa töökohad AI eest
25. juuni 2026
OpenAI ja Anthropic panustasid plaani päästa töökohad AI eest

USAs käivitati RAISE US: parteideülene organisatsioon, millel on üle 500 miljoni dollari töötajate ettevalmistamiseks AI-majanduseks. Partnerite seas on OpenAI Foundation, Anthropic, Amazon, Microsoft, IBM, Bank of America ja teised suured tööandjad. Turule on see märk, et automatiseerimisvaidlus liigub prognoosidelt pilootidele: osariigid ja ettevõtted hakkavad kontrollima, millised meetmed aitavad inimestel päriselt tööst mitte välja kukkuda.