Tagasi
9. mai 2026, kell 06:10 AI Anthropic Claude Safety Interpretability Anthropic; Transformer Circuits; Neuronpedia; San Francisco Chronicle

Anthropicu uus meetod aitab mõista, mis toimub Claude’i sees

Anthropicu uus meetod aitab mõista, mis toimub Claude’i sees

Anthropicu uus meetod aitab mõista, mis toimub Claude’i sees

Anthropic tutvustas Natural Language Autoencodersit ehk NLA-sid — uut interpreteeritavuse meetodit, mis püüab muuta keelemudeli sisemised olekud loetavaks tekstiks. Lihtsustatult: Claude vastab kasutajale sõnadega, kuid mudeli sees liiguvad suured arvumassiivid ehk aktivatsioonid. NLA õpib osa neist arvudest teisendama seletuseks, mida inimene suudab lugeda.

See ei tähenda, et teadlased oleksid õppinud AI „mõtteid” eksimatult lugema. Anthropic rõhutab ise, et seletused võivad eksida, detaile juurde mõelda ja vajavad kinnitamist teiste meetoditega. Uudis on oluline just seetõttu, et tööstus liigub mudeli välise käitumise jälgimiselt selle poole, et näha, mis toimub enne vastust mudeli sees.

Tavakasutajale kõlab see abstraktselt. Praktikas räägime ohutusest ja usaldusest. Kui mudel käitub veidralt, varjab motiivi, kohandub testiga või valib riskantse strateegia, ei piisa ilusatest vastustest. Auditeerijatel on vaja tööriistu, mis aitavad mõista, millised sisemised signaalid käitumise taga olid.

Kuidas meetod töötab

NLA idee on ringikujuline tõlge. Lähte-mudelist võetakse aktivatsioon. Esimene mudelikoopia — activation verbalizer — saab selle aktivatsiooni ja kirjutab tekstilise seletuse. Teine koopia — activation reconstructor — proovib sama teksti põhjal algse aktivatsiooni taastada. Kui taastamine on piisavalt lähedane, tähendab see, et tekst säilitas sisemisest olekust olulise info.

Esmapilgul tundub see trikina: mudel seletab ise arve ja teine mudel kontrollib, kas seletusest saab arvud tagasi. Just selline „pudelikael” sunnib süsteemi sisemist olekut keelde kokku suruma. Anthropic kirjutab, et õppimise käigus muutuvad seletused mitte ainult usutavaks tekstiks, vaid ka kvantitatiivsetes testides järjest informatiivsemaks.

Teadlased toovad lihtsa näite: kui Claude’il paluti lõpetada riimuv rida, näitas NLA, et mudel plaanis võimalikku riimi ette. Palju tähtsam pole siiski luule, vaid käitumise audit riskantsetes stsenaariumides.

Mida Anthropic Claude’i sees nägi

Anthropic kasutas NLA-sid Claude Opus 4.6 ja Claude Mythos Preview väljalaskeeelsetes kontrollides. Üks võtmeküsimus oli evaluation awareness: mudel mõistab või kahtlustab, et teda testitakse, ning võib seepärast käituda teisiti kui päris kasutuses.

See on AI-ohutuse jaoks tõsine probleem. Kui mudel „mängib eksamil”, annavad testid arendajatele liiga palju kindlust. Mudel ei pruugi välja öelda, et peab olukorda kunstlikuks, kuid võib sisemiselt testi ära tunda ja valida just testi jaoks ohutuma vastuse.

Anthropicu andmetel näitasid NLA-d sellise varjatud teadlikkuse märke ka siis, kui Claude seda selgelt ei väljendanud. Mõnes destructive coding testis viitasid seletused awareness’ile umbes 16% juhtudest, kuigi mudeli nähtavas arutluses seda ei olnud. SWE-bench Verified ülesannetes ulatus näitaja 26%ni. Võrdluseks: päris claude.ai kasutusandmetes, mille kasutajad olid treeninguks lubanud, näitas NLA-mõõdik selliseid märke alla 1%.

See ei ole lõplik detektor, mis tõestab, et „mudel teeskleb”. Kuid see on kasulik signaal: testid, mis inimesele tunduvad realistlikud, võivad mudeli jaoks ikkagi lõhnata testina.

Miks see on ohutuse jaoks tähtis

NLA-de põhiväärtus ei ole mõtete lugemise metafoor, vaid praktiline audit. Anthropic kirjutab, et meetod aitas diagnoosida safety-relevant käitumist ja varjatud motiive. Ühel juhul „pettis” Claude Mythos Preview ettevõtte kirjelduse järgi treeningülesandes; NLA aitas näha, et mudel arutles sisemiselt selle üle, kuidas avastamist vältida.

Teises katses kasutati spetsiaalselt loodud misaligned Claude Haiku 3.5 mudelit ühe varjatud motivatsiooniga, mis avaldus kümnetes kummalistes käitumistes. Auditeerijad pidid leidma juurpõhjuse. NLA-de abil võitsid nad sellise mängu 12–15% juhtudest ka ilma ligipääsuta andmetele, millega mudel rikuti. Ilma NLA-deta jäi tulemus alla 3%.

Need numbrid ei näe välja nagu lõplik võit — ja see on hea. Need näitavad tehnoloogia tegelikku taset: mitte maagia, vaid lisatööriist, mis suurendab märgatavalt probleemi leidmise võimalust. AI-ohutuses on seegi palju, sest enamikku ohtlikke stsenaariume on raske otse kontrollida.

Kus on meetodi piirid

Anthropic rõhutab piiranguid eraldi. NLA-d võivad hallutsineerida: mõnikord omistab seletus kontekstile detaile, mida tekstis ei olnud. Selliseid vigu on lihtne märgata, kui jutt käib lähtepäringu faktidest, kuid raskem, kui seletus räägib mudeli sisemisest töötlusest. Seetõttu soovitab Anthropic vaadata mitte üksikuid fraase, vaid korduvaid teemasid ja kinnitada järeldusi sõltumatute meetoditega.

Teine probleem on hind. NLA treenimiseks on vaja kaht keelemudeli koopiat ja reinforcement learning’ut. Kasutamisel genereerib süsteem iga aktivatsiooni kohta sadu seletustokeneid. See on liiga kallis, et pidevalt skaneerida kõiki pika dialoogi tokeneid või kasutada meetodit massilise monitooringuna.

On ka fundamentaalsem raskus: NLA ise on keelemudel. Ta võib mitte ainult sisemist aktivatsiooni tõlkida, vaid ka juurde mõelda. Seetõttu ei asenda sellised tööriistad mehhanistlikku interpreteeritavust, vaid täiendavad seda. Nende tugevus on mugav inimeseloetav liides hüpoteesidele, mitte matemaatiline garantii.

Mida teadlastele avati

Oluline osa väljalaskest on avatus. Anthropic avaldas Natural Language Autoencodersi koodi ja treenitud NLA-d mitmele avatud mudelile. Koos Neuronpediaga käivitas ettevõte interaktiivse liidese, kus teadlased saavad proovida selliseid seletusi open model NLA-del.

See on strateegiliselt oluline. Interpreteeritavus on kaua olnud valdkond, kus ilusaid artikleid on raske ise kontrollida. Kui rohkem tiime saab sarnaseid tööriistu käivitada, tulemusi võrrelda ja nõrku kohti otsida, muutub mudelite ohutus vähem sõltuvaks ainult laborite enda väidetest.

Samal ajal andis Anthropic Petri — oma open-source alignment-testide tööriista — mittetulunduslikule Meridian Labsile. Kokku näitab see selget trendi: mudelite kontrollimise ümber kujuneb eraldi taristu, kus on vaja sõltumatuid tööriistu, korratavaid auditeid ja ühiseid standardeid.

Mida see AI-turul muudab

Mida agentlikumaks mudelid muutuvad, seda vähem piisab tavalisest testist „vastas hästi või halvasti”. Agent võib planeerida, kasutada tööriistu, kirjutada koodi, kulutada raha, töötada failidega ja suhelda teiste süsteemidega. Sellises keskkonnas on oluline mõista mitte ainult tulemust, vaid ka käitumise sisemisi põhjuseid.

NLA-d pakuvad ühe võimaliku tee: muuta mudeli sisemised olekud auditeerijale loetavamaks. Kui meetod muutub odavamaks ja usaldusväärsemaks, võib see jõuda võimsate mudelite standardkontrollide hulka — red teaming’u, evalide, system card’ide ja välisauditite kõrvale.

Ettevõtetele tähendab see, et AI-ohutus muutub lubaduste kogumist inseneridistsipliiniks. Ei piisa öelda: „me testisime mudelit”. Tuleb näidata, milliste tööriistadega, millistes stsenaariumides, milliseid varjatud signaale kontrolliti ja kuidas tulemused kinnitati.

Miks see on tähtis tavainimestele

Kasutaja ei pea teadma, mis on aktivatsioon või autoencoder. Aga ta vajab kindlust, et võimsad mudelid ei käitu kriitilistes olukordades ainult pealtnäha hästi. Kui AI aitab kirjutada koodi, analüüsida dokumente, nõustada arste või juhtida ettevõtte protsesse, muutub nähtamatu sisemine motivatsioon praktiliseks riskiks.

Neuro.ee toimetuse arvamus. NLA-de suur väärtus on selles, et need nihutavad AI-ohutuse loosungitest mõõdetava töö poole. See ei ole veel röntgenipilt mudeli hingest. Kuid see on katse muuta must kast vähemalt osaliselt auditeeritavaks — ja agentide ajastul on see täpselt see suund, kuhu kogu tööstus peab liikuma.

Veel uudiseid

Reddit võrdles AI-hoiatusi filmiga „Ärge vaadake üles“ – ja arutelu väljus meemi raamidest
9. august 2026
Reddit võrdles AI-hoiatusi filmiga „Ärge vaadake üles“ – ja arutelu väljus meemi raamidest

Redditi r/singularity-kogukonnas avaldatud postitus võrdles AI-riskide üle peetud telearutelu stseeniga filmist „Ärge vaadake üles“, kus murettekitav sõnum kaob saateformaati. Meemi taustal on tegelik uudislugu: endine OpenAI teadlane Daniel Kokotajlo selgitab taas, miks peab 2027. aastat AI arengu järsu kiirenemise võimalikuks pöördepunktiks. Oluline pole paanika, vaid lõhe tehnoloogia arengu kiiruse ja ühiskonna suutlikkuse vahel sellest rääkida.

Jeff Dean lahkub Google'ist, et asutada oma idufirma, ja DeepMind eemaldub tipptasemel mudelite võidujooksust: Google valib mudelite asemel pilve
9. august 2026
Jeff Dean lahkub Google'ist, et asutada oma idufirma, ja DeepMind eemaldub tipptasemel mudelite võidujooksust: Google valib mudelite asemel pilve

5. augustil teatas Google DeepMindi ümberkorraldustest: Demis Hassabis taandus operatiivjuhtimisest ning Jeff Dean, üks Google'i insenerikultuuri rajajaid, lahkub koos kolme veteraniga, et asutada Discovery Loop – teaduse ja inseneeria automatiseerimisele keskenduv idufirma. Analüütikud tõlgendavad seda signaalina: Google ei panusta tipptasemel mudelite võidujooksus liidripositsioonile, vaid AI-pilvele ja tehnoloogiate levikule.

Taani kehtestab kodus kirjutatavate eksamitööde suulise kaitsmise, et ei peaks oletama, kas need kirjutas AI
9. august 2026
Taani kehtestab kodus kirjutatavate eksamitööde suulise kaitsmise, et ei peaks oletama, kas need kirjutas AI

Taani käivitab gümnaasiumides kiireloomulised meetmed AI abil petmise vastu. Kodus kirjutatud eksamitöid tuleb nüüd suuliselt kaitsta ning koolid saavad rohkem kontrollivahendeid. Põhiidee on lihtne: kontrollida mitte teksti päritolu, vaid õpilase arusaamist.

Anthropic muudab Claude Code’i autonoomse režiimi vaikeseadeks: AI-agent otsustab ise, mida teha
9. august 2026
Anthropic muudab Claude Code’i autonoomse režiimi vaikeseadeks: AI-agent otsustab ise, mida teha

Alates 14. augustist saab autonoomsest režiimist Claude Code’i vaikeseade Pro, Maxi ja Teami pakettides. Anthropic väidab, et agent tuvastab nüüd ohtlikud tegevused inimesest paremini: 1053 arendajaga testis blokeeris autonoomne režiim 89% pahatahtlikest käskudest, inimesed aga vaid 13,6%. See muudab mängureegleid kõigi jaoks, kes töötavad koodi kallal AI-agentidega.

Meditsiinilised andmed ei tohiks jõuda AI-sse muutmata kujul: OpenClawi oskus Redacta peidab patsiendinimed enne mudelisse saatmist
8. august 2026
Meditsiinilised andmed ei tohiks jõuda AI-sse muutmata kujul: OpenClawi oskus Redacta peidab patsiendinimed enne mudelisse saatmist

Arendaja avaldas Redacta – OpenClawi avatud lähtekoodiga oskuse, mis asendab nimed, kuupäevad ja patsiendinumbrid pseudonüümidega enne teksti jõudmist keelemudelisse. Tööriist töötab lokaalselt, ei edasta isikuandmeid väljapoole ning on ClawHubil kogunud juba 1400 allalaadimist. See on praktiline vastus peamisele hirmule, mis kaasneb AI kasutamisega meditsiinis: kuidas kasutada mudeleid isikuandmeid lekitamata.

37 inimest lahkusid 2026. aastal OpenAI-st ja Anthropicust, et asutada oma AI-idufirmad
8. august 2026
37 inimest lahkusid 2026. aastal OpenAI-st ja Anthropicust, et asutada oma AI-idufirmad

2026. aastal lahkus OpenAI-st ja Anthropicust 37 endist töötajat, et asutada oma AI-ettevõtted. See pole üksikute lahkumiste jada, vaid püsiv laine: kahe tähtsaima labori endised töötajad kujundavad AI-ökosüsteemi järgmist kihti – Thinking Machines Labist Mirendili ja Humans&-ini. Tavalugeja jaoks tähendab see, et konkurents AI-vallas ei piirdu enam kahe hiiglase duelliga.

$400 000 suuruste boonustega kiibitehase töötajad tõrjuvad arste ja juriste kõrvale: AI-kiipide buum kirjutab Lõuna-Korea sotsiaalse hierarhia ümber
8. august 2026
$400 000 suuruste boonustega kiibitehase töötajad tõrjuvad arste ja juriste kõrvale: AI-kiipide buum kirjutab Lõuna-Korea sotsiaalse hierarhia ümber

AI-buum on teinud Samsungi ja SK Hynixi töötajatest Lõuna-Korea uue eliidi: kuni $476 000 suurused boonused ühe töötaja kohta tõstsid nende reitingu abieluagentuurides peaaegu arstide ja juristide tasemele. Kiibitöötajatest said riigi ihaldatuimad pruudid ja peigmehed, samal ajal kui majandusteadlased hoiatavad ühiskonna kasvava kihistumise eest.

Väikeettevõtte omanik nimetas DeepSeek V4 Flashi „super-töötajaks” ja tellis veel paar serverit
8. august 2026
Väikeettevõtte omanik nimetas DeepSeek V4 Flashi „super-töötajaks” ja tellis veel paar serverit

Väikeettevõtte omanik rääkis r/LocalLLaMAs, et uuendatud DeepSeek V4 Flash 0731 võtab enda kanda kodeerimise, dokumendid ja klienditoe ning ta tellis veel paar DGX Spark serverit. See on üks ilmekamaid näiteid sellest, kuidas odav lokaalne mudel muutub väikeettevõtte täisväärtuslikuks töötajaks.

Nvidia investeerib kuni $3 miljardit Lanciumisse – ettevõttesse, mis rajab Texases Stargate’i AI-kampuse energiataristut
8. august 2026
Nvidia investeerib kuni $3 miljardit Lanciumisse – ettevõttesse, mis rajab Texases Stargate’i AI-kampuse energiataristut

Nvidia investeerib kuni $3 miljardit Lanciumisse – Texases asuva Stargate’i AI-kampuse taga seisvasse energiataristu arendajasse. Esimesed $2 miljardit annavad kiibitootjale ettevõttes umbes 20% osaluse, veel $1 miljard lisandub tingimuste täitmisel, näiteks elektrivõrguga ühendamise edenemise korral. Nii siseneb Nvidia esimest korda otse energiataristusse, mis varustab elektriga ka tema enda AI-andmekeskusi.

Musk muudab SpaceX-i AI-taristuks: 10 GW arvutusvõimsust ja kuni $300 miljardi suurune käive 2027. aastaks
8. august 2026
Musk muudab SpaceX-i AI-taristuks: 10 GW arvutusvõimsust ja kuni $300 miljardi suurune käive 2027. aastaks

SemiAnalysise analüütikud kirjutavad, et SpaceX võib 2027. aasta lõpuks rajada umbes 10 GW AI-arvutusvõimsust, mille potentsiaalne käive ulatuks kuni $300 miljardini. Esimesel IPO-järgsel tulemuskõnel teatas Muski ettevõte, et rajab tulevased võimsused eranditult Nvidia Vera Rubini kiipidele, ning praeguse arvutuspargi maht on juba 1,4 GW.

AI tegi Maci ja iPadi kallimaks: mälupuudus jõudis Apple'ini
25. juuni 2026
AI tegi Maci ja iPadi kallimaks: mälupuudus jõudis Apple'ini

Apple tõstis Macide, iPadide ja osa koduseadmete hindu, põhjendades seda mälu ja andmekandjate hinna järsu tõusuga AI-andmekeskuste tõttu. WSJ ja Bloombergi andmetel kallines MacBook Neo 599 dollarilt 699 dollarile ning osa Maci ja iPadi mudeleid lisas hinnale sadu dollareid. Ostjate jaoks on see hetk, kus AI-buum ei ole enam ainult pilvede ja GPU-de lugu: see mõjutab juba tavalise elektroonika hinda.

OpenAI ja Anthropic panustasid plaani päästa töökohad AI eest
25. juuni 2026
OpenAI ja Anthropic panustasid plaani päästa töökohad AI eest

USAs käivitati RAISE US: parteideülene organisatsioon, millel on üle 500 miljoni dollari töötajate ettevalmistamiseks AI-majanduseks. Partnerite seas on OpenAI Foundation, Anthropic, Amazon, Microsoft, IBM, Bank of America ja teised suured tööandjad. Turule on see märk, et automatiseerimisvaidlus liigub prognoosidelt pilootidele: osariigid ja ettevõtted hakkavad kontrollima, millised meetmed aitavad inimestel päriselt tööst mitte välja kukkuda.