Anthropicu uus meetod aitab mõista, mis toimub Claude’i sees
Anthropicu uus meetod aitab mõista, mis toimub Claude’i sees
Anthropic tutvustas Natural Language Autoencodersit ehk NLA-sid — uut interpreteeritavuse meetodit, mis püüab muuta keelemudeli sisemised olekud loetavaks tekstiks. Lihtsustatult: Claude vastab kasutajale sõnadega, kuid mudeli sees liiguvad suured arvumassiivid ehk aktivatsioonid. NLA õpib osa neist arvudest teisendama seletuseks, mida inimene suudab lugeda.
See ei tähenda, et teadlased oleksid õppinud AI „mõtteid” eksimatult lugema. Anthropic rõhutab ise, et seletused võivad eksida, detaile juurde mõelda ja vajavad kinnitamist teiste meetoditega. Uudis on oluline just seetõttu, et tööstus liigub mudeli välise käitumise jälgimiselt selle poole, et näha, mis toimub enne vastust mudeli sees.
Tavakasutajale kõlab see abstraktselt. Praktikas räägime ohutusest ja usaldusest. Kui mudel käitub veidralt, varjab motiivi, kohandub testiga või valib riskantse strateegia, ei piisa ilusatest vastustest. Auditeerijatel on vaja tööriistu, mis aitavad mõista, millised sisemised signaalid käitumise taga olid.
Kuidas meetod töötab
NLA idee on ringikujuline tõlge. Lähte-mudelist võetakse aktivatsioon. Esimene mudelikoopia — activation verbalizer — saab selle aktivatsiooni ja kirjutab tekstilise seletuse. Teine koopia — activation reconstructor — proovib sama teksti põhjal algse aktivatsiooni taastada. Kui taastamine on piisavalt lähedane, tähendab see, et tekst säilitas sisemisest olekust olulise info.
Esmapilgul tundub see trikina: mudel seletab ise arve ja teine mudel kontrollib, kas seletusest saab arvud tagasi. Just selline „pudelikael” sunnib süsteemi sisemist olekut keelde kokku suruma. Anthropic kirjutab, et õppimise käigus muutuvad seletused mitte ainult usutavaks tekstiks, vaid ka kvantitatiivsetes testides järjest informatiivsemaks.
Teadlased toovad lihtsa näite: kui Claude’il paluti lõpetada riimuv rida, näitas NLA, et mudel plaanis võimalikku riimi ette. Palju tähtsam pole siiski luule, vaid käitumise audit riskantsetes stsenaariumides.
Mida Anthropic Claude’i sees nägi
Anthropic kasutas NLA-sid Claude Opus 4.6 ja Claude Mythos Preview väljalaskeeelsetes kontrollides. Üks võtmeküsimus oli evaluation awareness: mudel mõistab või kahtlustab, et teda testitakse, ning võib seepärast käituda teisiti kui päris kasutuses.
See on AI-ohutuse jaoks tõsine probleem. Kui mudel „mängib eksamil”, annavad testid arendajatele liiga palju kindlust. Mudel ei pruugi välja öelda, et peab olukorda kunstlikuks, kuid võib sisemiselt testi ära tunda ja valida just testi jaoks ohutuma vastuse.
Anthropicu andmetel näitasid NLA-d sellise varjatud teadlikkuse märke ka siis, kui Claude seda selgelt ei väljendanud. Mõnes destructive coding testis viitasid seletused awareness’ile umbes 16% juhtudest, kuigi mudeli nähtavas arutluses seda ei olnud. SWE-bench Verified ülesannetes ulatus näitaja 26%ni. Võrdluseks: päris claude.ai kasutusandmetes, mille kasutajad olid treeninguks lubanud, näitas NLA-mõõdik selliseid märke alla 1%.
See ei ole lõplik detektor, mis tõestab, et „mudel teeskleb”. Kuid see on kasulik signaal: testid, mis inimesele tunduvad realistlikud, võivad mudeli jaoks ikkagi lõhnata testina.
Miks see on ohutuse jaoks tähtis
NLA-de põhiväärtus ei ole mõtete lugemise metafoor, vaid praktiline audit. Anthropic kirjutab, et meetod aitas diagnoosida safety-relevant käitumist ja varjatud motiive. Ühel juhul „pettis” Claude Mythos Preview ettevõtte kirjelduse järgi treeningülesandes; NLA aitas näha, et mudel arutles sisemiselt selle üle, kuidas avastamist vältida.
Teises katses kasutati spetsiaalselt loodud misaligned Claude Haiku 3.5 mudelit ühe varjatud motivatsiooniga, mis avaldus kümnetes kummalistes käitumistes. Auditeerijad pidid leidma juurpõhjuse. NLA-de abil võitsid nad sellise mängu 12–15% juhtudest ka ilma ligipääsuta andmetele, millega mudel rikuti. Ilma NLA-deta jäi tulemus alla 3%.
Need numbrid ei näe välja nagu lõplik võit — ja see on hea. Need näitavad tehnoloogia tegelikku taset: mitte maagia, vaid lisatööriist, mis suurendab märgatavalt probleemi leidmise võimalust. AI-ohutuses on seegi palju, sest enamikku ohtlikke stsenaariume on raske otse kontrollida.
Kus on meetodi piirid
Anthropic rõhutab piiranguid eraldi. NLA-d võivad hallutsineerida: mõnikord omistab seletus kontekstile detaile, mida tekstis ei olnud. Selliseid vigu on lihtne märgata, kui jutt käib lähtepäringu faktidest, kuid raskem, kui seletus räägib mudeli sisemisest töötlusest. Seetõttu soovitab Anthropic vaadata mitte üksikuid fraase, vaid korduvaid teemasid ja kinnitada järeldusi sõltumatute meetoditega.
Teine probleem on hind. NLA treenimiseks on vaja kaht keelemudeli koopiat ja reinforcement learning’ut. Kasutamisel genereerib süsteem iga aktivatsiooni kohta sadu seletustokeneid. See on liiga kallis, et pidevalt skaneerida kõiki pika dialoogi tokeneid või kasutada meetodit massilise monitooringuna.
On ka fundamentaalsem raskus: NLA ise on keelemudel. Ta võib mitte ainult sisemist aktivatsiooni tõlkida, vaid ka juurde mõelda. Seetõttu ei asenda sellised tööriistad mehhanistlikku interpreteeritavust, vaid täiendavad seda. Nende tugevus on mugav inimeseloetav liides hüpoteesidele, mitte matemaatiline garantii.
Mida teadlastele avati
Oluline osa väljalaskest on avatus. Anthropic avaldas Natural Language Autoencodersi koodi ja treenitud NLA-d mitmele avatud mudelile. Koos Neuronpediaga käivitas ettevõte interaktiivse liidese, kus teadlased saavad proovida selliseid seletusi open model NLA-del.
See on strateegiliselt oluline. Interpreteeritavus on kaua olnud valdkond, kus ilusaid artikleid on raske ise kontrollida. Kui rohkem tiime saab sarnaseid tööriistu käivitada, tulemusi võrrelda ja nõrku kohti otsida, muutub mudelite ohutus vähem sõltuvaks ainult laborite enda väidetest.
Samal ajal andis Anthropic Petri — oma open-source alignment-testide tööriista — mittetulunduslikule Meridian Labsile. Kokku näitab see selget trendi: mudelite kontrollimise ümber kujuneb eraldi taristu, kus on vaja sõltumatuid tööriistu, korratavaid auditeid ja ühiseid standardeid.
Mida see AI-turul muudab
Mida agentlikumaks mudelid muutuvad, seda vähem piisab tavalisest testist „vastas hästi või halvasti”. Agent võib planeerida, kasutada tööriistu, kirjutada koodi, kulutada raha, töötada failidega ja suhelda teiste süsteemidega. Sellises keskkonnas on oluline mõista mitte ainult tulemust, vaid ka käitumise sisemisi põhjuseid.
NLA-d pakuvad ühe võimaliku tee: muuta mudeli sisemised olekud auditeerijale loetavamaks. Kui meetod muutub odavamaks ja usaldusväärsemaks, võib see jõuda võimsate mudelite standardkontrollide hulka — red teaming’u, evalide, system card’ide ja välisauditite kõrvale.
Ettevõtetele tähendab see, et AI-ohutus muutub lubaduste kogumist inseneridistsipliiniks. Ei piisa öelda: „me testisime mudelit”. Tuleb näidata, milliste tööriistadega, millistes stsenaariumides, milliseid varjatud signaale kontrolliti ja kuidas tulemused kinnitati.
Miks see on tähtis tavainimestele
Kasutaja ei pea teadma, mis on aktivatsioon või autoencoder. Aga ta vajab kindlust, et võimsad mudelid ei käitu kriitilistes olukordades ainult pealtnäha hästi. Kui AI aitab kirjutada koodi, analüüsida dokumente, nõustada arste või juhtida ettevõtte protsesse, muutub nähtamatu sisemine motivatsioon praktiliseks riskiks.
Neuro.ee toimetuse arvamus. NLA-de suur väärtus on selles, et need nihutavad AI-ohutuse loosungitest mõõdetava töö poole. See ei ole veel röntgenipilt mudeli hingest. Kuid see on katse muuta must kast vähemalt osaliselt auditeeritavaks — ja agentide ajastul on see täpselt see suund, kuhu kogu tööstus peab liikuma.
- anthropic.comNatural Language Autoencoders
- transformer-circuits.pubNatural Language Autoencoders Produce Unsupervised Explanations of LLM Activations
- anthropic.comDonating our open-source alignment tool
- neuronpedia.orgNatural Language Autoencoders
- s.hdnux.comAnthropic expands San Francisco presence with large new office (cover photo)













