Thinking Machines näitas AI-d, mis kuulab ja vastab samal ajal
Thinking Machines näitas AI-d, mis kuulab ja vastab samal ajal
Thinking Machines Lab, OpenAI endise tehnoloogiajuhi Mira Murati idufirma, esitles research preview’d „interaction models“ — mudeleid, mis peaksid töötama mitte tavapärase voorupõhise vestlusena, vaid elava protsessi kaaslasena. Need võtavad korraga vastu heli, videot ja teksti, reageerivad reaalajas, võivad katkestada, täpsustada, vestlust üleval hoida ning paralleelselt käivitada pikemaid arutlusi või tööriistu.
Peamine uudis pole see, et veel üks labor näitas hääleassistenti. Thinking Machines üritab muuta AI-ga suhtlemise põhimehaanikat: „inimene kirjutas päringu → mudel mõtles → mudel vastas“ mudelilt püsivale koostöökanalile, kus mõlemad pooled saavad samal ajal näha, kuulda, rääkida ja tegutseda.
Mida Thinking Machines täpselt näitas
Ettevõte kirjutab oma blogis, et tänased mudelid „elavad ühes voos“. Kui inimene räägib või kirjutab, ootab mudel. Kui mudel genereerib vastust, on tema taju sisuliselt külmunud: ta ei saa uusi signaale enne, kui lõpetab või kasutaja katkestab. Lihtsa küsimuse puhul on see talutav. Päris töö — koodi arutamine, tõlkimine, õpetamine, kasutajaliidese disain, abi laboris või tootmises — muudab selle kitsaskohaks.
Interaction models on ehitatud teisiti. Thinking Machines kirjeldab mitme voo lähenemist „mikrokäikudega“: mudel töötleb umbes 200 millisekundit sisendit ja 200 millisekundit väljundit pideva voona. See lubab tal mitte oodata ideaalset piiri repliikide vahel. Ta võib kuulata ja rääkida samal ajal, märgata visuaalseid vihjeid, reageerida pausidele, eneseparandustele ja žestidele, mitte ainult lõplikule tekstipäringule.
Ettevõte toob näiteid: mudel kuulab lugu ja märgib loomade mainimisi, tõlgib kõnet reaalajas, tuletab inimesele meelde, et ta kössitab, või reageerib kaadris toimuvale. Need kõlavad nagu väikesed UX-detailid, kuid just neist tekib tunne, et AI mitte lihtsalt ei „vasta“, vaid on ülesandes inimesega koos kohal.
Miks see erineb tavalistest häälebotidest
Tänapäeva voice- ja realtime-süsteemid näivad sageli interaktiivsed tänu ümbrisele: kõnetuvastus, lauselõpu detektor, eraldi keelemudel, kõnesüntees, katkestused, dialoogireeglid. See töötab, kuid süsteem jääb kokkuliimitud komponentide kogumiks. Thinking Machines väidab, et interaktiivsus tuleb ehitada mudeli arhitektuuri sisse, mitte lisada sellele peale.
Siit tuleb oluline mõte: mudel peab mõistma aega, pause, kattuvat kõnet ja visuaalseid sündmusi konteksti osana. Inimese jaoks on see loomulik. Vestluses kuuleme „mm“, näeme näoilmet, jõuame teise poole enne vales suunas minekut katkestada ja samal ajal ekraani vaadata. AI puhul on see seni tihti olnud kasutajaliidese trikkidega imiteerimine.
Thinking Machines kirjeldab ka kahekihilist süsteemi. Kiire interaction-mudel jääb kasutaja kõrvale ja hoiab elavat kontakti. Kui vaja on rasket tööd — otsingut, brausimist, kasutajaliidese ehitamist, pikka arutlust, agentset workflow’d — delegeerib ta ülesande taustamudel-agentile ning põimib tulemuse hiljem vestlusesse tagasi. Idee on selge: kasutaja ei peaks valima mudeli kohese reaktsiooni ja sügava mõtlemise vahel.
Mida jõudluse kohta teada on
Thinking Machinesi ja VentureBeati vahenduse järgi on näidatud TML-Interaction-Small 276 miljardi parameetriga MoE-mudel, millest aktiivsed on 12 miljardit parameetrit. Ettevõte väidab turn-taking viivituseks umbes 0,40 sekundit, võrreldes Gemini-3.1-flash-live’i 0,57 ja GPT-realtime-2.0 1,18 sekundiga sarnases režiimis. FD-bench V1.5 testis, mis mõõdab interaktiivse suhtluse kvaliteeti, annab Thinking Machines tulemuseks 77,8 punkti, võrreldes Gemini-3.1-flash-live’i 54,3 ja GPT-realtime-2.0 46,8 punktiga.
Neid arve tasub võtta ettevaatlikult: see on research preview, mitte sõltumatu massitoode päris kasutajakoormuse all. Kuid suund on tähtis. AI benchmark’id mõõtsid kaua peamiselt „vastuse tarkust“ — matemaatikat, koodi, arutlust, teadmisi. Nüüd tekib eraldi võidujooks koostööprotsessi kvaliteedi üle: kui kiiresti mudel olukorda mõistab, inimest ei sega, õigel hetkel sekkub ja ei kaota niiti, samal ajal kui taustaagent töötab.
Miks see on tavakasutajatele oluline
Enamik inimesi ei taha AI-d „promptida“ nagu vormimasinat. Nad tahavad näidata ekraani, hakata seletama, end poole sõna pealt parandada, kuulda lühikest täpsustust, paluda mitte vahele segada, liikuda häälelt tekstile ja tagasi. Mida rohkem AI muutub tööpartneriks, seda halvemini sobib mudel „kirjuta ideaalne päring ja oota valmis tulemust“.
Kui interaction models jõuavad tooteni, võivad need muuta hääleassistente, õpet, kliendituge, paarisprogrammeerimist, meditsiini- ja laboriprotsesse, tootmiskontrolli ning disainitööriistu. Näiteks saab mudel vaadata arendaja ekraani, kuulda tema selgitust, märgata koodiviga enne teste ja paralleelselt koguda taustainfot. Või aidata tootmisoperaatorit, ootamata, kuni too probleemi sõnadesse vormib.
See ei tähenda, et inimene protsessist kaob. Vastupidi, Thinking Machines vaidleb selgelt ideega, et parim AI on autonoomne agent, kellele anti ülesanne ja siis mindi kohvi jooma. Päris töös täpsustuvad nõuded tihti käigu pealt. Hea tulemus ei sünni ühest promptist, vaid kiiretest parandustest, kontekstist, kogemusest ja inimlikust otsustusest. Uus arhitektuur üritab tuua inimese tsüklisse tagasi mitte segajana, vaid infoallikana.
Miks see on AI-turule oluline
Thinking Machinesi jaoks on see teade viis näidata, mille poolest Mira Murati ettevõte erineb kümnetest uutest AI-laboritest. Startup on juba välja andnud Tinkeri, mudelite peenhäälestuse API, kuid interaction models annavad selgema strateegilise panuse: tulevik ei ole ainult tugevamates reasoning-mudelites, vaid loomulikumates koostööliidestes.
See avaldab survet ka OpenAI-le, Google’ile, Anthropicule ja teistele laboritele. Kui kasutaja harjub AI-ga, mis näeb, kuuleb, vastab peaaegu viivituseta ja ei kaota katkestamisel konteksti, hakkab tavaline vestlusaken tunduma mitte „klassikana“, vaid piiranguna. Niipea kui sellised süsteemid muutuvad stabiilseks, tõuseb kõigi assistentide kasutajaliidese latt järsult.
Äri jaoks on küsimus veel praktilisem. Paljusid ettevõtteprotsesse ei saa täielikult autonoomsele agendile anda: liiga palju nüansse, vastutust, ligipääsu süsteemidele ja mitteametlikku teadmist. Kuid neid saab kiirendada, kui AI on reaalajas kõrval — jälgib, soovitab, vormistab, kontrollib ja kutsub taustaagendi sinna, kus on vaja rasket tööd.
Piirangud ja riskid
Praegu ei saa interaction models’i lihtsalt avada ja proovida. Thinking Machines lubab piiratud research preview’d lähikuudel ning laiemat väljalaset hiljem sel aastal. Seega on tegu pigem arhitektuurisuuna avaldusega kui valmis ChatGPT või Gemini Live’i asendusega.
On ka selged riskid. Pidevalt kuulav ja vaatav mudel tõstatab privaatsusküsimused tugevamalt kui tekstivestlus. Kui selline AI töötab koosolekul, klassiruumis, haiglas või tehasepingi juures, peab olema selge, mida salvestatakse, kus seda hoitakse, kes voogu näeb, kuidas vaatlemine välja lülitatakse ja milliseid tegevusi mudel võib ilma kinnituseta teha.
Teine risk on liigne enesekindlus. Mudel, mis katkestab ja aktiivselt sekkub, võib olla kasulik, kuid ka ärritada, segada või suunata inimest valede otsuste poole. Hea interaktiivne käitumine pole ainult madal viivitus, vaid ka sotsiaalne sobivus: millal vaikida, millal täpsustada, millal peatuda ja millal ausalt öelda „ma pole kindel“.
Peamine järeldus
Thinking Machinesi teade näitab, et AI-võidujooksu järgmine faas ei käi ainult mudelite suuruse ja testitulemuste ümber. Üha olulisemaks muutub küsimus: kui loomulikult suudab mudel inimesega elavas voos koos töötada.
Kui esimese põlvkonna juturobotid vastasid päringutele, siis interaction models taotlevad püsiva ülesandes osaleja rolli. Nad kuulavad, vaatavad, reageerivad, hoiavad konteksti ja kutsuvad taustaagente, samal ajal kui vestlus jätkub. See pole veel massitoode, kuid on tähtis kaart maastikust: AI liigub järk-järgult targalt sisestusaknalt ühise töökeskkonna poole.
💬 Neuro.ee toimetuse arvamus
Selles uudises on vähe odavat draamat, kuid palju tulevast praktikat. AI kõige väärtuslikum osa ei pruugi olla see, et ta „teeb kõik ise ära“, vaid see, et ta lõpetab lõpuks inimese sundimise suhtlema temaga nagu bürokraatliku vormiga. Kui Thinking Machinesil on õigus, pole tuleviku liides ideaalne prompt, vaid normaalne töövestlus, kus mudel jõuab mõelda, kuulata ega kuku protsessist välja.
- thinkingmachines.aiInteraction Models: A Scalable Approach to Human-AI Collaboration
- theverge.comHere’s what Mira Murati’s AI company is up to
- venturebeat.comThinking Machines shows off preview of near-realtime AI voice and video conversation with new 'interaction models'
- techmeme.comThinking Machines Lab details interaction models, which can think and respond in real time, letting users and AI interact continuously for better collaboration
- flickr.comMira Murati Th′12: Honorary Degree













