Odav AI-mudel võib osutuda kallimaks: reasoning-mudelite hinda mõõdeti päris ülesannetel
Stanfordi, UC Berkeley, CMU ja Microsoft Researchi teadlased kirjeldasid AI-turu ebameeldivat lõksu: mudel, mis paistab hinnakirjas odav, võib päris töös osutuda kallimaks. Töö kannab pealkirja The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost More; esimene versioon ilmus märtsis ja uuendatud versioon avaldati 28. mail. Täna levis teema taas Redditi AI-kogukondades, sest probleem tabab arendajate rahakotti väga otse.
Tokeni hind ei võrdu enam ülesande hinnaga
Autorid võrdlesid kaheksat frontier reasoning-mudelit 12 ülesandekogumil: matemaatikas, teadusküsimustes, koodis, agentsetes stsenaariumides ja muudes testides. Lõppjäreldus on karm: 32% võrdlustest maksis madalama deklareeritud tokenihinnaga mudel tegelikult rohkem. Suurim vahe ulatus 28 korrani.
Iseloomulik näide annotatsioonist: Gemini 3 Flash on hinnakirjas ligikaudu 80% odavam kui GPT-5.4, kuid ülesannete kogukulu järgi osutus 38% kallimaks. Põhjus ei ole tariifide maagias, vaid mudelite käitumises. Reasoning-mudelid kulutavad sisemisi “thinking tokens” ning võivad enne vastust teha erineva arvu samme. Sama päringu puhul võib üks mudel autorite andmetel kasutada 900% rohkem thinking token’eid kui teine.
Miks see on ettevõtetele tähtis
Juturoboti kasutajale näeb see välja nagu tehniline detail. APIde, agentide, koodiabiliste või klienditoe automatiseerimisega äri jaoks on see juba toote majandus. Kui teenust müüakse fikseeritud kuutasuga, kuid rasked kasutajad käivitavad ettearvamatult kalleid reasoning-ülesandeid, võib marginaal kaduda märkamatult.
Eraldi probleem on hajuvus. Uuring näitab, et sama päringu korduvkäivitused võivad anda thinking token’ite hulgas kuni 9,7-kordse erinevuse. See tähendab, et üksiku päringu täpset hinda on peaaegu võimatu ennustada: vaadata tuleb kulude jaotust, limiite, alarme ja päris teste oma ülesannetel.
Peamine õppetund on lihtne: teenusepakkuja hinnakiri on ainult sisendhind. Tegelik arve kujuneb sellest, kui palju mudel mõtleb, mitu sammu teeb ja kui tihti kaldub kallitele trajektooridele.













