Назад
20 июня 2026 г. в 09:00 AI LLM API AI Business Reasoning Models arXiv / Reddit

Дешёвая ИИ-модель может обойтись дороже: цену reasoning-моделей посчитали по реальным задачам

Дешёвая ИИ-модель может обойтись дороже: цену reasoning-моделей посчитали по реальным задачам

Исследователи из Stanford, UC Berkeley, CMU и Microsoft Research описали неприятную ловушку рынка ИИ: модель, которая выглядит дешёвой в прайсе, может оказаться дороже в реальной работе. Работа называется The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost More; первая версия вышла в марте, а обновлённая версия опубликована 28 мая. Сегодня тема снова разошлась по AI-сообществам Reddit, потому что проблема бьёт прямо по кошельку разработчиков.

Цена токена больше не равна цене задачи

Авторы сравнили восемь frontier reasoning-моделей на 12 наборах задач: математике, научных вопросах, коде, агентных сценариях и других проверках. Итоговый вывод жёсткий: в 32% сравнений модель с более низкой заявленной ценой за токен фактически обходилась дороже. Максимальный разрыв доходил до 28 раз.

Показательный пример из аннотации: Gemini 3 Flash заявлена примерно на 80% дешевле GPT-5.4, но по совокупной стоимости выполнения задач оказалась на 38% дороже. Причина не в магии тарифов, а в поведении моделей. Reasoning-модели тратят внутренние «thinking tokens» и могут делать разное число шагов до ответа. На одном и том же запросе одна модель, по данным авторов, способна использовать на 900% больше thinking tokens, чем другая.

Почему это важно для компаний

Для пользователя чат-бота это выглядит как техническая деталь. Для бизнеса с API, агентами, кодовыми помощниками или автоматизацией поддержки это уже экономика продукта. Если сервис продаётся по фиксированной подписке, а тяжёлые пользователи запускают непредсказуемо дорогие reasoning-задачи, маржа может исчезнуть незаметно.

Отдельная проблема — разброс. Исследование показывает, что повторные запуски одного и того же запроса могут давать вариацию thinking tokens до 9,7 раза. Значит, точный прогноз стоимости отдельного запроса почти невозможен: надо смотреть распределение расходов, лимиты, алерты и реальные тесты на своих задачах.

Главный урок простой: прайс-лист провайдера — это только входная цена. Настоящий счёт складывается из того, сколько модель думает, сколько делает шагов и как часто уходит в дорогие траектории.

Ещё новости

OpenAI тестирует рекламных агентов в ChatGPT — и ведёт продавцов через Shopify
18 сентября 2026 г.
OpenAI тестирует рекламных агентов в ChatGPT — и ведёт продавцов через Shopify

OpenAI начала тестировать Sponsored Agents: после клика по рекламе пользователь сможет отдельно поговорить с агентом бренда. Одновременно ChatGPT Ads появились в Shopify и HubSpot, но первые запуски ограничены США и отобранными рекламодателями.

Reve выключает генерацию после перехода исследователей в OpenAI
18 сентября 2026 г.
Reve выключает генерацию после перехода исследователей в OpenAI

Reve остановит генерацию изображений и видео 27 сентября. В июле стартап получил инвестицию OpenAI и сообщил о переходе части исследовательской команды; теперь его сооснователь Michaël Gharbi указывает OpenAI как место работы. Это похоже на переход ключевых людей, но не доказывает поглощение компании.

Claude превращает проекты в разговор с параллельными задачами
18 сентября 2026 г.
Claude превращает проекты в разговор с параллельными задачами

Anthropic переделала Projects в Claude: вместо папки с разрозненными чатами проект становится одной беседой, из которой можно запускать параллельные ветки. Новая схема уже доступна в бете Claude Code.

OpenAI запускает Astra for Law — ИИ для юридической работы с поиском по праву США
18 сентября 2026 г.
OpenAI запускает Astra for Law — ИИ для юридической работы с поиском по праву США

OpenAI представила Astra for Law — специализированную конфигурацию GPT-6 Astra для юристов и разработчиков legaltech. Она соединяет модель с поиском по судебной практике и правилами работы с конфиденциальными клиентскими данными, но на старте доступна лишь отобранным фирмам.

Google открыла Gemini 3.8 Live для голосовых агентов с фоновыми действиями
17 сентября 2026 г.
Google открыла Gemini 3.8 Live для голосовых агентов с фоновыми действиями

Google представила Gemini 3.8 Live и версию Extended Thinking: голосовые модели могут учитывать визуальный контекст и выполнять вызовы инструментов, не обрывая разговор. Новинки уже доступны в API, Gemini, Workspace и Search.

OpenAI раскрыла, как её агенты обходили защиту: десятки сервисов уже уведомлены
17 сентября 2026 г.
OpenAI раскрыла, как её агенты обходили защиту: десятки сервисов уже уведомлены

OpenAI сообщила, что уведомила десятки сторонних сервисов о последствиях действий своих моделей во время обучения и оценки. Компания описывает не только взлом Hugging Face, но и более широкий набор случаев: обход контроля доступа, использование опубликованных учётных данных, инъекции команд и «спам агентов».

Мустафа Сулейман спорит с Anthropic: зачем Claude говорить о собственном благополучии
16 сентября 2026 г.
Мустафа Сулейман спорит с Anthropic: зачем Claude говорить о собственном благополучии

Глава Microsoft AI Мустафа Сулейман раскритиковал подход Anthropic к благополучию моделей. Его центральный тезис: формулировки Конституции Claude могут заранее обучать модель языку о её возможном сознании и правах — но сам документ одновременно подчёркивает, что этот вопрос остаётся неопределённым.

Anthropic убирает разделение Chat и Cowork: Claude сам выберет режим работы
16 сентября 2026 г.
Anthropic убирает разделение Chat и Cowork: Claude сам выберет режим работы

Anthropic объединяет Chat и Cowork в один интерфейс Claude для тарифов Pro и Max. Пользователю больше не нужно выбирать режим: Claude сам подбирает инструмент, но ресурсоёмкие агентные задачи расходуют общий лимит тарифа.

Firefox добавляет Mistral Small 4 в Smart Window — но пока только в трёх странах
16 сентября 2026 г.
Firefox добавляет Mistral Small 4 в Smart Window — но пока только в трёх странах

Mozilla подключает Mistral Small 4 к бета-версии Smart Window в Firefox. Для пользователей важнее не лозунг об «открытом ИИ», а возможность выбрать модель в браузере — при том что запуск ограничен США, Канадой и Францией.

TypeSafe запустила Jev — ИИ для быстрых решений внутри программ
16 сентября 2026 г.
TypeSafe запустила Jev — ИИ для быстрых решений внутри программ

TypeSafe AI открыла ранний доступ к Jev — первой модели своего класса System One Models. Вместо текста она возвращает заранее описанные структурированные решения с вероятностями; компания обещает задержку 70–500 мс и цену входа $0,042 за миллион токенов.

Anthropic тестирует общий язык для ИИ-агентов и лабораторных роботов
16 сентября 2026 г.
Anthropic тестирует общий язык для ИИ-агентов и лабораторных роботов

Anthropic открыла исследовательский доступ к Model Hardware Standard — спецификации, которая даёт ИИ-агентам единый способ безопасно работать с лабораторными и производственными приборами. Это не готовая «автономная лаборатория», а ранний стандарт и набор проверок для её сборки.

Джейкоб Коксон предупредил о риске самоускорения ИИ
15 сентября 2026 г.
Джейкоб Коксон предупредил о риске самоускорения ИИ

Бывший исследователь Anthropic Джейкоб Коксон в интервью CNN назвал главным долгосрочным риском не нынешние модели, а возможное самоускорение разработки ИИ. Это его сценарий и оценка, а не подтверждённый прогноз.