ИИ-модели начали сравнивать по профессиям: бизнесу важны не только баллы, но и цена задачи
ИИ-модели начали сравнивать по профессиям: бизнесу важны не только баллы, но и цена задачи
Artificial Analysis запустила шесть новых Capability Indices — отраслевых индексов для сравнения моделей в финансах и учете, праве, медицине, стратегии и операциях, инженерии и экономике. Это не еще одна общая таблица «кто умнее»: сервис пытается измерить, какие модели лучше подходят для конкретной офисной и экспертной работы.
Что изменилось в сравнении моделей
Новые индексы строятся от задач, а не от маркетинговых категорий. Artificial Analysis пишет, что берет типовые рабочие действия из классификации O*NET, выводит из них нужные способности, подбирает релевантные бенчмарки и взвешивает их по частоте таких способностей в домене. Для права это исследования, договоры, судебная поддержка и комплаенс; для инженерии — расчеты, документация, инструменты и автоматизация.
По данным официального анонса, Claude Fable 5 с fallback на Opus 4.8 лидирует во всех восьми индексах, включая прежние Agentic и Coding. Но дальше картина быстро распадается по областям: GPT-5.5, Gemini 3.5 Flash, Claude Sonnet 5, GLM-5.2 и другие модели меняются местами в зависимости от работы.
Почему это важно для компаний
Главная интрига не в том, что frontier-модели снова наверху. Artificial Analysis отдельно показывает цену и время на задачу. Например, DeepSeek V4 Flash проходит задачи дешевле $0,04 во всех шести новых индексах, а GLM-5.2 лидирует среди open-weight моделей в пяти из шести отраслевых индексов. При этом Claude Fable 5 в индексе Strategy & Ops дает заметно более высокий результат, но стоит более чем в 100 раз дороже DeepSeek V4 Pro на одну задачу.
Для бизнеса это полезнее абстрактного рейтинга. Юридический отдел, финансовая команда и инженерная группа могут получить разные ответы на вопрос «какую модель брать». Где-то важен максимум качества, где-то — скорость, стоимость или возможность развернуть open-weight модель внутри своего контура.
Сдвиг простой: рынок ИИ взрослеет от тестов «какая модель победила» к вопросу «какая модель окупается в этой работе». Именно так компании будут считать автоматизацию дальше.
- nitter.netIntroducing six new Artificial Analysis Capability Indices
- artificialanalysis.aiAI Model & API Providers Analysis | Artificial Analysis
- artificialanalysis.aiBest AI for Legal: LLM Leaderboard | Artificial Analysis
- artificialanalysis.aiBest AI for Engineering: LLM Leaderboard | Artificial Analysis
- commons.wikimedia.orgFile:Mindpark Helsingborg bottenvåning Open Space.jpg - Wikimedia Commons













