Назад
7 июля 2026 г. в 06:08 AI Benchmarks Business AI Claude Open Weights Productivity Artificial Analysis Artificial Analysis / X

ИИ-модели начали сравнивать по профессиям: бизнесу важны не только баллы, но и цена задачи

ИИ-модели начали сравнивать по профессиям: бизнесу важны не только баллы, но и цена задачи

ИИ-модели начали сравнивать по профессиям: бизнесу важны не только баллы, но и цена задачи

Artificial Analysis запустила шесть новых Capability Indices — отраслевых индексов для сравнения моделей в финансах и учете, праве, медицине, стратегии и операциях, инженерии и экономике. Это не еще одна общая таблица «кто умнее»: сервис пытается измерить, какие модели лучше подходят для конкретной офисной и экспертной работы.

Что изменилось в сравнении моделей

Новые индексы строятся от задач, а не от маркетинговых категорий. Artificial Analysis пишет, что берет типовые рабочие действия из классификации O*NET, выводит из них нужные способности, подбирает релевантные бенчмарки и взвешивает их по частоте таких способностей в домене. Для права это исследования, договоры, судебная поддержка и комплаенс; для инженерии — расчеты, документация, инструменты и автоматизация.

По данным официального анонса, Claude Fable 5 с fallback на Opus 4.8 лидирует во всех восьми индексах, включая прежние Agentic и Coding. Но дальше картина быстро распадается по областям: GPT-5.5, Gemini 3.5 Flash, Claude Sonnet 5, GLM-5.2 и другие модели меняются местами в зависимости от работы.

Почему это важно для компаний

Главная интрига не в том, что frontier-модели снова наверху. Artificial Analysis отдельно показывает цену и время на задачу. Например, DeepSeek V4 Flash проходит задачи дешевле $0,04 во всех шести новых индексах, а GLM-5.2 лидирует среди open-weight моделей в пяти из шести отраслевых индексов. При этом Claude Fable 5 в индексе Strategy & Ops дает заметно более высокий результат, но стоит более чем в 100 раз дороже DeepSeek V4 Pro на одну задачу.

Для бизнеса это полезнее абстрактного рейтинга. Юридический отдел, финансовая команда и инженерная группа могут получить разные ответы на вопрос «какую модель брать». Где-то важен максимум качества, где-то — скорость, стоимость или возможность развернуть open-weight модель внутри своего контура.

Сдвиг простой: рынок ИИ взрослеет от тестов «какая модель победила» к вопросу «какая модель окупается в этой работе». Именно так компании будут считать автоматизацию дальше.

Ещё новости

GitHub открыла API для запуска проверок кода Copilot
5 октября 2026 г.
GitHub открыла API для запуска проверок кода Copilot

GitHub разрешила запускать проверку pull request’ов Copilot через REST и GraphQL API. Одновременно для новых и уже существующих репозиториев стандартным уровнем тщательности стал Balanced.

AWS показала Well-Architected Agent: ИИ-ревизор для облака, но с правами и проверкой человеком
5 октября 2026 г.
AWS показала Well-Architected Agent: ИИ-ревизор для облака, но с правами и проверкой человеком

AWS открыла предварительный доступ к Well-Architected Agent — сервису, который анализирует инфраструктуру и предлагает исправления для стоимости, производительности, устойчивости и безопасности. Рекомендации могут включать изменения IaC, но AWS отдельно предупреждает: генеративный ИИ способен ошибаться.

Google урезает доступ к Gemini: бесплатным оставят Flash-Lite
4 октября 2026 г.
Google урезает доступ к Gemini: бесплатным оставят Flash-Lite

Google меняет набор моделей Gemini для бесплатных пользователей и подписки AI Plus. С 9 октября доступ к Pro исчезнет у обоих уровней, а платный AI Pro получит Deep Think.

Руководитель по безопасности OpenAI ушёл, назвав культуру компании сломанной
4 октября 2026 г.
Руководитель по безопасности OpenAI ушёл, назвав культуру компании сломанной

Дэвид Робинсон, руководивший подготовкой отчётов по безопасности к релизам OpenAI, покинул компанию. В эссе он заявил, что темп запусков не оставляет ей достаточной осторожности; OpenAI ответила, что продолжает усиливать практики безопасности и при необходимости замедляет обучение или выпуск моделей.

PFNYC: в Нью-Йорке сжимаются стартовые вакансии в профессиях, уязвимых для ИИ
4 октября 2026 г.
PFNYC: в Нью-Йорке сжимаются стартовые вакансии в профессиях, уязвимых для ИИ

В Нью-Йорке с 2022 года заметно сократилось число стартовых вакансий в нескольких офисных профессиях с высокой подверженностью ИИ, сообщает Partnership for New York City. Данные PFNYC и отдельная работа Stanford фиксируют совпадающие ранние паттерны, но не доказывают, что их причиной стал именно ИИ.

Фишинг под видом обсуждения ИИ-политики: как TA419 охотилась за доступом к Microsoft 365
4 октября 2026 г.
Фишинг под видом обсуждения ИИ-политики: как TA419 охотилась за доступом к Microsoft 365

Proofpoint описала кампанию TA419 против экспертов по ИИ-политике: злоумышленники начинали с правдоподобного письма, а после ответа вели жертву на поддельную страницу входа Microsoft.

GitHub Copilot получил доступ к настольным приложениям
4 октября 2026 г.
GitHub Copilot получил доступ к настольным приложениям

GitHub открыл preview режима Computer Use для Copilot CLI и приложения Copilot на macOS и Windows. Агент может работать с графическим интерфейсом, но перед управлением программой обязан запросить подтверждение.

За ИИ платят лишь 2,2% домохозяйств США — но чек растёт
3 октября 2026 г.
За ИИ платят лишь 2,2% домохозяйств США — но чек растёт

В отчёте a16z State of Markets II доля американских домохозяйств с платной AI-подпиской достигла 2,2% к весне 2026 года. Это не оценка всего рынка ИИ и не число пользователей: график фиксирует только оплачиваемые подписки домохозяйств, зато показывает одновременно рост проникновения и среднего ежемесячного чека.

NVIDIA выпустит DGX Spark с 64 ГБ памяти за $4 999
3 октября 2026 г.
NVIDIA выпустит DGX Spark с 64 ГБ памяти за $4 999

NVIDIA добавляет более доступную версию DGX Spark с 64 ГБ объединённой памяти. Один компьютер рассчитан на локальные модели до 100 млрд параметров, а пара устройств может объединять память до 128 ГБ.

Meta открыла SDK для устройств Muse: агент можно подключить к ESP32 и Raspberry Pi
3 октября 2026 г.
Meta открыла SDK для устройств Muse: агент можно подключить к ESP32 и Raspberry Pi

Meta опубликовала открытые SDK и прошивки для самодельных устройств, подключаемых к персональному агенту Muse. Практический смысл — вывести агента из приложения на кнопки, дисплеи, датчики и домашние сценарии, но для сопряжения всё равно нужен токен и режим разработчика.

ИИ помог прочитать шифр Наполеоновской войны, молчавший 217 лет
2 октября 2026 г.
ИИ помог прочитать шифр Наполеоновской войны, молчавший 217 лет

ИИ-инженер Картер Чёрч с помощью GPT-6 Astra расшифровал письмо для генерала Огюста де Мармона, известное лишь по скану 1969 года. Важен не только результат, но и рабочий процесс: модель одновременно читала рукописные знаки, строила ключ гомофонического шифра и проверяла гипотезы по исходному изображению.

Microsoft выпустила расшифровку, которая начинает работать до конца фразы
2 октября 2026 г.
Microsoft выпустила расшифровку, которая начинает работать до конца фразы

Microsoft AI представила потоковую модель MAI-Transcribe-2-Streaming и две голосовые модели. Главная ставка — голосовые агенты, которые могут начать обработку запроса ещё во время речи.