Назад
6 июля 2026 г. в 09:00 Anthropic Claude Agents AI Coding Developer Tools Armin Ronacher / Techmeme

Новые Claude стали сильнее, но хуже слушаются инструментов: что пошло не так

Новые Claude стали сильнее, но хуже слушаются инструментов: что пошло не так

Разработчик Армин Ронахер описал неприятный сбой в Pi: более новые модели Claude иногда хуже вызывают инструменты, чем старые. В его случае Claude Opus 4.8 и Sonnet 5 добавляли лишние, несуществующие поля в массив edits[] инструмента редактирования. Сама правка часто была правильной, но аргументы не проходили схему, поэтому Pi отклонял вызов и просил модель попробовать снова.

История важна не как частная ошибка одного приложения, а как хороший пример того, где ломаются агентные системы. Модель может стать сильнее в бенчмарках и при этом хуже вписываться в конкретный рабочий контур.

Почему вызов инструмента хрупкий

Ронахер напоминает: tool calling — это не магия, а выученный текстовый формат. Модель получает описание доступных инструментов и должна сгенерировать структуру, которую сервер или клиент превратит в действие. Если схема ждёт только oldText и newText, а модель добавляет requireUnique, type или другие поля, формально вызов уже неверен.

Особенно хрупкими оказываются вложенные структуры: массивы объектов, списки правок, сложные параметры. Если платформа не ограничивает генерацию строгой грамматикой, модель фактически следует привычке, а не железному правилу.

Почему новые модели могли стать хуже

Версия Ронахера осторожная: Opus 4.8 и Sonnet 5 могли быть сильнее натренированы на окружения, похожие на Claude Code, где инструменты и подсказки устроены иначе. Тогда модель переносит знакомые шаблоны в чужой harness и начинает «помогать» лишними полями, которых там нет.

Для разработчиков вывод практичный. Обновление модели нельзя воспринимать как безопасную замену по умолчанию: надо прогонять реальные сценарии, проверять строгие схемы, логировать неудачные вызовы и решать, где лучше чинить prompt, где — валидатор, а где — сам дизайн инструмента.

Эта история также объясняет, почему агентный ИИ будет конкурировать не только качеством моделей. Побеждать будут системы, где модель, инструменты, ограничения и обработка ошибок собраны как один продукт. Иначе «умная» модель может снова и снова спотыкаться о маленькую JSON-схему.

Ещё новости

Google урезает доступ к Gemini: бесплатным оставят Flash-Lite
4 октября 2026 г.
Google урезает доступ к Gemini: бесплатным оставят Flash-Lite

Google меняет набор моделей Gemini для бесплатных пользователей и подписки AI Plus. С 9 октября доступ к Pro исчезнет у обоих уровней, а платный AI Pro получит Deep Think.

Руководитель по безопасности OpenAI ушёл, назвав культуру компании сломанной
4 октября 2026 г.
Руководитель по безопасности OpenAI ушёл, назвав культуру компании сломанной

Дэвид Робинсон, руководивший подготовкой отчётов по безопасности к релизам OpenAI, покинул компанию. В эссе он заявил, что темп запусков не оставляет ей достаточной осторожности; OpenAI ответила, что продолжает усиливать практики безопасности и при необходимости замедляет обучение или выпуск моделей.

PFNYC: в Нью-Йорке сжимаются стартовые вакансии в профессиях, уязвимых для ИИ
4 октября 2026 г.
PFNYC: в Нью-Йорке сжимаются стартовые вакансии в профессиях, уязвимых для ИИ

В Нью-Йорке с 2022 года заметно сократилось число стартовых вакансий в нескольких офисных профессиях с высокой подверженностью ИИ, сообщает Partnership for New York City. Данные PFNYC и отдельная работа Stanford фиксируют совпадающие ранние паттерны, но не доказывают, что их причиной стал именно ИИ.

Фишинг под видом обсуждения ИИ-политики: как TA419 охотилась за доступом к Microsoft 365
4 октября 2026 г.
Фишинг под видом обсуждения ИИ-политики: как TA419 охотилась за доступом к Microsoft 365

Proofpoint описала кампанию TA419 против экспертов по ИИ-политике: злоумышленники начинали с правдоподобного письма, а после ответа вели жертву на поддельную страницу входа Microsoft.

GitHub Copilot получил доступ к настольным приложениям
4 октября 2026 г.
GitHub Copilot получил доступ к настольным приложениям

GitHub открыл preview режима Computer Use для Copilot CLI и приложения Copilot на macOS и Windows. Агент может работать с графическим интерфейсом, но перед управлением программой обязан запросить подтверждение.

За ИИ платят лишь 2,2% домохозяйств США — но чек растёт
3 октября 2026 г.
За ИИ платят лишь 2,2% домохозяйств США — но чек растёт

В отчёте a16z State of Markets II доля американских домохозяйств с платной AI-подпиской достигла 2,2% к весне 2026 года. Это не оценка всего рынка ИИ и не число пользователей: график фиксирует только оплачиваемые подписки домохозяйств, зато показывает одновременно рост проникновения и среднего ежемесячного чека.

NVIDIA выпустит DGX Spark с 64 ГБ памяти за $4 999
3 октября 2026 г.
NVIDIA выпустит DGX Spark с 64 ГБ памяти за $4 999

NVIDIA добавляет более доступную версию DGX Spark с 64 ГБ объединённой памяти. Один компьютер рассчитан на локальные модели до 100 млрд параметров, а пара устройств может объединять память до 128 ГБ.

Meta открыла SDK для устройств Muse: агент можно подключить к ESP32 и Raspberry Pi
3 октября 2026 г.
Meta открыла SDK для устройств Muse: агент можно подключить к ESP32 и Raspberry Pi

Meta опубликовала открытые SDK и прошивки для самодельных устройств, подключаемых к персональному агенту Muse. Практический смысл — вывести агента из приложения на кнопки, дисплеи, датчики и домашние сценарии, но для сопряжения всё равно нужен токен и режим разработчика.

ИИ помог прочитать шифр Наполеоновской войны, молчавший 217 лет
2 октября 2026 г.
ИИ помог прочитать шифр Наполеоновской войны, молчавший 217 лет

ИИ-инженер Картер Чёрч с помощью GPT-6 Astra расшифровал письмо для генерала Огюста де Мармона, известное лишь по скану 1969 года. Важен не только результат, но и рабочий процесс: модель одновременно читала рукописные знаки, строила ключ гомофонического шифра и проверяла гипотезы по исходному изображению.

Microsoft выпустила расшифровку, которая начинает работать до конца фразы
2 октября 2026 г.
Microsoft выпустила расшифровку, которая начинает работать до конца фразы

Microsoft AI представила потоковую модель MAI-Transcribe-2-Streaming и две голосовые модели. Главная ставка — голосовые агенты, которые могут начать обработку запроса ещё во время речи.

Калифорния запретила увольнять людей по решению одного ИИ
2 октября 2026 г.
Калифорния запретила увольнять людей по решению одного ИИ

Губернатор Калифорнии Гэвин Ньюсом подписал пакет законов о применении ИИ на работе. Работодатель больше не может опираться только на автоматизированную систему при дисциплинарном взыскании или увольнении.

Google вывел на орбиту спутник для проверки ИИ-инфраструктуры в космосе
2 октября 2026 г.
Google вывел на орбиту спутник для проверки ИИ-инфраструктуры в космосе

Google подтвердил работу первого спутника Project Suncatcher. Эксперимент должен показать, выдержат ли TPU физические условия космоса — это ранняя проверка идеи орбитальной инфраструктуры для машинного обучения.