Новые Claude стали сильнее, но хуже слушаются инструментов: что пошло не так
Разработчик Армин Ронахер описал неприятный сбой в Pi: более новые модели Claude иногда хуже вызывают инструменты, чем старые. В его случае Claude Opus 4.8 и Sonnet 5 добавляли лишние, несуществующие поля в массив edits[] инструмента редактирования. Сама правка часто была правильной, но аргументы не проходили схему, поэтому Pi отклонял вызов и просил модель попробовать снова.
История важна не как частная ошибка одного приложения, а как хороший пример того, где ломаются агентные системы. Модель может стать сильнее в бенчмарках и при этом хуже вписываться в конкретный рабочий контур.
Почему вызов инструмента хрупкий
Ронахер напоминает: tool calling — это не магия, а выученный текстовый формат. Модель получает описание доступных инструментов и должна сгенерировать структуру, которую сервер или клиент превратит в действие. Если схема ждёт только oldText и newText, а модель добавляет requireUnique, type или другие поля, формально вызов уже неверен.
Особенно хрупкими оказываются вложенные структуры: массивы объектов, списки правок, сложные параметры. Если платформа не ограничивает генерацию строгой грамматикой, модель фактически следует привычке, а не железному правилу.
Почему новые модели могли стать хуже
Версия Ронахера осторожная: Opus 4.8 и Sonnet 5 могли быть сильнее натренированы на окружения, похожие на Claude Code, где инструменты и подсказки устроены иначе. Тогда модель переносит знакомые шаблоны в чужой harness и начинает «помогать» лишними полями, которых там нет.
Для разработчиков вывод практичный. Обновление модели нельзя воспринимать как безопасную замену по умолчанию: надо прогонять реальные сценарии, проверять строгие схемы, логировать неудачные вызовы и решать, где лучше чинить prompt, где — валидатор, а где — сам дизайн инструмента.
Эта история также объясняет, почему агентный ИИ будет конкурировать не только качеством моделей. Побеждать будут системы, где модель, инструменты, ограничения и обработка ошибок собраны как один продукт. Иначе «умная» модель может снова и снова спотыкаться о маленькую JSON-схему.
- lucumr.pocoo.orgBetter Models: Worse Tools
- techmeme.comClaude Opus 4.8 and Sonnet 5 seem worse at tool calls than older models, likely due to post-training that assumes Claude Code-like harnesses as targets
- github.comNew Claude models work poorly with the current Pi’s edit tool, failing about 20% edits in some sessions · Issue #6278 · earendil-works/pi
- unsplash.comUnsplash photo used as editorial cover













