Anthropic выпустила Claude Sonnet 5.5 с киберзащитой уровня Opus
Anthropic выпустила Claude Sonnet 5.5 с киберзащитой уровня Opus
Anthropic представила Claude Sonnet 5.5 — вторую модель семейства 5.5. Компания нацеливает её на чётко поставленные ежедневные задачи: исправление кода, документы, презентации, таблицы и быстрые агентные циклы. Для неоднозначной работы, где нужно долго взвешивать решения, Anthropic по-прежнему рекомендует Opus 5.5.
Релиз уже доступен в приложениях Claude, Claude Code и API, а также через Amazon Web Services, Google Cloud и Microsoft Azure. Идентификатор модели в Claude Platform — claude-sonnet-5-5.
Скачок на агентных тестах
Главная цифра из официального анонса Anthropic: на Terminal-Bench 4.0 Sonnet 5.5 набрала 70,6%, тогда как Sonnet 5 — 10,3%. В таблице компании новая модель также почти догоняет Opus 5.5 на OSWorld и распознавании графиков. Это результаты производителя, а не независимый рейтинг, поэтому они показывают прежде всего заявленную позицию модели.

График: Anthropic.
Два следующих графика важнее одного максимального балла: они сопоставляют точность и стоимость одной попытки на разных уровнях усилий. Anthropic утверждает, что в ряде тестов Sonnet 5.5 на низком или среднем уровне усилий обходит лучший результат Sonnet 5 примерно за десятую часть цены одной попытки. При высоком уровне усилий экономическое преимущество сокращается.

График: Anthropic.
Та же цена за токен, другие ограничения
Тариф остался на уровне Sonnet 5: $2 за миллион входных токенов, $10 за миллион выходных и $0,20 за чтение из кэша. Anthropic заявляет, что модель обычно расходует меньше токенов на ту же работу, поэтому задача может обходиться до 30% дешевле; генерация, по её тестам, стала быстрее более чем на 30%.

Источник: Anthropic.
Вместе с ростом кибервозможностей Anthropic добавила защиту уровня Opus: часть высокорисковых запросов будет заметно переключаться на Sonnet 5. Обычная отладка и большинство задач в биологии, по словам компании, не затронуты. Для разработчиков это важная оговорка: Sonnet 5.5 выглядит как новый рабочий вариант для массовых агентов, но не как безусловная замена более сильному Opus в сложных задачах.












