Anthropic представила Claude Sonnet 5 для ИИ-агентов

Anthropic представила Claude Sonnet 5 для ИИ-агентов

Anthropic представила Claude Sonnet 5 — новую версию своей средней по размеру модели с упором на автономную работу и использование инструментов.

В блоге компании говорится, что модель может строить планы, работать с браузером и терминалом и выполнять задачи самостоятельно на уровне, для которого ещё несколько месяцев назад требовались более крупные и дорогие модели.

Такую подачу Anthropic использует на фоне похожих релизов у конкурентов. OpenAI на прошлой неделе выпустила в превью GPT-5.6 Sol, которая тоже позиционируется как самая агентная модель компании и позволяет распределять задачи между субагентами для длительной автономной работы. Google в мае представила Gemini 3.5 Flash как инструмент, который может планировать, создавать и дорабатывать реальные задачи с минимальным участием человека.

Релиз Sonnet 5 показывает, что агентные функции стали базовым требованием для моделей в разных ценовых категориях. По сути, ключевым фактором теперь становятся стоимость таких возможностей и качество работы без постоянного контроля со стороны человека.

По данным Anthropic, Sonnet 5 по уровню работы близка к Opus 4.8, но обходится заметно дешевле. С вторника модель станет стандартной для бесплатного и Pro-тарифов Claude и будет доступна во всех подписках.

На старте цена составляет 2 доллара за 1 млн входных токенов и 10 долларов за 1 млн выходных токенов до 31 августа. После этого стоимость вырастет до 3 долларов за 1 млн входных токенов при прежней цене в 10 долларов за 1 млн выходных токенов.

Anthropic отмечает, что Sonnet 5 дешевле Opus 4.8, а также OpenAI GPT-5.5 и Gemini 3.1 Pro. При этом модель всё ещё дороже, чем Gemini 3.5 Flash.

По данным компании, новая версия заметно прибавила по сравнению с Sonnet 4.6, выпущенной в феврале. Улучшения касаются рассуждений, работы с инструментами, программирования и задач интеллектуального труда.

В одном из бенчмарков на агентное программирование Sonnet 5 набрала 63,2% против 69,2% у Opus 4.8 и 58,1% у Sonnet 4.6. В тесте на задачи интеллектуального труда новая модель немного опережает Opus 4.8, которую Anthropic описывает как модель для самых трудных задач, где важны тонкие суждения и глубокое исследование темы.

«Opus 4.8 по-прежнему остаётся предпочтительным вариантом для более высокой точности в этих задачах, но Sonnet 5 даёт разработчикам более доступный по цене вариант с качеством заметно выше того, что было доступно раньше», — заявили в Anthropic.

Компания добавила: «Между Sonnet 5 и Opus 4.8 пользователи могут подобрать уровень усилий, чтобы найти нужный баланс между стоимостью и производительностью».

По словам тестировщиков, на которых ссылается Anthropic, Sonnet 5 лучше справляется со сложными многошаговыми задачами, где прошлые версии модели останавливались на полпути, и проверяет собственный результат даже без прямого запроса.

«Мы дали Claude Sonnet 5 задачу из двух частей — обновить уровни аккаунтов в Salesforce и отправить объявление о запуске корпоративным контактам — и она выполнила её от начала до конца», — сказал старший инженер Zapier Дэниел Шепард. «Раньше процесс застревал на середине. Для повседневной автоматизации это очевидный выбор».

В части безопасности Anthropic сообщает о снижении доли нежелательного поведения по сравнению с Sonnet 4.6. Речь идёт о готовности содействовать злоупотреблениям и о вводящем в заблуждение поведении. Модель также лучше отклоняет вредоносные запросы и попытки перехвата через prompt injection.

Кроме того, Sonnet 5 реже допускает галлюцинации и реже подстраивается под пользователя в ущерб точности, чем Sonnet 4.6.

При этом компания уточняет, что по поведению при отклонении от заданных правил Sonnet 5 уступает Opus 4.8 и Claude Mythos Preview. В блоге сказано: «Оценки также показывают, что её способность выполнять опасные задачи в кибербезопасности значительно ниже, чем у наших текущих моделей Opus».

Сооснователь Lovable Фабиан Хедин заявил, что Claude Sonnet 5 «чётко и последовательно отказывает в небезопасных запросах».

«В Lovable мы даём мощные инструменты миллионам создателей продуктов», — сказал Хедин. «Модель, которая понимает, когда нужно отказаться, так же важна, как и модель, которая умеет создавать».

Источник: блог Anthropic.