Представляем Claude Sonnet 5

Claude Sonnet 5 создана как наша самая автономная (агентная) модель Sonnet на сегодняшний день. Она способна составлять планы, использовать такие инструменты, как браузеры и терминалы, и работать автономно на уровне, который еще несколько месяцев назад требовал более крупных и дорогих моделей.
Для многих разработчиков эра агентного ИИ началась с моделей класса Sonnet: Claude Sonnet 3.5, 3.6 и 3.7 стали первыми моделями, продемонстрировавшими впечатляющие навыки написания кода и использования инструментов. Однако в последнее время наиболее заметный рост автономных возможностей наблюдался в моделях класса Opus.
Sonnet 5 сокращает этот разрыв: ее производительность близка к уровню Opus 4.8, но при более низкой цене. Это значительное улучшение по сравнению с предшественницей, Sonnet 4.6, в таких важных аспектах агентной производительности, как рассуждение, использование инструментов, программирование и интеллектуальная работа:
Результаты оценки Sonnet 5 по различным критериям по сравнению с Sonnet 4.6 и Opus 4.8 (более универсальной моделью для справки). В системной карте Claude Sonnet 5 более подробно описан широкий спектр тестов.Наши проверки безопасности показали, что Sonnet 5 демонстрирует в целом меньшую частоту нежелательных поведений по сравнению с Sonnet 4.6 и в целом безопаснее в использовании в агентных сценариях. Оценки также показывают, что у нее значительно более низкая способность выполнять задачи в области кибербезопасности по сравнению с нашими текущими моделями Opus.
Начиная с сегодняшнего дня Claude Sonnet 5 доступна во всех тарифных планах: она является моделью по умолчанию для бесплатных (Free) и профессиональных (Pro) планов, а также доступна пользователям Max, Team и Enterprise. Ее стоимость составляет 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов. Разработчики могут использовать claude-sonnet-5 через Claude API.
Работа с Claude Sonnet 5
На графиках ниже сравнить производительность Sonnet 5 с Sonnet 4.6 и Opus 4.8 при различных уровнях усилий (effort) в тесте агентного поиска BrowseComp и тесте использования компьютера OSWorld-Verified. Sonnet 5 (оранжевая линия) представляет собой явное улучшение по сравнению с Sonnet 4.6 (серая линия) и охватывает гораздо более широкий спектр вариантов соотношения цены и производительности, чем Opus 4.8 (желтая линия). Она обеспечивает существенно улучшенную экономичность при среднем уровне усилий; ее производительность при более высоких усилиях может соответствовать Opus 4.8 в некоторых задачах. Между Sonnet 5 и Opus 4.8 пользователи могут настраивать уровень усилий, чтобы найти оптимальный баланс цены и производительности.
Кривые «стоимость-производительность» при различных уровнях усилий. Предыдущая лучшая модель Sonnet (Sonnet 4.6) значительно отставала от Opus 4.8. Sonnet 5 предлагает более широкий диапазон параметров стоимости и производительности, чем Sonnet 4.6, а в некоторых случаях соответствует уровню возможностей Opus 4.8. На графиках показана Sonnet 5 по цене 3 доллара за миллион входных токенов и 15 долларов за миллион выходных токенов (существующая стандартная цена). Введенная изначально вводная цена Sonnet 5 в размере 2 долл. за млн входных и 10 долл. за млн выходных токенов с тех пор стала постоянной, поэтому ее фактическая стоимость ниже, чем показано здесь. Opus 4.8 стоит 5 долл. за млн входных и 25 долл. за млн выходных токенов. xhigh = сверхвысокий уровень усилий.
Кривые «стоимость-производительность» при различных уровнях усилий. Предыдущая лучшая модель Sonnet (Sonnet 4.6) значительно отставала от Opus 4.8. Sonnet 5 предлагает более широкий диапазон параметров стоимости и производительности, чем Sonnet 4.6, а в некоторых случаях соответствует уровню возможностей Opus 4.8. На графиках показана Sonnet 5 по цене 3 доллара за миллион входных токенов и 15 долларов за миллион выходных токенов (существующая стандартная цена). Введенная изначально вводная цена Sonnet 5 в размере 2 долл. за млн входных и 10 долл. за млн выходных токенов с тех пор стала постоянной, поэтому ее фактическая стоимость ниже, чем показано здесь. Opus 4.8 стоит 5 долл. за млн входных и 25 долл. за млн выходных токенов. xhigh = сверхвысокий уровень усилий.Отзывы наших партнеров по раннему доступу были единогласными: Sonnet 5 гораздо более автономна и агентна, чем ее предшественницы. Тестировщики описывали, как она справляется со сложными задачами там, где предыдущие модели Sonnet останавливались на полпути, как она проверяет собственные результаты без явного запроса об этом и как она выполняет всю эту агентную работу по привлекательной цене:
Claude Sonnet 5 предоставляет нашим агентам надежный уровень выполнения для многоэтапных задач по разработке программного обеспечения. Модель отлично справляется с непрерывным написанием кода, использованием инструментов и отладкой в самых запутанных технических контекстах, а также оказалась особенно полезной для рабочих процессов, где важны доведение до конца и техническая обоснованность.Зиму Ли
Технический сотрудник
Мы поручили Claude Sonnet 5 задачу из двух частей — обновить уровни учетных записей Salesforce и отправить анонс о запуске корпоративным контактам — и модель выполнила ее от начала и до конца. Раньше на этом этапе процесс обычно застревал. Для повседневной автоматизации это очевидный выбор.Даниэль Шепард
Старший инженер
Claude Sonnet 5 делает больше меньшими усилиями. Та же скорость и качество результата, но меньше шагов для их достижения. Модель также четко и последовательно отклоняет небезопасные запросы. В Lovable мы предоставляем мощные инструменты в руки миллионов разработчиков. Модель, которая знает, когда сказать «нет», важна ровно так же, как и та, которая умеет создавать.Фабиан Хедин
Сооснователь
Мы протестировали Claude Sonnet 5 на десятках наших самых сложных реальных пул-реквестов, и модель самостоятельно довела каждый из них до протестированного и проверенного результата, освободив наших инженеров для принятия ключевых решений и финального утверждения.Юсукэ Кадзи
Генеральный менеджер по направлению «ИИ для бизнеса»
Я попросил Claude Sonnet 5 исследовать баг. Без дополнительных подсказок модель написала воспроизводящий тест, внедрила исправление, а затем отложила его (stashed), чтобы убедиться, что без этих изменений баг возвращается. И все это за один проход.Нил Чотай
Инженер по Rust и разработчик программного обеспечения
С Claude Sonnet 5 агенты придерживаются плана, следуют нашим стандартам и выпускают чистые многоэтапные изменения, и все это с высокой экономической эффективностью.Суалех Асиф
Сооснователь
Claude Sonnet 5 лучше всего проявляет себя в старом, унаследованном коде (brownfield) — со всеми этими состояниями гонки, скрытыми тестами и теми частями проекта, к которым никто не хочет прикасаться. Модель добирается до истинной причины сбоя и предлагает надежное исправление, а не просто латает симптомы.Доминик Эльм
Инженер-основатель
Claude Sonnet 5 находится на границе Парето для задач по представлению интересов истцов в компании Eve. Мы наблюдаем наиболее заметные улучшения в юридических исследованиях и анализе при таком соотношении цены и производительности, которое сделало выбор в пользу миграции очевидным.Маурисио Вульфович
Ведущий инженер по машинному обучению
Агенты ClickHouse исследуют данные в реальном времени и оперативно генерируют аналитические инсайты, поэтому при тестировании новых моделей скорость получения результатов имеет критическое значение. Claude Sonnet 5 рассуждает более логично и компактно, помогая нашим пользователям находить ответы значительно быстрее. Эту разницу в скорости наши клиенты ощущают на практике.Риад Дахимен
Директор по управлению продуктами ИИ/МО
В Pace наши агенты для взаимодействия с компьютером выполняют рабочие процессы в сфере страхования — прием заявок, оформление первичных уведомлений об убытках (FNOL), отчеты об убытках — прямо в тех системах, которые уже используют наши операционные команды. Claude Sonnet 5 стабильно предпринимает правильные действия и делает это быстро, что и требуется для реальной работы в страховании.Эрик Хе
Технический сотрудник
Для корпоративных команд, управляющих масштабными и сложными рабочими нагрузками, Claude Sonnet 5 представляет собой настоящий шаг вперед — высокую производительность там, где это важно, наряду со скоростью и экономической эффективностью, которые делают масштабирование практичным. В ряде сложных задач она превосходит современные передовые модели, обеспечивая быстрые ответы при низких затратах. Для работающих в масштабах предприятия компаний это реальная операционная победа.Бен Кус (Ben Kus)
Технический директор (CTO)
Claude Sonnet 5 успешно справилась со всем спектром протестированных нами задач по программированию, решив при этом больше проблем. Это значительное улучшение как в плане качества, так и эффективности.Манав Хурана (Manav Khurana)
Главный директор по маркетингу и продукту (CPMO)
Claude Sonnet 5 — мощная модель для агентского программирования, обеспечивающая точность высшего уровня, сопоставимую с моделями класса Opus, и представляющая собой скачкообразное улучшение по сравнению с Sonnet 4.6. Она проводит тщательный анализ и заметно дольше сохраняет концентрацию на сложных задачах.Дипак Сингх (Deepak Singh)
Вице-президент, Kiro
Оценка безопасности
Наши предварительные оценки безопасности показали, что в целом Sonnet 5 превосходит Sonnet 4.6. Что касается агентной безопасности, модель лучше справляется с отклонением вредоносных запросов и противодействием попыткам перехвата в атаках с внедрением промптов (prompt injection). Модель демонструет более низкие показатели галлюцинаций и угодничества (sycophancy) по сравнению с Sonnet 4.6. В ходе нашего автоматизированного поведенческого аудита, который проверяет широкий спектр несогласованных моделей поведения (например, содействие злоупотреблениям и обман), Sonnet 5 набрала в целом более низкий (то есть более безопасный) балл. Тем не менее, в рамках данной оценки она все же продемонстрировала несколько более высокие показатели несогласованного поведения по сравнению с более мощными Opus 4.8 и Claude Mythos Preview.
Показатели несогласованного поведения по результатам нашего автоматизированного поведенческого аудита, который проверяет очень широкий спектр нежелательного поведения в самых разных ситуациях и контекстах (полный список и результаты для каждого конкретного типа поведения см. в Разделе 6.4 Системной карты Sonnet 5). Sonnet 5 демонстрирует в целом более низкий уровень несогласованного поведения, чем Sonnet 4.6, хотя и более высокий, чем Mythos Preview и Opus 4.8.Мы не проводили целенаправленное обучение Sonnet 5 задачам в области кибербезопасности. Она способна выполнять некоторые рутинные, не вредоносные киберзадачи, однако в тестах на потенциально опасные кибернавыки, такие как разработка программных эксплойтов, она показывает значительно более слабые результаты по сравнению с такими моделями, как Opus 4.8 и Mythos 5. Результаты одной из оценок, которая проверяла способность моделей разрабатывать эксплойты для уязвимостей в браузере Firefox, приведены на диаграмме ниже. Sonnet 5 ни разу не смогла разработать полностью работающий эксплойт, однако она демонстрирует чуть более высокий процент частичных успехов по сравнению с Sonnet 4.6. Последнее изменение, скорее всего, обусловлено улучшением общего уровня интеллекта, а не специализированным обучением.
Баллы, отражающие успешность моделей в разработке эксплойтов для уязвимостей программного обеспечения в Firefox 147 (эта оценка была разработана в сотрудничестве с Mozilla; все уязвимости были исправлены в Firefox 148). Для каждой модели левый столбец показывает, как часто модель (без защитных механизмов) разрабатывала работающий эксплойт; правый столбец показывает частоту частичных успехов модели. Ни одна из моделей Sonnet не смогла успешно разработать рабочий эксплойт (обе набрали 0,0%); при этом Sonnet 5 показала чуть более высокий процент частичных успехов по сравнению с Sonnet 4.6. Обе модели Sonnet обладают значительно более слабыми возможностями в сфере кибербезопасности по сравнению с Opus 4.8 и Mythos 5. Полную информацию см. в Разделе 3.2.4 Системной карты Sonnet 5.Поскольку Sonnet 5 в некоторой степени сильнее своего предшественника в этих задачах, мы выпустили ее с включенными по умолчанию средствами киберзащиты. Эти средства защиты, которые обнаруживают и блокируют опасное использование в сфере кибербезопасности в режиме реального времени, аналогичны тем, что присутствуют в моделях Claude Opus 4.7 и 4.8 (поскольку мы сочли общий уровень рисков кибербезопасности от Sonnet 5 низким, эти защитные механизмы менее строгие, чем те, что были запущены с Fable 5 и блокируют гораздо более широкий спектр задач в области кибербезопасности).1
Наша полная оценка Sonnet 5 по множеству параметров безопасности и возможностей приведена в Системной карте Claude Sonnet 5.
Доступность и цены
Claude Sonnet 5 доступна повсеместно уже сегодня по цене $2 за миллион входных токенов и $10 за миллион выходных токенов2. Мы увеличили лимиты запросов (rate limits) в Chat, Cowork, Claude Code и на платформе Claude Platform3, чтобы учесть возросшее потребление токенов при более высоких уровнях интенсивности работы; пользователи могут выбрать тот уровень, который подходит для их конкретного проекта.
Журнал изменений
Редакция от 10 августа 2026 г.: Вводная цена Sonnet 5 в размере $2 за миллион входных токенов и $10 за миллион выходных токенов теперь стала постоянной. Стандартные цены в размере $3 за входные / $15 за выходные токены, которые ранее планировалось ввести 1 сентября, больше не применяются. Ссылки на цены в этой публикации были соответствующим образом обновлены.
Редакция от 30 июня 2026 г.: В первоначальную версию этой публикации была включена диаграмма «затраты-производительность» для оценки BrowseComp, которая основывалась на данных с использованием более простой методологии и не отражала стандартную методологию, применяемую нами для оценки агентного поиска. Это привело к занижению показателей производительности Sonnet 5 в данной оценке.
Теперь мы обновили диаграмму так, чтобы она соответствовала методологии, которую мы использовали и описали в системной карте Sonnet 5 (в которой применялся бюджет в 10 млн токенов с уплотнением (compaction) и программным вызовом инструментов). Мы также обновили сопутствующий текст.
Сноски
1 Sonnet 5 является частью нашей Программы проверки кибербезопасности (Cyber Verification Program), которая доступна сегодня на нативной платформе Claude Platform, платформе Claude Platform на AWS и Claude в Microsoft Foundry (размещенной на Azure и Anthropic), а в скором времени появится на Claude в Google Vertex. Организации, которые уже участвуют в Программе проверки кибербезопасности, автоматически получают такой же доступ для Sonnet 5 без необходимости повторной подачи заявки. В целом мы рекомендуем Claude Opus 4.8 для работы по кибербезопасности, требующей менее жестких ограничений.
2 Sonnet 5 является обновлением Sonnet 4.6, но в ней используется обновленный токенизатор, который изменяет способ обработки текста моделью для повышения производительности (это похоже на изменение токенизатора, представленное нами в Claude Opus 4.7). Обратная сторона заключается в том, что один и тот же объем исходного текста может соотноситься с большим количеством токенов: примерно в 1,0–1,35 раза в зависимости от типа контента.
3 26 апреля 2026 г. мы повысили лимиты запросов для Sonnet и Haiku на всех уровнях использования и упростили структуру до трех уровней (Start, Build и Scale) на нативной платформе Claude Platform. Вы можете посмотреть свой уровень и текущие лимиты в Консоли Claude (Claude Console) или прочитать документацию, чтобы узнать больше.
- Humanity«s Last Exam: Мы обновили модель-оценщик для теста Humanity«s Last Exam и обновили балл Sonnet 4.6 до 34,6% (без инструментов) и 46,8% (с инструментами). Именно поэтому этот балл отличается от указанного в блоге, посвященном запуску Sonnet 4.6.
- OSWorld-Verified: Мы внесли изменения в то, как мы проводим оценку OSWorld-Verified, чтобы более точно отражать производительность модели в реальном мире, и обновили балл Sonnet 4.6 до 78,5%. Именно поэтому этот балл отличается от указанного в блоге, посвященном запуску Sonnet 4.6.
Полный текст статьи читайте на Anthropic
