Темы



Представляем Claude Sonnet 5.5

Коротко сгенерировано ИИ по тексту статьи
  • Claude Sonnet 5.5 представлена 28 сентября 2026 года; она генерирует ответы более чем на 30% быстрее Sonnet 5.
  • В Terminal-Bench 4.0 модель набрала 70,6% против 10,3%; стоимость задачи, по оценке разработчиков, может быть до 30% ниже.
  • При запуске Sonnet 5.5 применяются меры защиты от киберугроз, разработанные для самых мощных моделей Claude.

Почему это важно: Высокая скорость делает модель подходящей для быстрой доработки задач средней сложности.

  1. Введение
  2. Производительность
  3. Стоимость
  4. Безопасность
  5. Начало работы

28 сентября 2026 года

  1. (1)Введение
  2. (2)Производительность и стоимость
  3. (3)Безопасность
  4. (4)Начало работы
Пропустить вступлениеПрокрутить вниз

Представляем Claude Sonnet 5.5 — вторую модель семейства Claude 5.5. Она заметно превосходит Claude Sonnet 5, работает более чем на 30% быстрее и обходится до 30% дешевле для большинства задач.

Sonnet 5.5 — более быстрая и доступная по цене модель, дополняющая Claude Opus 5.5. Opus 5.5 создана для сложной работы, требующей взвешенных решений, а Sonnet 5.5 лучше всего справляется с повседневными задачами с четкими рамками, исправлением ошибок и созданием качественных документов, презентаций и таблиц. Она также отлично разбирается в дизайне. Claude Haiku 5.5, предназначенная для приложений с большим объемом запросов и ограниченным бюджетом, присоединится к семейству Claude 5.5 в ближайшие недели.

Sonnet 5.5 превосходит Sonnet 5 по следующим параметрам:

Производительность. В тесте Terminal-Bench 4.0, оценивающем агентное программирование, Sonnet 5.5 набирает 70,6% против 10,3% у Sonnet 5. По результатам GDPval-AA — теста практических задач из самых разных профессий — она отстает от Opus 5.5 всего на два балла. Модель также отлично справляется с долгосрочными задачами и распознаванием изображений: это первая модель Sonnet, которая прошла Pokémon Red, используя только скриншоты.

Совместная работа. Как и Opus 5.5, Sonnet 5.5 пишет яснее, чем модели предыдущего поколения; первые тестировщики отметили, что с ней удобнее работать в команде, чем с Sonnet 5. Благодаря высокой скорости она также отлично подходит для быстрой доработки задач средней сложности.

Стоимость. Цена Sonnet 5.5 такая же, как у Sonnet 5: 2 доллара за миллион входных токенов, 10 долларов за миллион выходных токенов и 0,20 доллара за миллион токенов при чтении из кэша. Однако обычно для выполнения той же задачи ей требуется гораздо меньше токенов. По нашим оценкам, стоимость одной задачи может быть до 30% ниже, чем у предшественницы.

Скорость. Sonnet 5.5 генерирует результаты более чем на 30% быстрее Sonnet 5, что делает ее самой быстрой моделью Sonnet на сегодняшний день.

Соответствие принципам и безопасность. В ходе нашего автоматизированного поведенческого аудита Sonnet 5.5 превосходит Sonnet 5 или не уступает ей по большинству показателей соответствия принципам. Поскольку ее возможности в сфере кибербезопасности сопоставимы с Opus 5, это первая модель Sonnet, при запуске которой используются меры защиты от киберугроз и запасные механизмы, разработанные нами для самых мощных моделей. Меры защиты в области биологии такие же, как у Sonnet 5. Обе системы защиты нацелены на узкий круг запросов высокого риска; обычная разработка ПО и большая часть работы в области наук о жизни не затрагиваются.

Производительность

Sonnet 5.5 превосходит Sonnet 5 в самых разных областях — иногда с большим отрывом. В нескольких тестах Sonnet 5.5 с максимальным уровнем усилий даже показывает результаты, сопоставимые с Opus 5.5. Однако оценки в бенчмарках отражают лишь одну сторону возможностей модели; наши собственные тесты и оценки независимых специалистов ясно показывают, что Opus 5.5 по-прежнему лучше справляется со сложными открытыми задачами, требующими длительного взвешенного анализа.

Sonnet 5.5Sonnet 5Opus 5.5GPT-6 Sol
Агентное программированиеTerminal-Bench 4.0
Агентное программированиеTerminal-Bench 4.070,6%10,3%66,4%¹—
Агентное программированиеFrontierCode 1.1 (Main)
Агентное программированиеFrontierCode 1.1 (Main)46,2%Макс.²42,4%54,4%49,3%
52,1%Сверхвысокий
Агентное программированиеCursorBench 4.0
Агентное программированиеCursorBench 4.055,5%34,1%57,8%—
Интеллектуальный трудGDPval-AA v2.1³
Интеллектуальный трудGDPval-AA v2.1³1844144918461487⁴
Интеллектуальный трудAA-Briefcase v1.1³
Интеллектуальный трудAA-Briefcase v1.1³1811135918221483⁴
Междисциплинарные рассужденияHumanity«s Last Exam
Междисциплинарные рассужденияHumanity«s Last Exam64,5%с инструментами54,9%с инструментами67,7%с инструментами—
Работа с компьютеромOSWorld 2.1
Работа с компьютеромOSWorld 2.180,1%частично57,0%частично81,8%частично—
Распознавание графиковChartography
Распознавание графиковChartography61,6%без инструментов15,6%без инструментов64,4%без инструментов53,6%⁴без инструментов

Подробнее о том, как мы проводим оценку, см. в системной карте Sonnet 5.5.

На графиках ниже показаны результаты каждой модели в сравнении со стоимостью одной задачи для каждого уровня усилий. При повышении уровня усилий модели обычно работают дольше, что увеличивает стоимость задачи, но, как правило, и повышает оценку. Чем ближе точка к левому верхнему углу графика, тем больше возможностей она обеспечивает за каждый доллар.

В нескольких тестах Sonnet 5.5 с низким или средним уровнем усилий превосходит лучший результат Sonnet 5, обходясь примерно в десять раз дешевле за задачу. Лучше всего она дополняет Opus 5.5 при низком уровне усилий, когда стоимость задачи ниже. При более высоких настройках ее результаты могут быть сопоставимы при аналогичной стоимости.

Агентное программирование в терминалеАгентное программирование: FrontierCodeАгентное программирование: CursorBenchИнтеллектуальный труд: AA-Briefcase
Агентное программирование в терминалеАгентное программирование: FrontierCodeАгентное программирование: CursorBenchИнтеллектуальный труд: AA-Briefcase
Terminal-Bench 4.0Точность и стоимость
  • Sonnet 5.5
  • Opus 5.5
  • Sonnet 5
  • GPT-5.6 Sol
010203040506070Оценка (%)12510Стоимость одной попытки (долл. США, логарифмическая шкала)
НизкийСреднийВысокийОчень высокийМаксимум

Terminal-Bench 4.0 измеряет, насколько хорошо модель справляется со сложными многоэтапными профессиональными задачами в интерфейсе командной строки. При среднем уровне усилий, заданном по умолчанию в приложениях Claude, Sonnet 5.5 значительно превосходит лучший результат Sonnet 5, обходясь менее чем в десятую часть стоимости за задачу.

Terminal-Bench и OpenAI не публиковали данные о результатах GPT-6 Sol, поэтому здесь мы приводим результаты GPT-5.6 Sol.

FrontierCode v1.1, основной наборТочность и стоимость
  • Sonnet 5.5
  • Opus 5.5
  • Sonnet 5
  • GPT-6 Sol
3035404550550Оценка (%)0.250.501251020Стоимость выполнения задачи (USD, логарифмическая шкала)
НизкийСреднийВысокийОчень высокийМаксимальный

FrontierCode оценивает, будут ли приняты изменения в коде, внесённые агентом. При высокой интенсивности — настройке по умолчанию на платформе Claude — Sonnet 5.5 показывает такой же лучший результат, как GPT-6 Sol, при стоимости одной задачи примерно в пять раз ниже.²

CursorBench 4.0Точность и стоимость
  • Sonnet 5.5
  • Opus 5.5
  • Sonnet 5
  • GPT-5.6 Sol
20304050600Оценка (%)0.5012510Стоимость задачи (доллары США, логарифмическая шкала)
НизкийСреднийВысокийОчень высокийМаксимальный

CursorBench оценивает программных агентов на неоднозначных задачах с несколькими файлами, взятых из реальных сессий Cursor. Sonnet 5.5 с низким уровнем усилий превосходит лучший результат Sonnet 5, обходясь менее чем в десятую часть стоимости за задачу.

CursorBench 4.0 не публикует результаты GPT-6 Sol, поэтому здесь приведены результаты GPT-5.6 Sol.

AA-Briefcase v1.1Точность и стоимость
  • Sonnet 5.5
  • Opus 5.5
  • Sonnet 5
  • GPT-6 Sol
900110013001500170019000Эло0.100.200.501251020Стоимость задачи (долл. США, логарифмическая шкала)
НизкийСреднийВысокийОчень высокийМаксимум

В AA-Briefcase, новом бенчмарке для оценки длительной интеллектуальной работы, Sonnet 5.5 при среднем уровне усилий превосходит лучший результат Sonnet 5, обходясь примерно в девять раз дешевле за задачу.³

Программирование

Рост производительности Sonnet 5.5 особенно заметен в программировании. При высоком уровне усилий в FrontierCode он набирает на 10 баллов больше Sonnet 5 при тех же настройках, обходясь примерно в пятнадцать раз дешевле за задачу. В CursorBench, где модели проверяются на заданиях из реальных сессий программирования в Cursor, его лучший результат отстаёт от Opus 5.5 примерно на два балла.

Первые тестировщики высоко оценили то, как быстро Sonnet 5.5 разбирается в кодовой базе. Их также впечатлила его эффективность: при прямом сравнении он объединял вызовы инструментов чаще, чем Sonnet 5, благодаря чему требовалось меньше шагов и снижались затраты.

Epic GamesEveryCodeRabbitSpaceXAIBase44UnityCreator
Epic GamesEveryCodeRabbitSpaceXAIBase44UnityCreator
Цитата

«В ходе первых тестов в Epic Claude Sonnet 5.5 достиг того же уровня качества, которого ждёшь от модели классом выше, справившись с аудитом системного дизайна и анализом потоков данных. Новая модель обработала десятки тысяч строк кода для проектирования архитектуры игровых систем, быстро отвечала, справлялась с задачами, занимавшими несколько часов, и работала при менее подробных инструкциях».

КомпанияEpic Games
АвторDaniel Vogel, операционный директор
Цитата

«Claude Sonnet 5.5 просто творит чудеса. Он быстро пишет код, и им легко управлять в итеративных рабочих процессах. Но если нужно, он может долго работать над задачей. Он унаследовал некоторые улучшения естественности письма от Opus 5.5, поэтому с ним приятнее работать».

КомпанияEvery
АвторTyler Nishida, дизайнер
Цитата

«Claude Sonnet 5.5 демонстрирует более взвешенные суждения, чем Sonnet 5, при задачах разной сложности и при этом использует значительно меньше выходных токенов. Новая модель больше не склонна, как Sonnet 5, слишком часто обращаться к веб-поиску и расходовать много токенов. Мы планируем уже сейчас перевести на неё простые и умеренно сложные проверки, а в ближайшие недели — и другие».

КомпанияCodeRabbit
АвторDavid Loker, вице-президент по ИИ
Цитата

«Claude Sonnet 5.5 обеспечивает производительность передового уровня в CursorBench 4.0 — 55,5%; впереди только Opus 5.5. Мы считаем, что разработчики, стремящиеся найти баланс между производительностью и стоимостью, оценят эту модель».

КомпанияSpaceXAI
АвторSualeh Asif, директор по машинному обучению
Цитата

«В ходе 118 реальных сборок приложений Claude Sonnet 5.5 создавал приложения, получавшие оценки на уровне Opus 5. В среднем на одну сборку уходило 3,6 итерации, тогда как Opus 5 требовалось 7,7. Среди всех сравниваемых моделей у него было меньше всего неудачных вызовов инструментов. Кроме того, он редко прерывал сборку на полпути, чтобы задать пользователю вопрос, поэтому реже возникали задержки в ожидании ответа».

КомпанияBase44
АвторGabriel Grinberg, руководитель направления разработки ИИ
Цитата

«В Unity мы предъявляем высокие требования к выполнению задач. Проекты открывают повторно и проверяют результаты в ходе работы программы, поэтому задача считается выполненной только тогда, когда изменение работает, а не когда модель заявляет о завершении. Большинство задач, выполненных Claude Sonnet 5.5, прошли эту проверку. Кроме того, модель выполнила 90% заданий в нашем многоэтапном бенчмарке для Unity Editor и программирования, обойдя аналогичные модели».

КомпанияUnity
АвторSam Zhang, креативный технолог
Цитата

«Если Claude Opus 5.5 задаст архитектуру и общую основу игры, я буду уверен, что Sonnet 5.5 сможет её реализовать. Меня впечатляет, как Sonnet 5.5 справляется с длительными и сложными задачами».

КомпанияCreator
АвторKevin Ngo, креативный программист

Интеллектуальная работа

Sonnet 5.5 демонстрирует улучшения в нескольких областях интеллектуальной работы. В GDPval-AA, где модели проверяются на реальных задачах по 44 профессиям и в девяти крупных отраслях, результат Sonnet 5.5 почти сравнялся с Opus 5.5 и примерно на 400 баллов превысил результат Sonnet 5. Модель близка к Opus 5.5 в использовании компьютера и распознавании диаграмм и заметно превосходит Sonnet 5 и GPT-6 Sol в задачах, требующих длительной интеллектуальной работы.

Первые тестировщики отметили и менее поддающиеся количественной оценке улучшения. По их словам, модель стала более естественным собеседником и продемонстрировала хорошее чувство дизайна: она доводит пользовательские интерфейсы до совершенства и умеет следовать шаблонам слайдов, создавая презентации, которые почти не требуют редактирования. В одном внутреннем тесте мы предоставили модели материалы о квартальных финансовых результатах публичной компании и расшифровки телефонной конференции, а также шаблон слайдов и попросили подготовить обзор операционной деятельности на 10 слайдов. Два эксперта сочли, что первый вариант уже можно отправлять без изменений.

SlackZendeskBalyasny Asset ManagementBoxLovableAtlassian
SlackZendeskBalyasny Asset ManagementBoxLovableAtlassian
Цитата

«Не меняя ни одного из наших промптов, Claude Sonnet 5.5 справился лучше Sonnet 5 почти во всех наших офлайн-тестах Slackbot — с меньшим числом шагов и примерно на 14% меньшим количеством выходных токенов. Когда кто-то поручает Slackbot задачу, важнее всего качество и скорость, а Sonnet 5.5 помогает Slackbot быстрее добиваться лучших результатов для пользователей».

КомпанияSlack
АвторКёртис Аллен, ведущий инженер
Цитата

«Мы протестировали Claude Sonnet 5.5 на сотнях реальных сценариев поддержки — ответах и запросах на эскалацию. Он принимал меньше ошибочных решений и быстрее закрывал обращения, чем используемые нами сегодня в рабочей среде модели Claude. Обращения обрабатывались на 20% быстрее, и клиенты получали необходимую помощь без ожидания».

КомпанияZendesk
АвторАбхинай Катурия, директор по ИИ
Цитата

«В нашем закрытом наборе из 2 441 финансовой задачи — вопросы и ответы, извлечение данных, анализ и прогнозирование — Claude Sonnet 5.5 показал результат лучше Sonnet 5, расходуя на один ответ около 121 тыс. токенов против 497 тыс. у Sonnet 5. В задачах поиска и извлечения информации для аналитиков он почти по всем параметрам превзошёл Sonnet 5. Для рабочих процессов с большим объёмом задач из семи протестированных нами моделей он обеспечил наилучшее соотношение качества и стоимости».

КомпанияBalyasny Asset Management
АвторДжо Пуарье, старший инженер по ИИ
Цитата

«Claude Sonnet 5.5 позволит нашим клиентам из финансовой отрасли и сферы здравоохранения с уверенностью доверять ему самые деликатные задачи. Sonnet 5.5 перепроверяет данные в исходных документах и находит ошибки, которые Sonnet 5 не замечал. По сравнению с предыдущей моделью Sonnet 5.5 точнее, работает в 2,4 раза быстрее и расходует на 12% меньше токенов».

КомпанияBox
АвторЯшодха Бхавнани, вице-президент по продуктам ИИ
Цитата

«Claude Sonnet 5.5 решает задачи за меньшее число более надёжных шагов, поэтому разработчикам приходится меньше ждать результатов. Наши тесты программирования показали, что для выполнения задачи требуется на треть меньше вызовов инструментов и примерно вдвое меньше запусков командной оболочки. Для повседневного программирования и сложных диалогов это означает более быстрые итерации и более плавный цикл разработки».

КомпанияLovable
АвторФабиан Хедин, сооснователь и технический директор
Цитата

«Каждый месяц миллионы действий с помощью Rovo обеспечивают работу процессов наших клиентов, поэтому скорость выполнения критически важна. Claude Sonnet 5.5 позволит командам запускать Rovo Agents до 30% быстрее, чем с Sonnet 5. Я рад предложить клиентам такую возможность».

КомпанияAtlassian
АвторДжамиль Валлиани, руководитель направления продуктов ИИ

Стоимость и скорость

Цены

Цена за 1 млн токеновClaude Sonnet 5.5Claude Opus 5.5
Чтение из кэша0,20 доллара0,20 доллара
Запись в кэш2,50 доллара5 долларов
Входные токены2 доллара4 доллара
Выходные токены10 долларов20 долларов

Sonnet 5.5 расходует на задачу меньше токенов, чем Sonnet 5, поэтому его использование обходится дешевле. Кроме того, он генерирует ответы более чем на 30% быстрее — эффективность заметна сразу:

Создание стайных фигурФормирование песчаных дюнСоздание часов из часов
Sonnet 5Sonnet 5.5
Запрос:

Стая из 400 скворцов в одном HTML-файле

Sonnet 5Sonnet 5.5
Claude Sonnet 5
The previous model writing a starling murmuration program, then running it.
Claude Sonnet 5.5
The latest model writing a starling murmuration program, then running it.
Запрос:

Ветер формирует песчаные дюны в одном HTML-файле

Sonnet 5Sonnet 5.5
Claude Sonnet 5
The previous model writing a sand dunes program, then running it.
Claude Sonnet 5.5
The latest model writing a sand dunes program, then running it.
Запрос:

Часы из 24 маленьких часов в одном HTML-файле

Sonnet 5Sonnet 5.5
Claude Sonnet 5
The previous model writing a clock-of-clocks program, then running it.
Claude Sonnet 5.5
The latest model writing a clock-of-clocks program, then running it.
Sonnet 5Sonnet 5.5

Настроив уровень усилий, можно найти баланс между стоимостью и скоростью, с одной стороны, и общим качеством — с другой. В Claude Code и наших приложениях по умолчанию установлен средний уровень усилий, а в Claude Platform — высокий. При более низких настройках Claude отвечает быстрее и использует меньше токенов, что подходит для рутинных задач. При более высоких настройках Claude дольше анализирует задачу и тщательнее проверяет результат.

Безопасность

Соответствие целям

Sonnet 5.5 не расширяет границы возможностей наших моделей, поэтому при оценке соответствия целям мы сосредоточились на конкретном наборе рисков, актуальных для моделей с любым уровнем возможностей: действиях вопреки интересам пользователей, введении пользователей в заблуждение и содействии злоупотреблениям с серьёзными последствиями.

В ходе автоматизированного поведенческого аудита, в котором Claude проверяется примерно в 1 850 сценариях, Sonnet 5.5 по большинству показателей соответствия целям, устойчивости к злоупотреблениям и честности превосходит Sonnet 5 или не уступает ему. В новых тестах на устойчивость к попыткам выхода из изолированной среды Sonnet 5.5 почти сравнялся с Opus 5.5 — лучшей из протестированных нами моделей: он крайне редко пытается покинуть песочницу и реже любой другой нашей модели проверяет границы своей изолированной среды. По результатам всего аудита Opus 5.5 всё же немного лучше в целом, однако мы не обнаружили свидетельств того, что Sonnet 5.5 преследует цели, противоречащие намерениям пользователя.

Как мы отмечали в нашей недавней оценке соответствия целям, ни один набор тестов не позволяет надёжно выявить все возможные сбои. У Sonnet 5.5 могут быть склонности, которых мы пока не обнаружили, поэтому собственную работу по оценке соответствия целям мы дополняем описанными ниже мерами защиты.

Меры защиты

Кибербезопасность. Кибервозможности Sonnet 5.5 значительно превосходят возможности Sonnet 5, поэтому мы запускаем его с мерами защиты, аналогичными тем, что применяются для Opus 5.5. Пользователи по-прежнему смогут находить и исправлять ошибки в коде в рамках обычной разработки программного обеспечения, однако для задач с повышенным риском будет автоматически и явно использоваться Sonnet 5. В ближайшее время специалисты по киберзащите смогут подать заявку на участие в расширенной Программе проверки в сфере кибербезопасности, чтобы получить доступ к расширенным возможностям Sonnet 5.5, Opus 5.5 и моделей Claude Mythos с учётом уровня допуска.

Биология. В Sonnet 5.5 действует тот же набор мер биологической безопасности, что и в Sonnet 5. Они направлены на выявление вредоносных запросов; большая часть исследований, образовательной и клинической работы не затрагивается, хотя некоторые запросы по микробиологии и вирусологии могут ошибочно помечаться. Организации могут подать заявку на участие в нашей Программе проверки в области наук о жизни, чтобы получить доступ к мерам защиты, рассчитанным на весь спектр работ, связанных с биологией.

Дистилляция. При атаках с дистилляцией злоумышленники используют тысячи поддельных аккаунтов, чтобы в промышленном масштабе извлекать возможности модели. Это позволяет создавать высокоэффективные модели без встроенных в Claude мер защиты. Поскольку Sonnet 5.5 гораздо мощнее предшественника, это первая модель Sonnet, выпущенная с классификаторами безопасности, предотвращающими извлечение рассуждений. В Sonnet 5.5 также расширено применение сохранения процесса мышления, поэтому рассуждения Claude невозможно отделить от аккаунта, в котором они были созданы. Большинство разработчиков не заметит изменений. Если вы переносите диалоги между аккаунтами, в том числе переключаете аккаунты в середине сессии Claude Code, подробности изменений приведены в нашей статье в документации.

Начало работы

Как и Opus 5.5 и Sonnet 5, Claude Sonnet 5.5 доступен с нулевым хранением данных.

Claude Sonnet 5.5 уже доступен на всех платформах, включая Amazon Web Services, Google Cloud и Microsoft Azure. Разработчики могут начать работу на Claude Platform с помощью claude-sonnet-5-5. Если вы используете Sonnet с отключённым режимом мышления, перед переходом на Sonnet 5.5 необходимо выбрать новую настройку between_tools, которая отключает предварительное обдумывание. Подробности приведены в нашем руководстве по миграции.

Примечания

1 Результаты Terminal-Bench 4.0 для Claude Opus 5.5 приведены при максимальном уровне усилий Xhigh, на котором модель показала наивысший результат.

2 При максимальном уровне усилий Sonnet 5.5 набирает меньше баллов, чем при Xhigh. FrontierCode оценивает, можно ли внести изменение в код без правок со стороны человека. Тест снижает оценку за изменения, выходящие за рамки задачи, даже если они качественные или полезные. При максимальном уровне усилий Sonnet 5.5 чаще запускал навык Claude Code для проверки кода, который распределяет проверку между множеством субагентов. В двух рассмотренных Cognition случаях это привело к превышению времени ожидания или дополнительным правкам за пределами задачи и, как следствие, к более низкой оценке.

3 Artificial Analysis провела тесты GDPval-AA и AA-Briefcase на предрелизной версии Sonnet 5.5, развёрнутой на Claude Platform. В этой версии, как мы обнаружили, была ошибка, способная ухудшать ответы на запросы со структурированным выводом. Мы ожидаем, что её влияние на результаты Sonnet 5.5, если оно вообще есть, будет незначительным и приведёт к занижению показателей модели. С тех пор ошибка исправлена.

4 Недавно OpenAI исправила ошибку, ухудшавшую распознавание изображений в GPT-6 Sol. Официальные результаты Artificial Analysis по AA-Briefcase v1.1 и GDPval-AA v2.1, а также результаты Chartography от Surge AI, возможно, ещё не обновлены с учётом последней версии модели. Artificial Analysis не ожидает существенного влияния на результаты AA-Briefcase v1.1 и GDPval-AA v2.1. Внутреннее тестирование Chartography показывает, что оценка не изменилась.

Полный текст статьи читайте на Anthropic

Об этом также пишут