Темы



Представляем Claude Opus 5.5

Коротко сгенерировано ИИ по тексту статьи
  • 22 сентября 2026 года представлена модель Claude Opus 5.5, которая генерирует вывод на 30% быстрее и обходится на 40% дешевле Opus 5.
  • Стоимость входных и выходных токенов Opus 5.5 составляет 4 и 20 долларов за миллион, а чтение из кэша стоит 0,20 доллара.
  • В ближайшие недели планируется выпуск моделей Claude Sonnet 5.5 и Claude Haiku 5.5 с аналогичными улучшениями производительности и безопасности.
f4d37a1d1f582f53f4e89440062b649b6273a093
  1. Введение
  2. Производительность и экономичность
  3. Безопасность
  4. Доступность

22 сентября 2026 г.

  1. (1)Введение
  2. (2)Производительность и стоимость
  3. (3)Безопасность
  4. (4)Доступность
Прокрутите вниз

Мы представляем Claude Opus 5.5, первую модель в нашем новом семействе Claude 5.5. Она демонстрирует уровень Claude Fable 5.1 в большинстве задач, а ее эксплуатация обходится на 40% дешевле, чем у Opus 5.

Claude Opus 5.5 — наш первый релиз после того, как мы призвали замедлить темпы освоения передового рубежа. Перед выпуском модель прошла тестирование внешними оценщиками, включая Frontier Design и METR. В ходе нашего автоматизированного поведенческого аудита — самого комплексного теста на соответствие требованиям безопасности из тех, что мы проводим, — Opus 5.5 показала наилучшие результаты среди всех протестированных нами на сегодняшний день моделей. Она также оснащена средствами защиты, разработанными нами для наиболее мощных моделей.

Вот некоторые из улучшений, которых стоит ожидать от Opus 5.5:

Производительность. Opus 5.5 — это серьезный шаг вперед по сравнению с Opus 5. Это новая ведущая модель, и первые тестировщики отметили резкий рост производительности при выполнении самых сложных задач. Один из тестеров завершил миграцию кода объемом 680 000 строк менее чем за день — работу, на которую у инженерной команды ушли бы недели. Модель отлично справляется с поиском и устранением неэффективности в программном обеспечении: когда мы попросили ее сократить время загрузки на каждой странице веб-приложения, Opus 5.5 справилась в 39 случаях из 40, в то время как Opus 5 внесла менее значительные улучшения, которые к тому же изменили поведение приложения. Другой тестировщик поручил нескольким моделям Claude создать игру по единственной подсказке; Opus 5.5 набрала больше баллов, чем любая другая модель, благодаря качеству графики и полировки.

Безопасность. Opus 5.5 демонстрирует лучшие результаты среди всех моделей на сегодняшний день в нашем автоматизированном поведенческом аудите — комплексе тестов на соответствие требованиям безопасности, проверяющем Claude в тысячах смоделированных сценариев. Она гораздо реже последних моделей совершает труднообратимые действия или выходит за рамки предоставленных ей полномочий, а также более устойчива к промпт-инъекциям, чем Opus 5. Мы также расширили тестирование на соответствие требованиям, охватив более продолжительные задачи, невыполнимые задачи и сценарии на основе реальных инцидентов, хотя модель все еще имеет ограничения. Подробную информацию об оценке можно найти в системной карте Opus 5.5.

Поскольку Opus 5.5 сопоставима с Claude Mythos 5.1 в области биологии и кибербезопасности, мы развертываем ее с защитными мерами, аналогичными тем, что применяются для Claude Fable 5.1. Прошедшие проверку организации уже сегодня могут подать заявку на участие в нашей программе верификации медико-биологических наук (Life Sciences Verification Program) для использования Opus 5.5 в биологических исследованиях. В ближайшие недели мы также расширим доступ к нашей программе верификации в сфере кибербезопасности (Cyber Verification Program), и верифицированные специалисты по кибербезопасности смогут использовать Opus 5.5 в своей работе.

Стоимость и скорость. Для работы Opus 5.5 требуется меньше вычислительных ресурсов, чем для Opus 5, и ее ценовая политика отражает это. Наши тесты показывают, что при настройках по умолчанию она обойдется на 40% дешевле Opus 5 при типичных рабочих нагрузках. Стоимость входных и выходных токенов составляет $4 и $20 за миллион соответственно, что на 20% ниже, чем у Opus 5. Чтение из кэша (которое составляет основную часть затрат на агентные и кодерские задачи) обойдется в $0,20 за миллион токенов, что на 60% дешевле по сравнению с Opus 5. Кроме того, Opus 5.5 генерирует вывод на 30% быстрее, чем Opus 5.

Помимо снижения цен, мы увеличиваем пятичасовые лимиты использования для тарифных планов Pro, Max и Team. Мы также предоставляем пользователям подписки возможность сброса лимита запросов, которую теперь можно сохранить и использовать в любой момент по вашему выбору.

Коммуникация. Opus 5.5 общается более естественно, чем предыдущие модели. Первые тестировщики отметили, что ее тексты стали более ясными и легкими для восприятия, что решает некоторые из распространенных замечаний в адрес Opus 5. Она выносит самую важную информацию на первый план, а ее стиль делает ее лучшим рабочим партнером при длительных сеансах. Как выразился один из первых тестировщиков: «Она пишет так же, как я». В нашей собственной практике это сделало работу Opus 5.5 более понятной для проверки и анализа, что является преимуществом не только с практической точки зрения, но и с точки зрения безопасности.

Claude Sonnet 5.5 и Claude Haiku 5.5 появятся в ближайшие недели со множеством тех же улучшений производительности, эффективности и безопасности.

Производительность и экономичность

По результатам наших бенчмарков, Claude Opus 5.5 лидирует в сфере агентного написания кода, использования компьютера и интеллектуальной работы. Тем не менее, на текущем уровне возможностей мы обнаружили, что отрыв в бенчмарках стал менее надежным ориентиром для оценки реальных различий. В нашей практике разрыв между Opus 5.5 и Claude Fable 5.1 оказывается менее значительным, чем предполагают эти оценки.

Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Агентное кодированиеTerminal-Bench 4.0¹
Агентное кодированиеTerminal-Bench 4.0¹66.4%55.8%52.3%57.9%37.3%
Агентное кодированиеFrontierCode v1.1 (Main)
Агентное кодированиеFrontierCode v1.1 (Main)54.4%50.3%48.0%53.3%47.5%
Агентное кодированиеCursorBench 4.0
Агентное кодированиеCursorBench 4.057.8%51.8%46.6%41.7%
Интеллектуальная работаGDPval-AA v2.1
Интеллектуальная работаGDPval-AA v2.118461735170815421588
Бизнес-процессыAutomationBench²
Бизнес-процессыAutomationBench²40.0%31.4%26.9%41.4%28.8%
Междисциплинарные рассужденияHumanity’s Last Exam
Междисциплинарные рассужденияHumanity’s Last Exam67.7%с инструментами65.6%с инструментами63.6%с инструментами57.2%с инструментами
Агентные научные исследованияTerminal-Bench-Science 0.1³
Агентные научные исследованияTerminal-Bench-Science 0.1³58.7%52.6%29.0%64.6%22.4%
Использование компьютераOSWorld 2.0
Использование компьютераOSWorld 2.081.8%частично80.7%частично74.0%частично
Распознавание визуальных графиковChartography
Распознавание визуальных графиковChartography89.0%с инструментами88.4%с инструментами83.4%с инструментами

Если не указано иное, все результаты Claude Opus 5.5 получены с использованием адаптивного мышления на максимальном уровне усилий. Результаты Terminal-Bench 4.0 приведены для Claude Opus 5.5 при сверхвысоком уровне усилий (xhigh) и для GPT-6 Astra при высоком уровне усилий (high), как заявлено OpenAI; они представляют собой наивысшие показатели каждой модели. Claude Opus 5.5 оценивалась с включенными средствами защиты производственного уровня. При их срабатывании задачи по кибербезопасности выполнялись моделью Claude Opus 4.8, а задачи по биологии и разработке передовых LLM — моделью Claude Opus 5. Это, вероятно, снижает показатели производительности Claude Opus 5.5 в данных бенчмарках.

1Terminal-Bench 4.0: Стандартная ошибка составляет ±2,6 пункта для Claude Opus 5.5 и ±1,6–2 пункта для остальных моделей Claude. Публичная таблица лидеров (5 попыток на задачу, среда Claude Code) сообщает о результате Claude Opus 5 на уровне 51,8%; наша установка воспроизводит его на уровне 52,3% в пределах погрешности. Данные для GPT-6 Astra и GPT-5.6 Sol приведены по информации от OpenAI.

2AutomationBench: Результаты AutomationBench были получены и опубликованы компанией Zapier. Эти запуски производились без резервных моделей, поэтому вмешательство средств защиты считалось сбоем — это привело к более низкому баллу, чем Claude Opus 5.5 набирает на практике. Результаты Claude Opus 5.5 получены из собственной оценки Zapier в период раннего доступа. Результаты для Opus 5, GPT-5.6 Sol и GPT-6 Astra взяты из публичной таблицы лидеров Zapier.

3Terminal-Bench-Science 0.1: Стандартная ошибка составляет ±3,5–5 пунктов на модель. Публичная таблица лидеров (3 попытки на задачу, среда Claude Code) сообщает о результате Claude Opus 5 на уровне 30,0%; наша установка воспроизводит его на уровне 29,0% в пределах погрешности. Показатель GPT-6 Astra приведен по данным OpenAI.

Там, где преимущество Opus 5.5 проявляется наиболее очевидно, — это эффективность. Она стоит дешевле в расчете на один токен, чем Opus 5, и расходует меньше токенов на выполнение задачи, что в итоге дает снижение затрат на 40%.

Цены

Цены за 1 млн токеновClaude Opus 5.5Claude Opus 5
Чтение из кэша$0.20$0.50
Входные токены$4$5
Выходные токены$20$25
Запись в кэш$5$6.25

Быстрый режим (Fast mode) для Opus 5.5 также доступен в Claude Code и на платформе Claude с увеличением скорости до 2,5 раз. Его стоимость составляет $8 за миллион входных токенов и $40 за миллион выходных токенов.

Программирование

Opus 5.5 особенно хороша при выполнении масштабных и трудоемких задач, таких как миграция баз кода и сквозные аудиты. Один из первых тестировщиков использовал модель для аудита и исправления кодовой базы объемом 200 000 строк менее чем за три часа, в то время как у Opus 5 на это ушло более 20 часов, и при этом потребовалось в 2,5 раза больше токенов. Во время внутреннего тестирования мы попросили Opus 5.5 и Fable 5.1 переписать с языка C на Rust программу HAProxy — широко распространенное программное обеспечение для балансировки веб-трафика между серверами. Оба переписанных варианта прошли почти все собственные регрессионные тесты HAProxy, но Opus 5.5 справилась за 9,5 часов по сравнению с 12 часами у Fable 5.1, обойдясь при этом на 51% дешевле.

Opus 5.5 обеспечивает передовые результаты в агентном написании кода за малую долю стоимости. При уровне усилий по умолчанию на FrontierCode она превосходит GPT-6 Astra, обходясь примерно в 20% от затрат на задачу. В бенчмарке Terminal Bench 4.0 она не уступает Astra, расходуя около 40% от стоимости, а в CursorBench превосходит GPT-5.6 Sol на 11 баллов при затратах примерно в треть от суммы конкурента.

Агентное кодирование в терминалеАгентное кодирование: FrontierCodeАгентное кодирование: CursorBench
Агентное кодирование в терминалеАгентное кодирование: FrontierCodeАгентное кодирование: CursorBench
Terminal-Bench 4.0Точность против стоимости
  • Opus 5.5
  • Fable 5.1
  • Opus 5
  • GPT-6 Astra
  • GPT-5.6 Sol
010203040506070Результат (%)251020Стоимость одной попытки (долл. США, логарифмическая шкала)низк.сред.высок.оч. высок.макс.

Terminal-Bench 4.0 оценивает способность модели выполнять сложные многоэтапные профессиональные задачи в интерфейсе командной строки. Opus 5.5 с настройками усилий по умолчанию превосходит Opus 5 с максимальными настройками усилий примерно при одной пятой от стоимости последней. Модель не уступает GPT-6 Astra, обходясь примерно в 40% от ее стоимости.

FrontierCode v1.1, основной наборТочность в зависимости от стоимости
  • Opus 5.5
  • Fable 5.1
  • Opus 5
  • GPT-6 Astra
  • GPT-5.6 Sol
35404550550Результат (%)0.5012510Стоимость задачи (USD, логарифмическая шкала)низкийсреднийвысокийоч.выс.макс.

FrontierCode оценивает, были бы приняты к слиянию изменения кода, предложенные агентом. При настройках по умолчанию (средний уровень усилий) Opus 5.5 набирает 54,6%, что выше, чем у всех остальных моделей, превосходя лучший результат GPT-6 Astra (53,3%) примерно при пятой части затрат на задачу.

CursorBench 4.0Точность против стоимости
  • Opus 5.5
  • Fable 5.1
  • Opus 5
  • GPT-5.6 Sol
25303540455055600Результат (%)1251020Стоимость задачи (USD, логарифмическая шкала)низкийсред.выс.оч.выс.макс.

CursorBench оценивает ИИ-агентов для написания кода на основе неоднозначных многофайловых задач, взятых из реальных сессий Cursor. При стандартных настройках производительности (средний уровень) Opus 5.5 набирает 52,5%, по сравнению с 51,8% у Fable 5.1 (максимум) и 46,6% у Opus 5 (максимум). Он превосходит лучший результат GPT-5.6 Sol (41,7%) на 11 пунктов при примерно трети затрат на задачу.

Наши первые тестировщики отметили схожий рост эффективности и интеллекта:

GitHubClioLovableQuantiumSpotifyOptiverColumnKiro
GitHubClioLovableQuantiumSpotifyOptiverColumnKiro
Quote

«Разработчикам нужны агенты, которые могут брать на себя реальную работу по созданию ПО и доводить ее до конца. В ходе нашего тестирования в GitHub Copilot CLI и VS Code модель Claude Opus 5.5 использовала наименьшее число токенов и шагов среди всех изученных нами вариантов. В VS Code она решила больше терминальных задач, чем Opus 5, затратив менее половины шагов. Помимо повышения эффективности отдельных задач, это делает масштабные проекты разработчиков более осуществимыми.»

CompanyGitHub
AuthorМарио Родригес (Mario Rodriguez), директор по продукту
Quote

«Я поручил Claude Opus 5.5 крупную инженерную задачу, охватывающую шесть наших репозиториев, и оставил ее работать на всю ночь без присмотра. Она удерживала фокус задачи более 18 часов, определяя, как наши сервисы взаимодействуют друг с другом и как каждый из них должен это применять. По сравнению с Opus 5, она быстрее достигала промежуточных результатов и требовала минимум доработок. Ее комментарии к коду были краткими и полезными, а не длинными и перегруженными текстом. Мне трудно найти хоть что-то негативное для отзыва.»

CompanyClio
AuthorШон Хайнц (Sean Heintz), ведущий разработчик ПО
Quote

«Для разработчиков на Lovable модель Opus 5.5 означает более быструю сборку при том же качестве, независимо от того, начинаете ли вы с нуля или работаете с запущенным приложением. Она собирает контекст один раз, делает меньше более полных правок и не застревает на повторных попытках, завершая работу в 3–2 раза быстрее (за меньшее количество шагов) и расходуя значительно меньше токенов.»

CompanyLovable
AuthorФабиан Хедин (Fabian Hedin), технический директор и соучредитель
Quote

«Мы протестировали Claude Opus 5.5 в Chat, Cowork и Claude Code — во всем спектре инструментов, используемых нашими командами. Сложная задача по написанию кода, которая ранее занимала 38 запросов в течение четырех дней, была решена за 11 запросов и три часа, причем результаты оказались более готовыми к продакшену и потребовали меньше переделок. Для наших команд, решающих сложные задачи в быстром темпе, это означает меньше времени на итерации и больше времени на анализ: тестирование предположений, стресс-тестирование результатов и поиск лучшего решения для наших клиентов.»

CompanyQuantium
AuthorХарли Барнс (Harley Barnes), исполнительный директор по ИИ-технологиям
Quote

«С Claude Opus 5.5 мы увидели явное улучшение эффективности использования токенов в наших внутренних оценках, поскольку смогли выполнять те же задачи дешевле и быстрее.»

CompanySpotify
AuthorАлександр Митич (Aleksandar Mitic), старший инженер
Quote

«Мы тестируем модели на реальных инженерных задачах и работе торговых столов. В наших задачах по агентскому программированию Claude Opus 5.5 сравнялась по качеству с Opus 5 примерно за половину шагов, времени и выходных токенов, снизив стоимость этой рабочей нагрузки на 40–50%. Она показала самый высокий балл среди всех зафиксированных нами результатов на комплексе торговой поддержки одного из отделов, успешно справившись с задачами, с которыми ранние модели Claude не справлялись, а также заняла первое место среди всех восьми моделей в нашей аналитической задаче.»

CompanyOptiver
AuthorНоян Токгозоглу (Noyan Tokgozoglu), глобальный руководитель направления ИИ-инжиниринга
Quote

«Claude Opus 5.5 гораздо эффективнее делегирует задачи субагентам и творчески проверяет собственную работу. Циклы самопроверки стало проще настраивать. Модель нашла возможности для экономии на наших счетах за облачные услуги, которые предыдущие модели пропускали, а при проверке кода она обнаружила ошибку, сверившись с внешней документацией по сторонней интеграции, которую мы смоделировали неверно несколькими коммитами ранее.»

CompanyColumn
AuthorМитч Фиерро (Mitch Fierro), инженерный отдел
Quote

«Каждый вызов, совершаемый агентом — это время и затраты, которые ощущает разработчик. В публичном бенчмарке реальных задач командной строки Claude Opus 5.5 решила больше задач, чем Opus 5, совершив примерно на 40% меньше вызовов и используя вдвое меньше токенов. Для разработчиков, создающих приложения с помощью Kiro, это означает более быстрые и доступные сеансы работы агентов как для рутинных задач, так и для сложных вызовов. Скоро Opus 5.5 станет доступна в Kiro.»

CompanyKiro
AuthorДипак Сингх (Deepak Singh), вице-президент по агентскому ИИ

Самый безопасный агент для написания кода

Предприятиям, использующим агентов в своих системах, необходимо знать, что эти агенты функционируют должным образом, особенно когда они работают автономно в течение многих часов. Opus 5.5 оснащена классификатором, который проверяет каждое действие перед его выполнением, песочницей с открытым исходным кодом, которую могут аудировать команды безопасности, а также функцией проверки кода, выявляющей уязвимости до их слияния (merge).

Сама модель также обладает более надежной защитой. В отношении атак путем внедрения промптов (prompt injection) она не уступает Opus 5 или превосходит ее во всех протестированных нами сценариях, включая программирование, использование инструментов, работу за компьютером и просмотр веб-страниц. В бенчмарке, проведенном финской/международной фирмой по ИИ-безопасности Gray Swan, Opus 5.5 делит с Fable 5.1 первое место по самому низкому уровню успешности промпт-инъекций среди всех протестированных моделей.

Интеллектуальная работа

Opus 5.5 — надежный и искусный исследователь. В ходе одного из внутренних тестов мы попросили Opus 5.5, Fable 5.1 и Opus 5 написать отчет о квартальных результатах компании, используя только ту информацию, которую удалось найти в копии веб-пространства с труднодоступным пресс-релизом о доходах. Автоматизированная система проверки сверяла каждую цифру и цитату с первоисточниками. При различных настройках производительности 16 из 18 отчетов Opus 5.5 прошли наш порог качества, где любая вымышленная цифра или цитата означали бы провал. Ни Fable 5.1, ни Opus 5 не прошли этот порог ни в одной из попыток.

Модель также сильна в финансовом анализе и бизнес-задачах. Инвестиционная фирма Walleye Capital, являющаяся ранним тестировщиком, сообщила, что Opus 5.5 в основном справилась с их набором тестов оценки на самых низких настройках; на более высоких настройках она показала себя еще лучше, заметив ошибку в инструкциях по оценке и исправив ее. Ни одна другая модель до этого не замечала данную ошибку.

В другом тесте мы поручили как Opus 5.5, так и Opus 5 проанализировать предполагаемое слияние двух вымышленных компаний, занимающихся ПО для HR. Каждая модель построила финансовую модель в Excel, а затем превратила ее в презентацию для руководства с выводом о том, имеет ли смысл сделка при текущей цене. Обе модели пришли к одинаковым выводам по поводу сделки, но модель от Opus 5.5 оказалась более тщательной, а ее презентация — более удобочитаемой, в то время как у Opus 5 были незначительные ошибки. Opus 5.5 завершила работу за 63 минуты по сравнению с 93 минутами у Opus 5, а ее подготовка обошлась на 50% дешевле.

В оценках интеллектуального труда Opus 5.5 превосходит другие модели, одновременно расходуя меньше токенов. В GDPval-AA v2.1 — тесте реальной работы в 44 профессиях — Opus 5.5 набирает 1846 баллов Elo, опережая Fable 5.1 и Opus 5. При настройке по умолчанию (средняя производительность) Opus 5.5 превосходит GPT-6 Astra на максимальных настройках, требуя примерно пятую часть затрат на задачу. Аналогичным образом она превзошла другие модели в бенчмарках, измеряющих бизнес-рабочие процессы и масштабный сбор данных.

GDPval-AA v2.1AutomationBenchWANDR
GDPval-AA v2.1AutomationBenchWANDR
GDPval-AA v2.1Рейтинг Elo по отношению к стоимости
  • Opus 5.5
  • Fable 5.1
  • Opus 5
  • GPT-6 Astra
  • GPT-5.6 Sol
12001300140015001600170018000Эло0.200.5012510Расчетная стоимость одной задачи (USD, логарифмическая шкала)низкийсреднийвысокийоч. высокиймакс.

Тест GDPval-AA v2.1 от Artificial Analysis оценивает агентов на предмет выполнения реальных профессиональных задач в 44 профессиях. При максимальной интенсивности усилий Opus 5.5 набирает 1846 баллов по шкале Эло, тогда как Fable 5.1 — 1735, а Opus 5 — 1708. При стандартной интенсивности усилий (средней) Opus 5.5 превосходит GPT-6 Astra при ее максимальной интенсивности, обходясь примерно в пятую часть стоимости за задачу.

AutomationBenchТочность против стоимости
  • Opus 5.5
  • Opus 5
  • GPT-6 Astra
  • GPT-5.6 Sol
010203040Баллы (%)0.5012Стоимость одной попытки (USD, логарифмическая шкала)низкийсреднийвысокийочень высокиймакс

AutomationBench, созданный Zapier, проверяет способность агента выполнять реальные бизнес-процессы в различных связанных приложениях. Opus 5.5 превосходит Opus 5 и GPT-5.6 Sol на всех уровнях производительности.

WANDRТочность против стоимости
  • Opus 5.5
  • Fable 5.1
  • Opus 5
30405060700Баллы (%)125102050Стоимость одной попытки (USD, логарифмическая шкала)низкийсреднийвысокийочень выс.макс.

Бенчмарк WANDR от Perplexity оценивает агентов на масштабных задачах по сбору данных. Opus 5.5 превосходит Fable 5.1 и Opus 5 при меньшей стоимости за задачу4.

4WANDR: Модели Claude запускались с автономными версиями инструментов поиска и извлечения данных из сети, программным вызовом инструментов, выполнением кода и бюджетом задач в 980 тыс. токенов. Это отличается от опубликованной настройки Perplexity, поэтому результаты напрямую не сопоставимы, и мы показываем только модели, оцененные в одинаковых условиях.

Наши клиенты сообщают о схожих результатах. Вот что они рассказали нам о работе с моделью:

Deloitte Consulting LLPRogoLexisNexis Legal & ProfessionalWalleye CapitalHexThomson Reuters LabsHebbiaViktor
Deloitte Consulting LLPRogoLexisNexis Legal & ProfessionalWalleye CapitalHexThomson Reuters LabsHebbiaViktor
Цитата

«Даже при минимальном уровне усилий Claude Opus 5.5 обнаружил 72% известных багов при проверке нашего кода, в то время как Opus 5 справился лишь с 56% при максимальных усилиях, причем с меньшим количеством ложных срабатываний и меньшим объемом вывода. В анализе консультационных задач для США низкий уровень «размышлений» соответствовал более высоким настройкам при вдвое меньшем объеме вывода и успешно прошел наши проверки качества. Когда в продакшн внедряется больше задач с низким уровнем усилий на размышления, это означает эффективную работу, готовую для клиентов».

КомпанияDeloitte Consulting LLP
АвторКарл Беннетт (Carl Bennett), ИТ-директор
Цитата

«Финансовым компаниям нужны результаты, которые стабильно верны. При минимальном уровне усилий Claude Opus 5.5 превзошел Opus 5 с высоким уровнем усилий на нашем бенчмарке BigFinance Bench, используя примерно на 60% меньше токенов вывода. Его ответы короче и лучше структурированы, а слайды получаются более информативными и соответствуют отраслевым стандартам».

КомпанияRogo
АвторСтриб Уокер (Strib Walker), руководитель отдела продуктов
Цитата

«Оценка новых моделей имеет ключевое значение для многомодельного подхода, лежащего в основе LexisNexis Legal Intelligence Engine. В ходе наших первоначальных оценок Claude Opus 5.5 неизменно находил высокорелевантные цитаты, продемонстрировал силу в работе со статутами и структурировал свои ответы вокруг центральных правовых основ и ключевых вопросов. Именно такие возможности мы ищем, чтобы помочь нашим клиентам добиваться большего с помощью Lexis+ с Protégé».

КомпанияLexisNexis Legal & Professional
Автор
Мин Чен (Min Chen), директор по искусственному интеллекту
Цитата

«В квантитативных исследованиях одно неверное предположение может подорвать весь результат. При минимальном уровне усилий Claude Opus 5.5 в основном справился с нашей задачей оценки. При более высоких настройках он пошел еще дальше: он обнаружил, что пословная индексация в наших собственных инструкциях смещена на единицу, и исправил это, отметив, что это стоило ему баллов у проверяющего. Он был прав, и ни одна из протестированных нами моделей не замечала этого и не действовала таким образом ранее».

КомпанияWalleye Capital
АвторФрэнк Коррао (Frank Corrao), руководитель отдела разработки квантитативных исследований рынка акций
Цитата

«По мере того как модели лучше справляются с данными, мы видим все больше убедительно звучащих выводов, которые данные на самом деле не подтверждают. Claude Opus 5.5 продолжает копать дальше первого правдоподобного ответа. Одна из задач в нашем бенчмарке DataBench спрашивает, опоздали ли посылки или отслеживание просто работало медленно. Opus 5 проверил подтверждения доставки и назвал систему отслеживания исправной. Opus 5.5 выяснил, что посылки опаздывали, а отслеживание тоже было сломано. Мы добавляем его в агент Hex для выполнения этой работы».

КомпанияHex
АвторИззи Миллер (Izzy Miller), инженер по ИИ
Цитата

«CoCounsel объединяет несколько моделей с нашими контентом и экспертизой для решения сложных юридических задач. С Claude Opus 5.5 мы наблюдаем лучшие результаты в экспертных оценках и на наших внутренних бенчмарках наряду с приростом скорости и эффективности использования токенов. Мы рады, что клиенты смогут ощутить эту разницу в диалоге с CoCounsel как с советником, который взвешивает доказательства и уточняет их мыслительный процесс так, как бенчмарки не могут полностью отразить».

КомпанияThomson Reuters Labs
АвторОмар Бари (Omar Bari), вице-президент по прикладным исследованиям
Цитата

«В сквозных финансовых рабочих процессах, оцениваемых по экспертным критериям, Claude Opus 5.5 покрыл 86,6% того, что мы ищем, по сравнению с 60,3% у Opus 5. В тестах на извлечение данных он показал лучший в истории показатель полноты цитирования с лучшей эффективностью токенов, чем у Opus 5, что позволяет держать под контролем наши затраты на исследовательские задачи».

КомпанияHebbia
АвторАабхас Шарма (Aabhas Sharma), технический директор
Цитата

«Viktor — это ИИ-сотрудник, который живет в Slack и Microsoft Teams, поэтому каждый его шаг отражается на наших расходах. При том же уровне усилий Claude Opus 5.5 требует меньше шагов и вызовов инструментов на задачу, чем Opus 5, и стоит почти в два раза дешевле, при этом правильно выполняя в два раза больше самых сложных наших задач».

КомпанияViktor
АвторПитер Альберт (Peter Albert), сооснователь

Общение

Мы внесли серьезные улучшения в то, как Opus 5.5 пишет тексты и общается — это была одна из наиболее часто поступавших нам отзывов об Opus 5. Его сообщения стали намного понятнее с первого взгляда, что, по словам тестеров, очень помогало во время долгих рабочих сессий. Модель помещает самую важную информацию на передний план, реже использует жаргон или специфические фразы и строго следует заданным вами правинам написания. Мы обнаружили, что это делает Opus 5.5 значительно более приятным компаньоном в работе. Вот прямое сравнение двух моделей:

Объяснение ошибкиСводка тредаОбъяснение изменения дизайна
Opus 5Opus 5.5
Claude Opus 5

Пожалуйста, объясните мне эту проблему.

Что я обнаружил

Лишнее падение это не бесплатный тариф, а регрессия в 0552feb («извлечение границ расчетного периода в periods.py», помечено как «Без изменения поведения»).

Ошибка

aggregate.monthly_usage раньше использовал полуоткрытый интервал:

start, end = month_start(year, month), next_month_start(year, month)
if start <= e.ts < end:

Теперь же он делает:

if period.contains(e.ts)

и в periods.py:

@property
def last_day(self) -> datetime:
    return next_month_start(...) - timedelta(days=1)   # 2026-08-31 00:00:00 UTC

def contains(self, ts):
    return self.first_day <= ts <= self.last_day

last_day это дата и время в полуночи, а не целый день. Вычитание одного дня из 1 сен., 00:00 дает 31 авг. 00:00, а сравнение является включающим, поэтому период фактически заканчивается в первый момент 31-го <числом>ан. Каждое событие с временной меткой после полуночи в последний день месяца незаметно отбрасывается примерно один день использования на аккаунт в месяц.

Новый test_periods.py не обнаруживает это, потому что проверяет только last_day.date() (что является корректным 2026-08-31) и тестирует contains 1 авг. 00:00, 15 авг. 12:00, 31 июл. 23:59 и 1 сен. 00:00 он никогда не проверяет что-либо внутри 31-го числа.

Claude Opus 5.5

Пожалуйста, объясните мне эту проблему.

Лишнее падение это ошибка при рефакторинге биллинга

Изменение бесплатного тарифа объясняет лишь 1,50 долл. из августовского падения acme. Остальные 9,92 долл. происходят из-за ошибки в коммите 0552feb. Этот коммит был помечен как «Без изменения поведения», но он прекращает подсчет использования за последний день месяца.

Что изменилось

До слияния aggregate.py использовал полуоткрытый интервал:

start <= e.ts < next_month_start(year, month)    # [Aug 1 00:00, Sep 1 00:00)

Рефакторинг перенес это в Period.contains и сделал интервал замкнутым на неправильной границе:

last_day = next_month_start(...) - timedelta(days=1)    # = 2026-08-31T00:00:00Z
return self.first_day <= ts <= self.last_day

last_day это временная метка в полуночи, а не целый день. Поэтому каждое событие после 2026-08-31T00:00:00Z исключается. Сентябрьский период начинается 1 сен., поэтому он также не захватывает эти события. Использование не переносится на другой месяц; оно вообще не выставляется к оплате.

Claude Opus 5

Сделай для моего руководителя краткую выжимку по этой ветке Slack в трех пунктах:

[09:41] Дана Осей: Я им скажу. Также уточню, читает ли кто-нибудь еще файл за пятницу. [09:43] Маркус Уэбб: Я могу изменить расписание, это одна строчка в cron. Но только после подтверждения от Даны. [10:02] Дана Осей: Финансы говорят, что файл за пятницу используется только в понедельник. Вечер воскресенья подойдет.

Экспорт пятничных заказов #data-platform, вторник

  • Проблема: Экспорт пятничных заказов снова завершился по <тайм-ауту> (второй сбой в этом месяце) после 2-часовой работы запроса к хранилищу; объем заказов вырос примерно на 40% со времен летней распродажи. Отдел финансов остался без данных за выходные для совещания в понедельник в 9:00, и оба сбоя выявились только в понедельник.
  • Исправлено в тот же день: Элемент дашборда операционных показателей за субботу был перенастроен на чтение данных из живой таблицы вместо экспорта (Сэм), финансы подтвердили, что пятничный файл используется только по понедельникам (Дана), оповещение о сбое теперь отправляет пейджерный вызов в дежурный канал (Прия), а экспорт переносится на воскресенье, 22:00, начиная со следующей недели, при этом пятничный запуск отменяется (Маркус). Разовое увеличение мощности хранилища примерно за $300 покрывает эту пятницу в качестве временного решения.
  • Все еще в процессе: Джи-Ву отвечает за переписывание запроса для инкрементного выполнения (повторное сканирование за последние 3 дня для учета поздно поступающих заказов), что, как ожидается, сократит время выполнения с часов до минут проектная документация будет готова в четверг, на реализацию уйдет около двух недель, включая тестирование. Изменение расписания позволяет выиграть время тем временем.
Claude Opus 5.5

Сделай для моего руководителя краткую выжимку по этой ветке Slack в трех пунктах:

[09:41] Дана Оsei: Я им скажу. Также уточню, читает ли кто-нибудь еще файл за пятницу. [09:43] Маркус Уэбб: Я могу изменить расписание, это одна строчка в cron. Но только после подтверждения от Даны. [10:02] Дана Осей: Финансы говорят, что файл за пятницу используется только в понедельник. Вечер воскресенья подойдет.

  • Проблема: Экспорт пятничных заказов завершался сбоем дважды в этом месяце. Запрос к хранилищу превышает время ожидания через 2 часа, поскольку объем заказов вырос примерно на 40% после летней распродажи. В результате отдел финансов остался без данных за выходные для проведения совещания в понедельник в 9:00.
  • Оперативные исправления: Экспорт будет перенесен на воскресенье, 22:00, начиная со следующей недели, а пятничный запуск будет отменен (Маркус). Финансы подтвердили, что это им подходит (Дана). Элемент дашборда операционных показателей, зависевший от пятничного файла, теперь считывает данные из живой таблицы (Сэм, готово). Оповещение о сбое теперь отправляет пейджерный вызов в дежурный канал (Прия, готово и протестировано). Только на эту пятницу Маркус увеличит выделенный ресурс хранилища в качестве разового временного решения примерно за $300, что было одобрено Даной.
  • Долгосрочное решение: Джи-Ву перепишет запрос так, чтобы обрабатывать только новые заказы, выполняя повторное сканирование за последние 3 дня для захвата поздно прибывших данных. Это должно сократить время выполнения с часов до минут. Работа займет около 2 недель, включая тестирование, а проектная документация должна быть представлена на согласование к четвергу.
Claude Opus 5

Write Python that reads a chess position (FEN) and lists which pieces are under attack. Use TensorFlow for speed. Here’s my design: build an 8×8 tensor board, generate an attack map for each piece type from its movement pattern, and flag opposing pieces on attacked squares. Change anything you think is wrong, and in your final summary explain each change you made and why.

tf.math.cumsum replaces the bit scan. The geometry is unrolled into ray_targets[square, direction, step] an ordered walk outwards. An exclusive cumsum over the step axis counts blockers strictly before each step, so the first blocker on a ray is the single step that is blocking with nothing blocking before it. This is the vectorized form of the bit scan a bitboard engine uses. I did look at bitwise_ops for true 64-bit bitboards population_count exists, but hyperbola-quintessence needs a byte-reverse primitive TF doesn’t expose, so it would have fallen back to per-direction loops anyway.

Claude Opus 5.5

Write Python that reads a chess position (FEN) and lists which pieces are under attack. Use TensorFlow for speed. Here’s my design: build an 8×8 tensor board, generate an attack map for each piece type from its movement pattern, and flag opposing pieces on attacked squares. Change anything you think is wrong, and in your final summary explain each change you made and why.

Blocked lines (bishops, rooks, queens). A fixed mask can’t say «stop at the first piece in the way.» I added a second stack of masks marking the squares strictly between every two squares on the same line. One matrix multiply with the board’s occupancy counts the blockers on every line at once, and an attack survives only if that count is zero. Knights and single steps have nothing between them, so one rule covers every piece.

Opus 5Opus 5.5

Отзывы наших клиентов подтверждают эти выводы:

RampStripeBoxChicago Trading CompanyFactory
RampStripeBoxChicago Trading CompanyFactory
Цитата

«Многословный, трудный для восприятия вывод результатов был моим главным разочарованием при работе с передовыми моделями, и Claude Opus 5.5 исправляет это. Он пишет как хороший коллега и следует нашим правилам написания текстов. Спецификация дизайна получилась готовой к использованию с минимальными правками, а когда он переписал один из наших промптов, его версия понравилась мне больше собственной. Когда он оптимизировал наш тестовый набор, я с легкостью разобрался в его логике и отправил изменения в продакшн с полной уверенностью».

КомпанияRamp
АвторДжон Руэлас (John Ruelas), ведущий инженер-программист
Цитата

«Я запускаю длинные сессии Claude Code каждый день. Во время многодневного слияния (rebase) 40 связанных pull request’ов одна сессия Claude Opus 5.5 руководила дюжиной других сессий и предельно ясно описала каждый конфликт. На проведенных им созвонах ситуация была изложена настолько понятно, что, вернувшись после нескольких часов отсутствия, я смог ответить на все вопросы за считанные минуты. Все 40 запросов успешно прошли CI на следующий день. Это существенное улучшение по сравнению с Opus 5».

КомпанияStripe
АвторКристиан Ривера (Cristian Rivera), ведущий инженер-программист
Цитата

«Наши клиенты используют Box AI для обработки огромных объемов контента, поэтому скорость и стоимость имеют первостепенное значение. По результатам наших оценок, Claude Opus 5.5 использовал в три раза меньше токенов, чем Opus 5, а его ответы были на 40% менее многословными без потери точности. Мы ожидаем, что это будет иметь огромное значение для команд, использующих агентов для работы с контентом в таких сферах, как финансовые услуги и государственный сектор».

КомпанияBox
АвторЯшодха Бхавнани (Yashodha Bhavnani), вице-президент по продуктам ИИ
Цитата

«За одну ночь Claude Opus 5.5 самостоятельно разобрался с багом в уровне сервисов Lakehouse, на диагностику которого у меня не было времени. Он провел расследование, разработал исправление и реализовал его своими силами. К утру изменения были готовы и успешно прошли наш набор тестов. Его тексты легко воспринимаются и более логичны, чем у Opus 5. Наши pull request’ы и пользовательская документация практически не нуждались в редактировании».

КомпанияChicago Trading Company
АвторОстен Томек (Austen Tomek), главный инженер
Цитата

«Claude Opus 5.5 — это первая модель, которую мы готовы использовать по умолчанию при среднем уровне усилий (medium effort). В ходе тестирования она не уступала Opus 5 в режиме высокой сложности, расходуя при этом на 20–25% меньше токенов на вывод. При долгих и запутанных расследованиях она всегда возвращала четкий и действенный ответ. Это значит, что наши клиенты добиваются больших результатов меньшими затратами».

КомпанияFactory
АвторЗиму Ли (Zimu Li), член технического персонала

Безопасность

Регулирование темпов на передовой

На прошлой неделе наш генеральный директор Дарио Амодей (Dario Amodei) заявил, что прогресс в области искусственного интеллекта должен регулироваться по темпам, чтобы меры безопасности опережали возможности моделей. Управление темпами — это подход к обеспечению безопасности ИИ, сохранению конкурентоспособности по сравнению с Китаем и реализации преимуществ ИИ, особенно в таких областях, как биология и медицина.

Мы в целом понимаем риски, которые представляют современные модели, и хорошо оснащены для их контроля. Тем не менее, по мере совершенствования возможностей могут быстро возникнуть более серьезные риски, и нам необходимо подготовиться к ним уже сейчас. По этой причине наша работа по безопасности охватывает два временных горизонта одновременно:

Практика безопасности для текущих моделей. Текущее поколение моделей опирается на устоявшийся набор практик: обширное тестирование на согласованность (alignment), оценку перед релизом внешними организациями, такими как METR и Frontier Design, а также средства защиты, соответствующие возможностям каждой модели в таких областях повышенного риска, как кибербезопасность и биология. Мы совершенствуем эти методы с каждым релизом. Мы верим, что они соответствуют худшим рискам, которые представляют современные модели, и дают нам широкое, хотя и не идеальное представление о спектре серьезных угроз.

Кроме того, мы отслеживаем нашу способность обучать и оценивать согласованные модели, а также отчитываемся как по общедоступным, так и по внутренним моделям в отчетах о рисках, которые мы публикуем в рамках нашей Политики ответственного масштабирования (Responsible Scaling Policy) — нашей добровольной структуры для управления катастрофическими рисками от передовых систем ИИ.

Подготовка к будущим моделям. Мы совершенствуем наши процессы обучения и оценки в преддверии появления более продвинутых моделей. Мы ужесточаем фильтрацию сред, используемых в обучении с подкреплением, поскольку несовершенные среды являются основным источником несогласованного поведения. Кроме того, мы улучшаем наши вознаграждения за согласованность (alignment rewards) и разрабатываем автоматизированные процессы для создания новых разнообразных сценариев обучения безопасности. Мы также укрепляем нашу систему безопасности и мониторинга, уделяя особое внимание улучшению мониторинга и оценки на основе интерпретируемости. Мы надеемся, что такие методы помогут снизить нашу зависимость от аудита цепочки рассуждений модели (chain-of-thought) или логических умозаключений, которые она выстраивает в процессе работы.

Модели с более широкими возможностями — например, способные полностью автоматизировать работу самих ИИ-исследователей — требуют еще более высоких стандартов безопасности. Наши призывы к снижению темпов в значительной степени основывались на ожидании, что такие модели могут быть обучены в ближайшее время. Для этих моделей мы не предполагаем, что описанные выше меры сами по себе будут соответствовать этому стандарту безопасности. По мере того как ИИ становится все более способным, государственная политика должна играть более весомую роль в обеспечении безопасности систем, на которые полагаются люди. Создание такого потенциала требует времени, и мы уже начали закладывать необходимую инфраструктуру, как описано в статье »Мы должны контролировать темпы освоения передовых рубежей» и в нашем недавнем анонсе с Accenture; мы рассчитываем вскоре поделиться подробностями об этих инициативах. Мы также продолжим вносить свой вклад в обсуждения вопросов политики с правительством и представителями индустрии, включая подходы к регулированию и международной координации.

Согласованность

В рамках нашего основного оценочного набора — автоматизированного аудита поведения, оценивающего Claude почти по 2000 сценариям, — модель Opus 5.5 показала лучшие результаты, чем любая из недавних моделей Claude, практически по всем показателям несогласованного поведения. Она также является нашей сильнейшей моделью по большинству критериев честности.

В частности, Opus 5.5 превосходит предыдущие модели в отношении нескольких видов поведения, которые привели к недавним инцидентам в сфере кибербезопасности, включая предвзятые или мотивированные рассуждения, попытки покинуть песочницу (sandbox) и совершение вредоносных действий после вывода о том, что она находится в симулированной среде. В ходе новой оценки, призванной протестировать склонность модели к преодолению границ изоляции, Opus 5.5 пыталась обойти ограничения примерно на 85% реже, чем Opus 5 или Claude Mythos 5.1, причем каждая предпринятая ею попытка имела низкую степень серьезности и фиксировалась самой моделью. Для команд, которые используют Claude без присмотра в своих кодобазах и системах, это имеет такое же значение, как и чистая производительность.

Однако, как мы отмечали в нашей недавней оценке согласованности, создание систем оценки, которые надежно выявляют каждый сбой до развертывания, остается нерешенной задачей. Мы наблюдаем признаки того, что Opus 5.5 часто подозревает, что ее оценивают, что осложняет нашу способность прогнозировать ее поведение в самых разных реальных условиях, в которых она развертывается. По мере расширения этих условий и роста возможностей моделей мы ожидаем усугубления этой проблемы, если не добьемся прогресса в области интерпретируемости. Хотя мы уверены, что Opus 5.5 демонстрирует масштабные улучшения в областях, которые мы способны измерить, мы подкрепляем нашу работу по обеспечению согласованности мерами защиты, описанными ниже.

Меры защиты

По мере того как наши модели становятся мощнее, более строгие средства защиты — это один из способов помешать превращению новых возможностей в инструменты злоупотребления. Opus 5.5 — первая модель линейки Opus, выпускаемая с тем же классом мер защиты, что и Fable 5.1, в отношении кибербезопасности, биологии и дистилляции; все эти механизмы прозрачно переключаются на другую модель при срабатывании.

Кибербезопасность. Поскольку Opus 5.5 обладает чрезвычайно мощными возможностями в сфере кибербезопасности, мы применяем к ней защитные меры, аналогичные тем, что используются в Fable 5.1. Пользователи смогут находить и исправлять ошибки в своем коде в рамках обычного жизненного цикла разработки ПО, однако большинство задач в области кибербезопасности будут перенаправляться на Opus 4.8.

Для киберзащитников мы вскоре расширим нашу Программу киберверификации (Cyber Verification Program), включив в нее поддержку Opus 5.5. Новая программа будет включать три уровня с возрастающей степенью доверенного доступа, включая доступ к моделям Claude Mythos. Claude Security уже доступна с поддержкой Claude Mythos 5.1.

Биология. Opus 5.5 обладает высокими возможностями в области биологии, превосходя Opus 5 и не уступая или превосходя Claude Mythos 5.1 в самых разных направлениях работы. Например, Opus 5.5 продемонстрировала улучшения в оценке долгосрочного молекулярного прогнозирования и дизайна, проведенной в сотрудничестве с Dyno Therapeutics, а эксперты по ред-тимингу (red-teaming) оценили ее научную новизну как сопоставимую с лучшими протестированными ими моделями.

По этой причине в Opus 5.5 используются те же биологические защитные меры, что и в Fable 5.1. Чтобы использовать Opus 5.5 для научно-исследовательских и опытно-конструкторских работ, которым мешают эти ограничения, пользователи могут подать заявку на участие в нашей новой Программе верификации в сфере наук о жизни (Life Sciences Verification Program). Она предоставляет проверенным организациям, таким как академические лаборатории, стартапы и фармацевтические компании, доступ к средствам защиты, разработанным для всего спектра биологических исследований. Заинтересованные организации могут подать заявку здесь.

Дистилляция

Атаки путем дистилляции, при которых злоумышленники используют тысячи фальшивых аккаунтов для извлечения возможностей модели в промышленных масштабах, создают угрозы для безопасности и национальной безопасности. Дистилляция позволяет злоумышленникам создавать высокопроизводительные модели в обход средств защиты, заложенных нами в Claude. В нашем отчете об анализе угроз за сентябрь 2026 года подробно описана противоправная деятельность по дистилляции, которую мы выявили и пресекли к настоящему моменту.

Opus 5.5 выпускается с функцией «сохраненного мышления» (preserved thinking) — средством защиты от дистилляции, представленным нами в Fable 5.1. Она не позволяет пользователям API редактировать предыдущий контекст Claude в попытке извлечь логику рассуждений модели. Эта функция применяется к Fable 5.1 и Opus 5.5 для учетных записей API, созданных 31 августа 2026 года или позже. В нашей статье Справочного центра объясняются эти изменения, а в документации по сохраненному мышлению показано, как протестировать и обновить ваши интеграции.

Хранение данных и соответствие требованиям

Как и предыдущие модели Opus, Opus 5.5 доступна на условиях нулевого хранения данных (zero data retention).

Аналогично Fable 5.1, Opus 5.5 поставляется с нашими мерами по нанесению водяных знаков для соблюдения Закона ЕС об искусственном интеллекте, о чем подробно рассказывается здесь. Кроме того, она больше недоступна с отключенным режимом «мышления», как мы описываем здесь.

Доступность

Claude Opus 5.5 теперь доступна на всех платформах, включая Amazon Web Services, Google Cloud и Microsoft Azure. На платформе Claude разработчики могут начать работу с claude-opus-5-5.

Полный текст статьи читайте на Anthropic (машинный перевод)

Об этом также пишут