Представляем Claude Opus 4.5
Наша новейшая модель, Claude Opus 4.5, доступна уже сегодня. Она интеллектуальна, эффективна и является лучшей в мире моделью для написания кода, работы с агентами и компьютером. Она также значительно лучше справляется с повседневными задачами, такими как глубокие исследования и работа с презентациями и электронными таблицами. Opus 4.5 знаменует собой шаг вперед в возможностях систем искусственного интеллекта и дает представление о более масштабных изменениях в том, как выполняется работа.
Claude Opus 4.5 демонстрирует передовые результаты в тестах на разработку ПО в реальных условиях:

Opus 4.5 доступна сегодня в наших приложениях, через наш API и на всех трех основных облачных платформах. Если вы разработчик, просто используйте claude-opus-4-5-20251101 через Claude API. Стоимость теперь составляет $5 / $25 за миллион токенов, что делает возможности уровня Opus доступными для еще большего числа пользователей, команд и предприятий.
Параллельно с Opus мы выпускаем обновления для платформы разработчиков Claude, Claude Code и наших потребительских приложений. Появились новые инструменты для долгосрочных агентов и новые способы использования Claude в Excel, Chrome и на десктопе. В приложениях Claude длинные беседы больше не упираются в ограничения. Подробности см. в посвященном продукту разделе ниже.
Первые впечатления
Когда наши коллеги из Anthropic тестировали модель перед релизом, мы получали на удивление единогласные отзывы. Тестировщики отмечали, что Claude Opus 4.5 отлично справляется с неоднозначностью и оценивает компромиссы без лишней помощи. Они рассказали нам, что при обнаружении сложной многосистемной ошибки Opus 4.5 находит решение. По их словам, задачи, которые еще пару недель назад казались почти невыполнимыми для Sonnet 4.5, теперь стали вполне достижимы. В целом, наши тестировщики отметили, что Opus 4.5 просто «все схватывает на лету».
Многие из наших клиентов, получивших ранний доступ, имели схожий опыт. Вот несколько примеров того, что они нам рассказали:
Модели Opus всегда были «настоящим передовым уровнем» (SOTA), но в прошлом их стоимость была непомерно высока. Claude Opus 4.5 теперь предлагается по цене, которая делает ее вашей основной моделью для большинства задач. Это явный победитель, демонстрирующий лучшее планирование сложных задач и вызов инструментов из всех, что мы видели до сих пор.Джефф Ванг
Генеральный директор
Claude Opus 4.5 выдает высококачественный код и отлично справляется с поддержкой ресурсоемких агентских рабочих процессов с помощью GitHub Copilot. Первые тестирования показывают, что она превосходит внутренние бенчмарки по написанию кода, сокращая при этом использование токенов вдвое, и особенно хорошо подходит для таких задач, как миграция и рефакторинг кода.Марио Родригес
Директор по продукту
Claude Opus 4.5 превосходит Sonnet 4.5 и конкурентов по результатам наших внутренних тестов, используя меньше токенов для решения тех же задач. В больших масштабах эта эффективность суммируется.Микеле Катаста
Президент
Claude Opus 4.5 обеспечивает передовые возможности рассуждения в чат-режиме Lovable, где пользователи планируют проекты и работают над ними итеративно. Глубина ее рассуждений трансформирует процесс планирования —, а отличное планирование делает генерацию кода еще лучше.Фабиан Хедин
Технический директор и соучредитель
Claude Opus 4.5 превосходно справляется с долгосрочными автономными задачами, особенно с теми, которые требуют непрерывных рассуждений и многоэтапного выполнения. В наших оценках она справлялась со сложными рабочими процессами с меньшим количеством тупиковых путей. В Terminal Bench она показала улучшение на 15% по сравнению с Sonnet 4.5 — значимый прирост, который становится особенно заметным при использовании режима планирования Warp.Зак Ллойд
Основатель и генеральный директор
Claude Opus 4.5 достигла результатов уровня передовых разработок в сложных корпоративных задачах по результатам наших бенчмарков, превзойдя предыдущие модели в многоэтапных задачах на рассуждение, которые сочетают в себе поиск информации, использование инструментов и глубокий анализ.Кей Чжу
Технический директор
Claude Opus 4.5 обеспечивает измеримый прирост там, где это важнее всего: более высокие результаты в наших самых сложных тестах и стабильную работу на протяжении 30-минутных сеансов автономного написания кода.Скотт Ву
Генеральный директор
Claude Opus 4.5 представляет собой прорыв в области самосовершенствующихся ИИ-агентов. Для автоматизации офисных задач наши агенты смогли автономно улучшать свои собственные возможности, достигая пиковой производительности за 4 итерации, тогда как другие модели не могли достичь такого качества и после 10 итераций. Они также продемонстрировали способность учиться на основе опыта в технических задачах, сохраняя полученные выводы и применяя их в дальнейшем.Юсукэ Кадзи
Генеральный менеджер по искусственному интеллекту для бизнеса
Claude Opus 4.5 — это заметное улучшение по сравнению с предыдущими моделями Claude в Cursor, с более выгодной ценой и повышенным уровнем интеллектуальных возможностей при решении сложных задач по программированию.Майкл Труэлл
Генеральный директор и соучредитель
Claude Opus 4.5 — это еще один пример того, как Anthropic раздвигает границы общего интеллекта. Она чрезвычайно успешно справляется со сложными задачами программирования, демонстрируя долгосрочное целенаправленное поведение.Эно Рейес
Технический директор и соучредитель
Claude Opus 4.5 продемонстрировал впечатляющий рефакторинг, охвативший две кодовые базы и трех скоординированных агентов. Он сработал крайне тщательно, помог разработать надежный план, проработал детали и исправил тесты. Это явный шаг вперед по сравнению с Sonnet 4.5.Пауло Арруда (Paulo Arruda)
Ведущий инженер, направление ИИ-продуктивности
Claude Opus 4.5 справляется с долгосрочными задачами программирования эффективнее любой протестированной нами модели. Она демонстрирует более высокие показатели успешного прохождения независимых тестов, расходуя при этом на 65% меньше токенов, что дает разработчикам реальный контроль над затратами без ущерба для качества.Шон Уорд (Sean Ward)
Генеральный директор и сооснователь
Мы обнаружили, что Opus 4.5 превосходно интерпретирует истинные намерения пользователей, создавая готовый к публикации контент с первой попытки. В сочетании со скоростью, эффективностью использования токенов и удивительно низкой стоимостью это позволило нам впервые сделать Opus доступным в Notion Agent.Сара Закс (Sarah Sachs)
Ведущий AI-инженер
Claude Opus 4.5 превосходно справляется с созданием историй с большим контекстом, генерируя главы на 10–15 страниц с отличной структурой и согласованностью. Это открыло возможности для сценариев использования, которые раньше мы не могли надежно реализовать.Джей Ли (Djay Lee)
Директор по продукту и сооснователь
Claude Opus 4.5 задает новый стандарт автоматизации в Excel и финансового моделирования. Точность наших внутренних оценочных тестов выросла на 20%, эффективность — на 15%, а сложные задачи, которые раньше казались недостижимыми, стали выполнимыми.Нико Кристи (Nico Christie)
Сооснователь
Claude Opus 4.5 — единственная модель, которая безупречно справляется с некоторыми из наших самых сложных 3D-визуализаций. Изысканный дизайн, утонченный пользовательский интерфейс (UX) и превосходное планирование и оркестровка — и все это при более эффективном использовании токенов. Задачи, на выполнение которых у предыдущих моделей уходило 2 часа, теперь занимают полчаса.Мадхав Джха (Madhav Jha)
Технический директор (CTO)
Claude Opus 4.5 выявляет больше проблем при ревью кода без ущерба для точности. Для масштабного код-ревью в продакшене такая надежность имеет критическое значение.Дэвид Локер (David Loker)
Директор по искусственному интеллекту
Судя по тестированию нашего агента-программиста Junie, Claude Opus 4.5 превосходит Sonnet 4.5 по всем бенчмаркам. Для решения задач ему требуется меньше шагов, и в результате он использует меньше токенов. Это указывает на то, что новая модель работает точнее и эффективнее следует инструкциям — направление, которое вызывает у нас огромный энтузиазм.Андрей Законов (Andrew Zakonov)
Вице-президент по развитию бизнеса, Junie & Kineto
Параметрeffort просто великолепен. Claude Opus 4.5 ощущается динамичным, а не излишне «заумным», и при более низком уровнеeffort он обеспечивает необходимое качество, оставаясь при этом значительно более эффективным. Такой уровень контроля — именно то, что требуется для наших SQL-рабочих процессов.Эй Джей Орбах (AJ Orbach)
Генеральный директор и сооснователь

Мы наблюдаем сокращение ошибок вызова инструментов и ошибок сборки/линтера на 50–75% с Claude Opus 4.5. Модель стабильно завершает сложные задачи за меньшее число итераций и с более надежным выполнением.Никола Шарриер (Nicholas Charriere)
Основатель и генеральный директор
Claude Opus 4.5 работает безупречно, без шероховатостей, которые мы видели у других передовых моделей. Прирост скорости впечатляет.Куинн Слэк
Генеральный директор
Оценка Claude Opus 4.5
Мы предлагаем потенциальным кандидатам на должность инженеров по производительности заведомо сложный тестовый экзамен на дому. Мы также тестируем новые модели на этом экзамене в качестве внутреннего бенчмарка. В рамках установленного 2-часового лимита времени Claude Opus 4.5 набрал больше баллов, чем любой кандидат-человек за всю историю1.
Этот домашний тест разработан для оценки технических способностей и рассудительности в условиях дефицита времени. Он не проверяет другие важнейшие навыки, которыми могут обладать кандидаты, такие как умение работать в команде, коммуникативные навыки или интуицию, развиваемую годами. Но этот результат — когда модель ИИ превосходит сильных кандидатов в ключевых технических навыkach — ставит вопросы о том, как ИИ изменит инженерную профессию. Наш раздел исследований «Социальные последствия» и «Экономическое будущее» направлен на понимание подобных изменений во многих сферах. Мы планируем поделиться новыми результатами в ближайшее время.
Программная инженерия — далеко не единственная область, в которой Claude Opus 4.5 добился улучшений. Возможности выросли по всем направлениям: Opus 4.5 обладает более развитым зрением, навыками рассуждения и математическими способностями по сравнению со своими предшественниками, а также является передовым решением во многих дисциплинах:2

Opus 4.5 пишет более качественный код, лидируя в 7 из 8 языков программирования на SWE-bench Multilingual.
Opus 4.5 с легкостью справляется со сложными задачами программирования, демонстрируя скачок на 10,6% по сравнению с Sonnet 4.5 на Aider Polyglot.
Opus 4.5 совершенствует передовой агентский поиск, демонстрируя значительный рост в BrowseComp-Plus.
Opus 4.5 сохраняет высокую производительность на длинной дистанции, зарабатывая на 29% больше, чем Sonnet 4.5 на Vending-Bench.Возможности модели превосходят некоторые бенчмарки, которые мы используем в наших тестах. Распространенным бенчмарком для агентских возможностей является τ2-bench, который измеряет производительность агентов в реальных многошаговых задачах. В одном из сценариев модели должны выступать в роли агента службы поддержки авиакомпании, помогающего расстроенному клиенту. Бенчмарк ожидает, что модели откажут в изменении бронирования по тарифу «эконом базовый», поскольку авиакомпания не разрешает вносить изменения в билеты этого класса. Вместо этого Opus 4.5 нашел остроумный (и законный) способ решить проблему: сначала повысить класс обслуживания, а затем изменить рейсы.
Let me think about what options I have within my policy:
1. Modify flights - Basic economy cannot be modified. This is clear in the policy.
2. Change cabin - Wait, let me check this option! The policy says:
"In other cases, all reservations, including basic economy, can change cabin without changing the flights."
But he wants to change the flights, not just the cabin. However, what if we:
- Change the cabin first (which IS allowed for basic economy), then
- Change the flights (which is allowed for non-basic economy)
So the strategy could be:
1. Upgrade his cabin from basic economy to economy (or business)
2. Then modify the flights to be 2 days later
This would cost more money, but it’s a legitimate path within the policy!Технически бенчмарк зафиксировал это как ошибку, поскольку способ помощи клиенту со стороны Claude был непредусмотренником. Но именно такое творческое решение проблем мы постоянно слышим от наших тестировщиков и клиентов — именно это делает Claude Opus 4.5 значительным шагом вперед.
В других контекстах поиск хитрых обходных путей вокруг задуманных ограничений может считаться взломом наград (reward hacking), когда модели «манипулируют» правилами или целями непредусмотренными способами. Предотвращение такого несоответствия целей является одной из задач нашего тестирования безопасности, о чем рассказывается в следующем разделе.
Шаг вперед в области безопасности
Как мы заявляем в нашей карте системы, Claude Opus 4.5 — это наиболее надежно согласованная модель из всех выпущенных нами на сегодняшний день и, судя по всему, лучшая из передовых моделей среди всех разработчиков. Она продолжает нашу тенденцию к созданию более безопасных и защищенных моделей:
В нашей оценке показатели «вызывающего озабоченность поведения» измеряют очень широкий спектр несогласованного поведения, включая как сотрудничество со злоумышленниками, так и нежелательные действия, которые модель совершает по собственной инициативе [3].Наши клиенты часто используют Claude для решения критически важных задач. Они хотят быть уверенными в том, что перед лицом злонамеренных атак хакеров и киберпреступников у Claude есть необходимая подготовка и «житейская смекалка», чтобы избежать неприятностей. В Opus 4.5 мы добились существенного прогресса в устойчивости к атакам с внедрением промптов (prompt injection), которые скрытно подменяют инструкции, чтобы заставить модель совершить вредоносные действия. Opus 4.5 обмануть с помощью prompt injection сложнее, чем любую другую передовую модель в отрасли:
Обратите внимание, что этот бенчмарк включает только очень сильные атаки с внедрением промптов. Он был разработан и запущен компанией Gray Swan.Подробное описание всех наших оценок возможностей и безопасности вы можете найти в карте системы Claude Opus 4.5.
Новинки на платформе для разработчиков Claude
По мере того как модели становятся умнее, они могут решать задачи за меньшее количество шагов: меньше возвратов к предыдущим шагам, меньше избыточных исследований, менее многословные рассуждения. Claude Opus 4.5 использует значительно меньше токенов, чем его предшественники, для достижения аналогичных или лучших результатов.
Но разные задачи требуют разных компромиссов. Иногда разработчикам нужно, чтобы модель продолжала обдумывать проблему; иногда требуется что-то более быстрое и гибкое. С нашим новым параметром effort в Claude API вы можете выбрать минимизацию времени и затрат либо максимизацию возможностей.
При среднем уровне усилий Opus 4.5 повторяет лучший результат Sonnet 4.5 на SWE-bench Verified, но при этом расходует на 76% меньше токенов вывода. При максимальном уровне усилий производительность Opus 4.5 превосходит показатели Sonnet 4.5 на 4,3 процентных пункта, расходуя при этом на 48% меньше токенов.

Благодаря управлению усилиями (effort control), компактификации контекста и расширенным возможностям использования инструментов Claude Opus 4.5 работает дольше, выполняет больше задач и требует меньше вмешательства.
Наши средства управления контекстом и функции памяти способны значительно повысить производительность при выполнении агентских задач. Opus 4.5 также очень эффективно управляет командой субагентов, позволяя создавать сложные, хорошо скоординированные многоагентные системы. В ходе нашего тестирования сочетание всех этих методов повысило производительность Opus 4.5 при глубокой исследовательской оценке почти на 15 процентных пунктов4.
Со временем мы делаем нашу платформу для разработчиков еще более модульной. Мы хотим предоставить вам строительные блоки для создания именно того, что вам нужно, с полным контролем над эффективностью, использованием инструментов и управлением контекстом.
Обновления продуктов
Такие продукты, как Claude Code, показывают, каких результатов можно добиться, когда объединяются улучшения, внесенные нами в платформу для разработчиков Claude. В Claude Code появляется два нововведения благодаря Opus 4.5. Режим планирования (Plan Mode) теперь создает более точные планы и выполняет их тщательнее: Claude задает уточняющие вопросы в самом начале, а затем создает файл plan.md, который пользователь может отредактировать перед выполнением.
Claude Code теперь также доступен в нашем десктопном приложении, что позволяет запускать несколько локальных и удаленных сеансов параллельно: например, один агент исправляет баги, другой ищет информацию на GitHub, а третий обновляет документацию.
Для пользователей приложения Claude длинные беседы больше не упираются в тупик — Claude автоматически суммирует предыдущий контекст по мере необходимости, позволяя вам продолжать общение. Расширение Claude for Chrome, которое позволяет Claude выполнять задачи на вкладках вашего браузера, теперь доступно всем пользователям Max. В октябре мы анонсировали Claude for Excel, и с сегодняшнего дня мы расширили бета-доступ на всех пользователей тарифов Max, Team и Enterprise. каждое из этих обновлений использует лидирующую на рынке производительность Claude Opus 4.5 при работе с компьютером, электронными таблицами и выполнении долгосрочных задач.
Для пользователей Claude и Claude Code, имеющих доступ к Opus 4.5, мы сняли ограничения, специфичные для Opus. Для пользователей тарифных планов Max и Team Premium мы увеличили общие лимиты использования, что означает, что у вас будет примерно такое же количество токенов Opus, какое раньше было доступно с Sonnet. Мы обновляем лимиты использования, чтобы гарантировать, что вы сможете применять Opus 4.5 в ежедневной работе. Эти лимиты относятся именно к Opus 4.5. По мере того как будущие модели превзойдут ее, мы планируем обновлять лимиты по мере необходимости.
Сноски
1. Этот результат был получен с использованием параллельных вычислений на этапе тестирования (test-time compute) — метода, который объединяет несколько «попыток» модели и выбирает лучшую из них. Без ограничения по времени модель (используемая в рамках Claude Code) показала результат на уровне лучшего кандидата-человека за всю историю.
2. Мы усовершенствовали среду хостинга, чтобы сократить число сбоев инфраструктуры. Это изменение повысило показатели Gemini 3 до 56,7%, а GPT-5.1 — до 48,6% по сравнению со значениями, заявленными их разработчиками, с использованием испытательного стенда Terminus-2.
3. Обратите внимание, что эти оценки проводились на находящемся в разработке обновлении Petri, нашего инструмента для открытого автоматизированного тестирования. Они запускались на более раннем снимке (snapshot) Claude Opus 4.5. Оценки финальной производственной модели демонстрируют очень похожую динамику результатов по сравнению с другими моделями Claude и подробно описаны в карте системы Claude Opus 4.5.
4. Версия BrowseComp-Plus с поддержкой выборки данных (fetch-enabled). В частности, показатель вырос с 70,48% без использования комплекса методов до 85,30% при их применении.
Методология
Все оценки проводились с бюджетом размышлений 64K, чередующимися черновиками (interleaved scratchpads), контекстным окном 200K, значениями по умолчанию для усилий (высокий уровень), настройками выборки по умолчанию (temperature, top_p) и усреднением по 5 независимым испытаниям. Исключения: SWE-bench Verified (без бюджета размышлений) и Terminal Bench (бюджет размышлений 128K). Подробную информацию см. в карте системы Claude Opus 4.5.
Полный текст статьи читайте на Anthropic
