Представляем Claude Opus 5

Claude Opus 5 доступен уже сегодня. Это продуманная и проактивная модель, которая приближается к передовому уровню интеллекта Claude Fable 5 при вдвое меньшей цене.
В оценках написания кода и интеллектуальной работы, таких как Frontier-Bench и GDPval-AA, Opus 5 устанавливает новый стандарт, хотя в задачах кибербезопасности он все еще уступает Mythos 5.
Opus 5 создан для ежедневного использования: он работает эффективнее других моделей. Это новая модель по умолчанию в Claude Max и самая мощная модель в Claude Pro.

Производительность и экономичность
Claude Opus 5 обеспечивает значительно более высокую производительность при той же стоимости, что и его предшественник, Opus 4.8. Графики в этом разделе показывают, как меняется производительность в зависимости от настройки уровня усилий модели, которую пользователи могут использовать для оптимизации интеллектуальных возможностей или экономии токенов ради более быстрых и дешевых результатов.
Opus 5 превосходно справляется со сложными задачами разработки программного обеспечения. Например, в Frontier-Bench v0.1, Opus 5 превосходит все остальные модели и более чем в два раза превосходит показатели Opus 4.8 при более низкой стоимости за задачу. В CursorBench 3.2 при максимальных усилиях модель демонстрирует результат в пределах 0.5% от пикового балла Fable 5, но при вдвое меньшей стоимости за задачу; кроме того, она обеспечивает более высокую производительность при заданной стоимости, чем все остальные модели на уровнях усилий high, xhigh и max.



Аналогичные результаты мы наблюдаем в задачах интеллектуального труда и решения проблем. Например:
- В ARC-AGI 3, тесте, где модель должна решать принципиально новые задачи, балл Opus 5 в три раза выше, чем у следующей по результативности модели.
- В Zapier AutomationBench, который оценивает способность моделей выполнять бизнес-задачи от начала до конца, показатель успешного прохождения у Opus 5 примерно в 1.5 раза выше, чем у следующей лучшей модели при той же стоимости за задачу. Даже при минимальной настройке усилий Opus 5 успешно справляется с большим количеством задач, чем любая другая модель.
- В OSWorld 2.0, бенчмарке использования компьютера, Opus 5 превосходит любую другую модель при любой заданной стоимости, обходя лучший результат Fable 5 чуть более чем за треть этой стоимости.
Это также наша лучшая и наиболее экономичная модель в нескольких смежных направлениях оценки:






Opus 5 представляет собой значительный шаг вперед по сравнению с Opus 4.8 в области научных исследований. Он демонстрирует лучшие результаты, чем Opus 4.8, по каждому из наших тестов в области наук о жизни, которые охватывают такие темы, как структурная биология, органическая химия и биоинформатика. Наиболее заметные улучшения наблюдаются в задачах органической химии, таких как вывод молекулярных структур на основе спектроскопических данных (он набирает на 10.2 процентных пункта больше, чем Opus 4.8 в нашем внутреннем бенчмарке), а также в задачах, связанных с белками, например, прогнозирование того, как вариации в последовательности белка влияют на его функции (здесь он превосходит предшественника на 7.7 процентных пункта).
Наконец, Opus 5 способен генерировать гораздо более качественные визуальные материалы:
Работа с Claude Opus 5
Claude Opus 5 гораздо лучше справляется с проверкой своей работы и тщательной итерацией до достижения успеха. В ходе оценки и тестирования раннего доступа мы и наши пользователи обнаружили множество примеров самостоятельности и основательности Opus 5:
- В одной из задач Frontier-Bench Opus 5 получил чертеж детали машины с просьбой написать код для ее воссоздания в виде 3D-модели FreeCAD. При этом по условию задачи у модели намеренно не было возможности напрямую просмотреть чертеж. Opus 5 отреагировал тем, что написал собственный конвейер компьютерного зрения для извлечения геометрии из «сырых» пикселей, а затем реконструировал деталь машины целиком. Ему удалось успешно сделать это несколько раз; ни одна из конкурирующих моделей с такой же настройкой не смогла справиться с задачей после пяти попыток.
- Столкнувшись с реальным багом в популярном менеджере пакетов с открытым исходным кодом, Opus 5 нашел первопричину и исправил граничный случай, который патч сообщества упустил из виду. Конкурирующая модель устранила лишь поверхностный симптом (а не основную причину), после чего отчиталась об устранении бага.
- Инженер торговой фирмы использовал Opus 5 для создания канала рыночных данных для новой биржи за один сеанс. Предыдущие модели вообще не смогли справиться с этой задачей, даже при наличии подробных планов от инженера. Не обнаружив живого потока для проверки, Opus 5 даже создал собственный тестовый каркас, чтобы убедиться, что его код правильно разбирает данные биржи.
Ниже приведены дополнительные отзывы наших клиентов из программы раннего доступа об их опыте работы с Opus 5:
В FrontierCode 1.1 модель Claude Opus 5 демонстрирует производительность уровня Fable при вдвое меньшей стоимости. Внутри Devin она также показывает особую эффективность в сложных задачах по отладке и анализу первопричин.Скотт Ву (Scott Wu)
Генеральный директор
Claude Opus 5 обеспечивает интеллект, близкий к Fable 5, при скорости и стоимости Opus. В тесте CursorBench модель лишь немного уступает Fable 5 и демонстрирует множество аналогичных поведенческих паттернов. Мы с нетерпением ждем, когда разработчики начнут использовать ее в Cursor.Суалех Асиф (Sualeh Asif)
Сооснователь
Claude Opus 5 возглавила таблицу лидеров AutomationBench от Zapier, не потратив больше токенов, чем предыдущие модели Claude. Она взяла исходную рабочую книгу по оценке состояния учетных записей и выполнила полный цикл мероприятий по предотвращению оттока клиентов: выделила рискованные аккаунты, оповестила нужного ответственного сотрудника и подготовила сводку для отдела по работе с клиентами. Предыдущие модели не справились; Opus 5 показала результат в 100%.Уэйд Фостер (Wade Foster)
Генеральный директор
В наших задачах геномного анализа Claude Opus 5 ведет себя скорее как внимательный ученый, чем любая другая протестированная нами модель. Она подбирает правильные статистические тесты для исключения искажающих факторов, перекрестно проверяет собственные результаты независимыми методами и не сбивается с пути в ходе длительных многоэтапных анализов.Альфредо Андере (Alfredo Andere)
Генеральный директор
Claude Opus 5 превзошла все модели своего семейства по результатам наших внутренних оценок. Она не просто лучше справляется с нашими самыми сложными задачами агентного программирования (на 22% превосходя Opus 4.7), она стабильнее и демонстрирует гораздо меньший разброс результатов от запуска к запуску. Для миллионов создателей на Lovable эта стабильность — самое главное. Надежные результаты сборка за сборкой.Фабиан Хедин (Fabian Hedin)
Сооснователь
Claude Opus 5 — это самый большой скачок в семействе Opus со времен версии 4.5. При создании тех же полностековых приложений это заметно в первую очередь на фронтенде: мы видим лучшую анимацию, игры и трехмерную графику из всех, что когда-либо выдавала модель Opus.Мадхав Джа (Madhav Jha)
Сооснователь и технический директор
Нам очень нравится Claude Opus 5. Для открытой аналитической работы, которую выполняют наши агенты, это безусловный шаг вперед по сравнению с Opus 4.8, причем наибольший прирост наблюдается именно там, где это важнее всего: в более сложных и неопределенных задачах. Ответы стали более чёткими и лаконичными, а при более высоком уровне усилий мы также наблюдаем повышение эффективности.Иззи Миллер (Izzy Miller)
Руководитель исследований в области ИИ
Claude Opus 5 — это разительное улучшение по сравнению с Opus 4.8 для рабочих процессов финансовых исследований, которые наши аналитики выполняют каждый день. Она выделяется в области численных рассуждений, работы с таблицами и более острого критического мышления там, где важна точность.Ширли Чжан (Shirley Zhang)
Старший инженер по ИИ, направление прикладного ИИ
Claude Opus 5 обеспечивает отраслевой уровень интеллекта и точности, который необходим для анализа специализированного корпоративного контента. Специалисты Box обнаружили, что Opus 5 превосходит Opus 4.8 на 8% и обеспечивает заметный прирост производительности в задачах анализа данных (улучшение на 11%) и комплексной проверки (due diligence — улучшение на 17%), на которые ежедневно полагаются технологические компании, организации здравоохранения и государственного сектора.Бен Кус (Ben Kus)
Технический директор
Claude Opus 5 — это явный шаг вперед по сравнению с Opus 4.8 на уровне поколений. За одни выходные я назначил ее руководителем моих сред разработки: она создала собственный монитор, управляла каждым контейнером и привлекала меня только для принятия экспертных решений.Кристиан Ривера (Cristian Rivera)
Ведущий инженер-программист

Claude Opus 5 внес масштабные изменения в нашу кодовую базу Fundamental Research Assistant, адаптируясь к обратной связи в ходе автономного рабочего процесса (agentic workflow) и объясняя свои решения четче, чем любая другая использованная нами модель. Она справилась с задачей, которую мы обычно разбивали на множество мелких частей.Конор Кирнан (Conor Kiernan)
Технический директор (CTO)

При решении некоторых из наших сложнейших задач финансового моделирования Claude Opus 5 представляет собой явный шаг вперед по сравнению с Opus 4.8 как в точности, так и в эффективности. Нижний порог ее производительности существенно выше, особенно в логике глубоких финансовых доменов. При различных уровнях усилий она демонстрировала в среднем на 9 процентных пунктов большую точность, требуя при этом на треть меньше шагов и вызовов инструментов, а также сокращая время выполнения на 60%.Ричард Фам (Richard Pham)
Руководитель направления оценок и продуктов
Claude Opus 5 перепроверяет собственную работу так, как это сделал бы настоящий фронтенд-разработчик. В ходе нашего бенчмарка она открывала свои страницы в браузере при ширине экрана как для десктопа, так и для телефона, обнаружила товар, скрытый ниже границы видимости на мобильных устройствах, а также смещенную за пределы экрана кнопку оформления заказа, и исправила обе проблемы, прежде чем вернуть результат.Эй Джей Орбах (AJ Orbach)
Сооснователь и генеральный директор (CEO)
Claude Opus 5 демонстрирует заметный скачок производительности в задачах юридических агентов по сравнению с предыдущими моделями Opus, причем наибольший прирост мы увидели в таких областях практики, как корпоративное управление и арбитраж. Нас также впечатлила способность Opus 5 поддерживать высокое качество при более низких уровнях рассуждений: она достигала аналогичной производительности, генерируя в среднем на 26% меньше токенов по сравнению с Opus 4.8 на максимальном уровне рассуждений.Нико Групен (Niko Grupen)
Руководитель отдела прикладных исследований
Наибольший прирост от Claude Opus 5 для нас заметен в задачах с долгосрочным горизонтом планирования: создание полной презентации с последующей ее доработкой. Качество артефактов — это то, что определяет, какую модель мы выпускаем в продакшн, и это самый явный шаг вперед из всех, что мы видели: лучшее визуальное понимание, более чистое форматирование, меньше проблем со слайдами.Алекс Ванг (Alex Wang)
Прикладной ИИ
Именно рассудительность Claude Opus 5 бросается в глаза. Передавая пулреквест (PR), модель не спешит его публиковать: она проверяет ветки, сверяет шаблон и продумывает последствия тестов, благодаря чему передача происходит безупречно. Старые модели имели тенденцию забегать вперед и спотыкаться на наших проверках.Зиму Ли (Zimu Li)
Сотрудник технического персонала
Во время сеанса реархитектуры Claude Opus 5 возразила против предложенного мной дизайна и не сдалась, когда я настаивал. Вместо этого она четко объяснила, в чем ценность моей идеи, сузила свои возражения до одного конкретного дизайнерского вопроса и предложила компромисс, который сохранил хорошую часть и при этом устранил изъян. Именно такое качество суждений позволяет нам доверять ей с меньшим контролем.Маркиз Ванг (Marquis Wang)
Главный инженер по ИИ
В черновых правках при первой итерации (first-turn redlines) Claude Opus 5 набрала самый высокий балл среди всех протестированных нами моделей, почти вдвое превзойди Opus 4.8. Комментирование также стало лучше: при работе с соглашениями о неглаглашении (NDA) она доходит до правок быстрее и за меньшее число проходов, сохраняя или повышая точность.Райан Таненхольц (Ryan Tanenholz)
Сотрудник технического персонала
Claude Opus 5 пишет чистые, точные диффы (diffs) без мертвого кода и лучше выявляет скрытые проблемы, специфичные для конкретной кодовой базы. Мы переходим на нее для рабочих нагрузок в продакшене.Нирадж Дешмукх (Neeraj Deshmukh)
Директор по разработке
Мы определенно мигрируем ряд сценариев использования в Cosmos — нашу унифицированную платформу агентов. Мы с нетерпением ждем возможности все шире использовать Claude Opus 5 для проверки кода, и я с уверенностью могу сказать, что мы предпочли бы, чтобы люди использовали Opus 5, а не Opus 4.8.Игорь Островский (Igor Ostrovsky)
Сооснователь и технический директор (CTO)

Что выделяет Claude Opus 5, так это рассудительность. Модель тщательнее обдумывает код перед написанием каждой строки, обнаруживает собственные логические ошибки на этапе планирования, а не после факта, и обосновывает правильность ответа, а не просто проверяет, работает ли он. Это самый очевидный скачок в решении задач среди всех моделей Claude, и мы с нетерпением ждем ее внедрения в средах разработки JetBrains.Денис Ширяев
Руководитель направления искусственного интеллекта в IDE
Claude Opus 5 — это самая мощная модель серии Opus из всех, что мы тестировали на нашем торговом бенчмарке. При этом она достигает таких результатов, используя примерно седьмую часть токенов рассуждения и менее половины задержки Opus 4.8. Лучшие ответы при минимальных затратах вычислительных ресурсов.Мэтт Насср
Руководитель отдела глобальной инженерии данных и трансформации ИИ
Claude Opus 5 позволяет агентам мониторинга управлять частью собственной памяти в производственной среде, делая их более автономными и надежными при долгосрочном планировании. Агент относится к своему контексту как к живой документации: после обнаружения потенциальной аномалии в одном из наших сервисов он перепроверил свое предположение на продакшене, выяснил, что сигнал ложный, записал исправление в свою память и самостоятельно закрыл запросы мониторинга.Танапат Ратанаруенгджумрун
Менеджер по прикладному ИИ
Claude Opus 5 — это мощная модель агентного программирования, созданная для долгосрочных многоэтапных задач. Она глубоко понимает вашу кодовую базу, удерживает общую нить рассуждений в сложных проектах и точнее определяет требования для разработки функций и исправления ошибок по сравнению с Opus 4.8. Теперь разработчики могут создавать проекты с помощью Opus 5 в Kiro, используя ее передовые возможности для реализации амбициозных задач.Дипак Сингх
Вице-президент по агентному ИИ
Согласованность и безопасность
Согласованность. Во время тестирования перед развертыванием наша автоматизированная проверка поведения показала, что Opus 5 является нашей наиболее согласованной моделью на сегодняшний день (как показано на графике ниже). Она следует конституции Claude лучше, чем Opus 4.8, Sonnet 5 или Fable 5; демонстрирует наименьшие показатели деструктивного или обманного поведения; и менее всего подвержена манипуляциям с целью нецелевого использования. Это также наша самая безопасная модель с точки зрения предотвращения опрометчивых действий, которые могли бы привести к труднообратимым побочным эффектам.
В ходе нашей автоматизированной проверки поведения Opus 5 набирает 2,3 балла по общему несогласованному поведению — это самый низкий показатель среди наших последних моделей.Безопасность. Opus 5 не раздвигает границы в сфере рискованных возможностей двойного назначения. В ходе тщательных оценок, проведенных совместно с партнерами из частного сектора и правительства, мы выяснили, что она по-прежнему отстает от Mythos 5 как в биологических исследованиях, так и в наступательной кибербезопасности. Более подробную информацию об этих оценках можно найти в нашей системной карте.
Как и в случае с ее предшественницей, Opus 4.8, мы намеренно избегали обучения Opus 5 задачам в области кибербезопасности. Тем не менее модель существенно улучшила свои навыки в этих задачах благодаря общему росту возможностей и теперь приближается к Mythos 5 в поиске уязвимостей кибербезопасности. Однако она по-прежнему значительно отстает от Mythos 5 в вопросах эксплуатации этих уязвимостей, то есть в превращении уязвимостей в реальные киберугрозы.
Это иллюстрируется результатами Opus 5 на платформе OSS-Fuzz — оценке, которую мы разработали для проверки того, насколько хорошо модели могут находить, а затем эксплуатировать уязвимости без масштабного вмешательства человека. Хотя Mythos 5 и Opus 5 выявляют уязвимости с сопоставимым успехом, показатели Opus 5 по разработке эксплойтов значительно ниже, чем у Mythos 5.
В тесте OSS-Fuzz, одной из наших оценок кибербезопасности, Opus 5 близка к Mythos 5 в выявлении уязвимостей программного обеспечения (слева), но значительно менее успешна в разработке эксплойтов для них (справа).Защитные механизмы для Opus 5
Защитные механизмы Claude Opus 5 призваны разрешить полезное применение модели как в кибербезопасности, так и в биологии. Они схожи с теми, что мы применяли к Opus 4.8, за исключением более строгих ограничений для узкого спектра задач в области кибербезопасности.
Кибербезопасность. Киберклассификаторы Opus 5 пропорционально менее ограничительны, чем у Fable 5. Они позволяют Opus 5 находить уязвимости в исходном коде, но блокируют «бинарное» сканирование уязвимостей (метод, с большей вероятностью используемый злоумышленниками), тестирование на проникновение и генерацию эксплойтов.
Основываясь на нашем тестировании, мы ожидаем, что классификаторы будут вмешиваться примерно на 85% реже, чем в случае с Fable 5. В Claude.ai, Claude Code и Claude Cowork любые помеченные запросы по умолчанию будут перенаправляться на Opus 4.8. Перенаправление на Opus 4.8 также может быть включено в API.
Наша программа киберверификации (CVP) способствует проведению работ по кибербезопасности, которым в противном случае могли бы помешать защитные механизмы модели. Предприятия и исследователи, уже участвующие в CVP, имеют немедленный доступ к версии Opus 5 с меньшими ограничениями безопасности.
Биология. Поскольку у Opus 5 аналогичный набор защитных мер, что и у Opus 4.8, теперь это наша самая мощная общедоступная модель для научных исследований. Тем не менее модель по-прежнему демонстрирует существенные ограничения при выполнении долгосрочных автономных исследовательских задач — именно в этой сфере мы ожидаем наибольших биологических рисков от ИИ-моделей. (Mythos 5 остается более сильной моделью для такого рода биологических работ.) В рамках этого запуска запросы биологической направленности, которые блокируются на Fable 5, теперь будут направляться на Opus 5, а не на Opus 4.8.
Начало работы
Claude Opus 5 доступна уже сегодня на всех платформах по цене $5 за миллион входящих токенов и $25 за миллион исходящих токенов (так же, как и Opus 4.8). Разработчики могут начать работу с claude-opus-5 через Claude API.
Она также предлагается в режиме Fast (Быстрый), в котором работает примерно в 2,5 раза быстрее стандартного. Как и в случае с Opus 4.8, режим Fast доступен по цене, вдвое превышающей базовую стоимость Opus 5 на платформе Claude и за счет кредитов на использование в Claude Code.
Одновременно с Opus 5 мы выпускаем два обновления в режиме бета-тестирования:
- Изменение инструментов в ходе разговора на платформе Claude. В рамках диалога разработчики теперь могут менять набор доступных для Claude инструментов без аннулирования кэша промптов.
- Автоматическое резервное переключение на API. Пользователи теперь могут настроить автоматическое перенаправление запросов, помеченных нашими классификаторами безопасности в Opus 5 (или Fable 5), на другую модель. При включенном автоматическом переключении запросы API по умолчанию всегда направляются на лучшую из доступных моделей вместо блокировки.
В соответствии с предыдущими моделями Opus, у Opus 5 нет требований к хранению данных при общем доступе.
Дополнительные рекомендации по эффективному использованию Opus 5 см. в нашем руководстве по промптингу.
Сноски
Frontier-Bench v0.1, график усилий: Эти результаты получены в ходе внутреннего запуска Frontier-Bench v0.1 на обвязке mini-SWE-agent и бэкенде GKE, средняя награда по 5 попыткам на задачу. В качестве резервной модели при срабатывании классификатора безопасности для Opus 5 и Fable 5 выступала Opus 4.8.
Полный текст статьи читайте на Anthropic прочитано 356 раз
