Представляем Claude 4

Illustration of Claude juggling several tasks in parallel

Сегодня мы представляем следующее поколение моделей Claude: Claude Opus 4 и Claude Sonnet 4, которые устанавливают новые стандарты в области написания кода, продвинутых рассуждений и работы ИИ-агентов.

Claude Opus 4 — это лучшая в мире модель для программирования, обеспечивающая стабильную производительность при выполнении сложных долгосрочных задач и в рабочих процессах агентов. Claude Sonnet 4 представляет собой значительное обновление Claude Sonnet 3.7, обеспечивающее превосходные возможности написания кода и рассуждений при более точном реагировании на ваши инструкции.

Вместе с моделями мы также анонсируем:

  • Расширенное мышление с использованием инструментов (бета-версия): обе модели могут использовать такие инструменты, как поиск в интернете, во время расширенного процесса мышления, позволяя Claude чередовать рассуждения и использование инструментов для улучшения ответов.
  • Новые возможности моделей: обе модели могут использовать инструменты параллельно, точнее следовать инструкциям и — при предоставлении разработчиками доступа к локальным файлам — демонстрировать значительно улучшенные возможности памяти, извлекая и сохраняя ключевые факты для поддержания непрерывности и накопления неявных знаний с течением времени.
  • Claude Code теперь общедоступен: получив множество положительных отзывов во время предварительного просмотра для разработчиков, мы расширяем возможности совместной работы с Claude. Теперь Claude Code поддерживает фоновые задачи через GitHub Actions и встроенную интеграцию с VS Code и JetBrains, отображая правки прямо в ваших файлах для удобного парного программирования.
  • Новые возможности API: мы выпускаем четыре новые функции для нашего API, которые позволяют разработчикам создавать более мощные ИИ-агенты: инструмент выполнения кода, коннектор MCP, API файлов и возможность кэширования промптов на срок до одного часа.

Claude Opus 4 и Sonnet 4 — это гибридные модели, предлагающие два режима: практически мгновенные ответы и расширенное мышление для более глубоких рассуждений. Тарифные планы Pro, Max, Team и Enterprise Claude включают обе модели и расширенное мышление, а Sonnet 4 также доступна бесплатным пользователям. Обе модели доступны через наш API, Amazon Bedrock и Google Cloud Vertex AI. Цены остаются прежними по сравнению с предыдущими моделями Opus и Sonnet: Opus 4 стоит $15/$75 за миллион токенов (вход/выход), а Sonnet 4 — $3/$15.

Claude 4

Claude Opus 4 — наша самая мощная модель на сегодняшний день и лучшая модель для программирования в мире, лидирующая на бенчмарках SWE-bench (72,5%) и Terminal-bench (43,2%). Она обеспечивает стабильную производительность при выполнении долгосрочных задач, требующих сфокусированных усилий и тысяч шагов, с возможностью непрерывной работы в течение нескольких часов, что значительно превосходит все модели Sonnet и существенно расширяет возможности ИИ-агентов.

Claude Opus 4 превосходно справляется с написанием кода и решением сложных задач, лежащих в основе передовых продуктов для агентов. В Cursor её называют передовой для кодирования и прорывом в понимании сложных кодовых баз. Replit сообщает о повышенной точности и кардинальных улучшениях при внесении сложных изменений в несколько файлов. Block называет её первой моделью, которая повышает качество кода при редактировании и отладке в своём агенте codename goose, сохраняя при этом полную производительность и надежность. Rakuten подтвердила её возможности в ходе сложного рефакторинга с открытым исходным кодом, который выполнялся автономно в течение 7 часов со стабильной производительностью. В Cognition отмечают, что Opus 4 отлично справляется со сложными задачами, которые не под силу другим моделям, успешно выполняя критические действия, которые пропускали предыдущие версии.

Claude Sonnet 4 значительно превосходит лидирующие в отрасли возможности Sonnet 3.7, демонстрируя превосходные результаты в кодировании с передовым показателем 72,7% на SWE-bench. Модель балансирует между производительностью и эффективностью для внутренних и внешних сценариев использования, обладая улучшенной управляемостью для большего контроля над реализацией. Хотя в большинстве областей она не дотягивает до Opus 4, она предлагает оптимальное сочетание возможностей и практичности.

В GitHub отмечают, что Claude Sonnet 4 демонстрирует потрясающие результаты в агентских сценариях и будет внедрена в качестве модели, обеспечивающей работу нового агента программирования в GitHub Copilot. Manus подчеркивает её улучшения в следовании сложным инструкциям, четкости рассуждений и качестве вывода. iGent сообщает, что Sonnet 4 превосходно справляется с автономной разработкой приложений со множеством функций, а также демонстрирует существенно улучшенное решение проблем и навигацию по кодовой базе, сокращая количество ошибок навигации с 20% почти до нуля. В Sourcegraph говорят, что модель выглядит многообещающе как серьезный шаг вперед в разработке программного обеспечения: она дольше не сбивается с пути, глубже понимает проблемы и обеспечивает более элегантный код. В Augment Code сообщают о более высоких показателях успешности, более ювелирных правках кода и более тщательной работе со сложными задачами, что делает её главным выбором в качестве основной модели.

Эти модели выводят стратегии искусственного интеллекта наших клиентов на новый уровень по всем направлениям: Opus 4 расширяет границы в программировании, исследованиях, написании текстов и научных открытиях, в то время как Sonnet 4 обеспечивает передовую производительность для повседневных задач в качестве мгновенного обновления для Sonnet 3.7.

Bar chart comparison between Claude and other LLMs on software engineering tasksМодели Claude 4 лидируют в SWE-bench Verified — бенчмарке производительности при решении реальных задач по разработке ПО. Подробнее о методологии см. в приложении.

Улучшения моделей

В дополнение к расширенному мышлению с использованием инструментов, параллельному выполнению инструментов и улучшению памяти мы значительно снизили склонность моделей использовать обходные пути или лазейки для выполнения задач. Вероятность такого поведения у обеих моделей на 65% ниже, чем у Sonnet 3.7, в агентских задачах, которые наиболее подвержены использованию лазеек.

Claude Opus 4 также кардинально превосходит все предыдущие модели по возможностям памяти. Когда разработчики создают приложения, предоставляющие Claude доступ к локальным файлам, Opus 4 успешно справляется с созданием и поддержанием «файлов памяти» для хранения ключевой информации. Это обеспечивает лучшее понимание долгосрочных задач, согласованность и производительность при выполнении задач агентом — например, когда Opus 4 создает «Путеводитель» во время игры в Pokémon.

A visual note in Claude's memories that depicts a navigation guide for the game Pokemon Red.Память: При предоставлении доступа к локальным файлам Claude Opus 4 записывает ключевые сведения, помогающие улучшить игровой процесс. Показанные выше заметки были реально сделаны Opus 4 во время прохождения Pokémon.

Наконец, мы внедрили краткие выжимки хода мыслей (thinking summaries) для моделей Claude 4, которые используют меньшую по размеру модель для сжатия долгих мыслительных процессов. Такое сокращение требуется лишь примерно в 5% случаев — большинство процессов рассуждения достаточно коротки, чтобы отображаться полностью. Пользователям, которым требуются «сырые» цепочки мыслей для сложного промпт-инжиниринга, могут обратиться в отдел продаж по поводу нашего нового режима разработчика (Developer Mode) для получения полного доступа.

Claude Code

Claude Code, который теперь стал общедоступным, переносит возможности Claude в еще большую часть вашего рабочего процесса разработки — в терминал, ваши любимые IDE и фоновый режим с использованием Claude Code SDK.

Новые бета-расширения для VS Code и JetBrains интегрируют Claude Code прямо в вашу IDE. Предложенные Claude правки появляются прямо в ваших файлах, упрощая их проверку и отслеживание в привычном интерфейсе редактора. Просто запустите Claude Code в терминале вашей IDE для установки.

Помимо IDE, мы выпускаем расширяемый SDK для Claude Code, чтобы вы могли создавать собственные агенты и приложения, используя то же ядро агента, что и в Claude Code. Мы также публикуем пример возможностей SDK: Claude Code на GitHub, который сейчас находится в бета-тестировании. Отмечайте Claude Code в пулл-реквестах (PR), чтобы реагировать на отзывы рецензентов, исправлять ошибки CI или изменять код. Для установки выполните команду /install-github-app из Claude Code.

Начало работы

Эти модели представляют собой большой шаг на пути к созданию виртуального соавтора, способного сохранять полный контекст, удерживать внимание на долгих проектах и оказывать трансформационное влияние. Они прошли всестороннее тестирование и оценку для минимизации рисков и максимизации безопасности, включая реализацию мер для более высоких уровней безопасности ИИ, таких как ASL-3.

Мы с нетерпением ждем того, что вы создадите. Начните работу сегодня на Claude, в Claude Code или на выбранной вами платформе.

Как всегда, ваши отзывы помогают нам становиться лучше.

Приложение

Источники данных бенчмарков производительности

  • Open AI: публикация о запуске o3, системная карта o3, публикация о запуске GPT-4.1, размещенные тесты GPT-4.1
  • Gemini: карточка модели Gemini 2.5 Pro Preview
  • Claude: публикация о запуске Claude 3.7 Sonnet

Отчетность по бенчмаркам производительности

Claude Opus 4 и Sonnet 4 — это гибридные модели рассуждения. Бенчмарки, представленные в этой статье блога, показывают наивысшие результаты, достигнутые с использованием расширенного мышления или без него. Ниже для каждого результата мы указали, применялось ли расширенное мышление:

  • Без расширенного мышления: SWE-bench Verified, Terminal-bench
  • Расширенное мышление (до 64K токенов):
    • TAU-bench (результаты без расширенного мышления не публикуются)
    • GPQA Diamond (без расширенного мышления: Opus 4 набирает 74,9%, а Sonnet 4 — 70,0%)
    • MMMLU (без расширенного мышления: Opus 4 набирает 87,4%, а Sonnet 4 — 85,4%)
    • MMMU (без расширенного мышления: Opus 4 набирает 73,7%, а Sonnet 4 — 72,6%)
    • AIME (без расширенного мышления: Opus 4 набирает 33,9%, а Sonnet 4 — 33,1%)

Методология TAU-bench

Баллы были достигнуты с помощью дополнения к промпту для политик агентов Airline и Retail, которое предписывало Claude эффективнее задействовать свои способности к рассуждению при использовании расширенного мышления с инструментами. Модель поощряется записывать свои мысли по мере решения проблемы отдельно от нашего обычного режима мышления во время многошаговых траекторий для наилучшего использования способностей к рассуждению. Чтобы компенсировать дополнительные шаги, которые совершает Claude, задействуя больше мышления, максимальное количество шагов (подсчитываемых по завершениям модели) было увеличено с 30 до 100 (большинство траекторий завершалось менее чем за 30 шагов, и только одна траектория превысила 50 шагов).

Методология SWE-bench

Для семейства моделей Claude 4 мы продолжаем использовать тот же простой каркас, который наделяет модель исключительно двумя инструментами, описанными в наших предыдущих релизах здесь — инструментом bash и инструментом редактирования файлов, работающим через замену строк. Мы больше не включаем третий «инструмент планирования», использовавшийся в Claude 3.7 Sonnet. По всем моделям Claude 4 мы публикуем результаты по полному набору из 500 задач. Результаты для моделей OpenAI приводятся по подмножеству из 477 задач.

Для наших показателей «высоких вычислительных затрат» мы используем дополнительную сложность и параллельные вычисления во время тестирования следующим образом:

  • Мы производим выборку из нескольких параллельных попыток.
  • Мы отбраковываем патчи, которые ломают видимые регрессионные тесты в репозитории, аналогично подходу с выборочной отбраковкой (rejection sampling), принятому в Agentless (Xia et al. 2024); обратите внимание, что скрытая информация тестов не используется.
  • Затем мы используем внутреннюю модель оценки для выбора лучшего кандидата из оставшихся попыток.

В результате получаем показатели 79,4% для Opus 4 и 80,2% для Sonnet 4 соответственно.

Полный текст статьи читайте на Anthropic