Представляем Claude Opus 4.7

Introducing Claude Opus 4.7

Наша последняя модель, Claude Opus 4.7, теперь доступна широкому кругу пользователей.

Opus 4.7 представляет собой заметное улучшение по сравнению с Opus 4.6 в области продвинутой программной инженерии, особенно в плане решения самых сложных задач. Пользователи отмечают, что теперь они могут смело передоверять Opus 4.7 свою самую сложную работу по написанию кода — ту, которая раньше требовала пристального контроля. Opus 4.7 строго и последовательно справляется со сложными и долгосрочными задачами, уделяет прецизионное внимание инструкциям и разрабатывает способы проверки собственных результатов перед отправкой отчета.

Модель также обладает значительно улучшенным зрением: она способна распознавать изображения в более высоком разрешении. Она демонстрирует лучший вкус и креативность при выполнении профессиональных задач, создавая интерфейсы, презентации и документы более высокого качества. И хотя ее общие возможности уступают нашей самой мощной модели Claude Mythos Preview, она показывает результаты лучше, чем Opus 4.6, в целом ряде бенчмарков:

На прошлой неделе мы анонсировали проект Glasswing, рассказав о рисках и преимуществах моделей ИИ для кибербезопасности. Мы заявляли, что выпуск Claude Mythos Preview останется ограниченным, а новые средства киберзащиты будут сначала протестированы на менее мощных моделях. Opus 4.7 стала первой такой моделью: ее кибервозможности не столь продвинуты, как у Mythos Preview (более того, в ходе обучения мы экспериментировали с попытками целенаправленного ограничения этих возможностей). Мы выпускаем Opus 4.7 с защитными механизмами, которые автоматически обнаруживают и блокируют запросы, указывающие на запрещенное или высокорисковое использование в сфере кибербезопасности. Полученные в ходе реального развертывания этих защитных мер данные помогут нам продвигаться к нашей конечной цели — широкому релизу моделей класса Mythos.

Специалисты по безопасности, желающие использовать Opus 4.7 в законных целях кибербезопасности (таких как исследование уязвимостей, тестирование на проникновение и имитация кибератак / red-teaming), могут присоединиться к нашей новой Программе верификации кибербезопасности.

Opus 4.7 доступна уже сегодня во всех продуктах Claude, а также через наш API, Amazon Bedrock, Vertex AI от Google Cloud и Microsoft Foundry. Цены остались прежними по сравнению с Opus 4.6: 5 долларов за миллион токенов на входе и 25 долларов за миллион токенов на выходе. Разработчики могут использовать claude-opus-4-7 через Claude API.

Тестирование Claude Opus 4.7

Claude Opus 4.7 получила множество положительных отзывов от тестировщиков раннего доступа:

logo
В ходе раннего тестирования мы видим потенциал для значительного качественного скачка для наших разработчиков с Claude Opus 4.7. Она находит собственные логические ошибки на этапе планирования и ускоряет выполнение задач, значительно превосходя предыдущие модели Claude. Будучи финтех-платформой, обслуживающей миллионы потребителей и компаний в больших масштабах, такое сочетание скорости и точности может стать поворотным моментом: оно ускоряет темпы разработки для более быстрого создания надежных финансовых решений, на которые наши клиенты полагаются каждый день.
Кларенс Хуанг (Clarence Huang)
Вице-президент по технологиям
logo
Anthropic уже задала стандарт для моделей написания кода, и Claude Opus 4.7 развивает этот успех, являясь передовой моделью на рынке. По результатам наших внутренних оценок, она выделяется не только своими базовыми возможностями, но и тем, как отлично справляется с реальными асинхронными рабочими процессами — автоматизацией, CI/CD и долгосрочными задачами. Она также глубже осмысляет проблемы и предлагает более аргументированную точку зрения, а не просто соглашается с пользователем.
Игорь Островский (Igor Ostrovsky)
Сооснователь и технический директор
logo
Claude Opus 4.7 — это самая мощная модель, которую тестировала компания Hex. Она корректно сообщает об отсутствующих данных вместо того, чтобы предоставлять правдоподобные, но неверные запасные варианты, а также противостоит ловушкам с противоречивыми данными, на которые попадается даже Opus 4.6. Это более умная и эффективная версия Opus 4.6: низкая интенсивность работы Opus 4.7 примерно эквивалентна средней интенсивности Opus 4.6.
Кейтлин Колгроув (Caitlin Colgrove)
Сооснователь и технический директор
logo
На нашем бенчмарке написания кода из 93 задач Claude Opus 4.7 повысила процент успешного решения на 13% по сравнению с Opus 4.6, включая четыре задачи, которые не смогли решить ни Opus 4.6, ни Sonnet 4.6. В сочетании с уменьшенной средней задержкой (latency) и строгим следованием инструкциям это особенно важно для сложных и продолжительных рабочих процессов программирования. Она снижает трение при выполнении таких многоэтапных задач, позволяя разработчикам оставаться в потоке и сосредоточиться на создании продукта.
Марио Родригес (Mario Rodriguez)
Директор по продукту (CPO)
logo
Основываясь на нашем собственном бенчмарке для исследовательских агентов, Claude Opus 4.7 обладает самым высоким базовым уровнем эффективности из всех, что мы видели в многоэтапной работе. Она разделила первое место по общему баллу среди наших шести модулей с результатом 0,715 и продемонстрировала самую стабильную работу с длинным контекстом среди всех протестированных нами моделей. В категории «Общие финансы» (нашем крупнейшем модуле) она значительно улучшила показатели по сравнению с Opus 4.6, набрав 0.813 против 0.767, а также показала лучшую в группе дисциплину раскрытия информации и работы с данными. А в дедуктивной логике — области, где Opus 4.6 испытывала трудности, — Opus 4.7 держится уверенно.
Михал Муха (Michal Mucha)
Ведущий инженер по ИИ, прикладной ИИ
logo
Claude Opus 4.7 расширяет границы возможностей моделей по исследованию и выполнению задач. Компания Anthropic явно оптимизировала решение для непрерывных рассуждений на протяжении длительных периодов времени, и это проявляется в ведущей на рынке производительности. По мере того как инженеры переходят от работы с агентами по схеме 1:1 к их управлению в параллельном режиме, это именно тот передовой класс возможностей, который открывает новые рабочие процессы.
Джефф Ванг (Jeff Wang)
Генеральный директор (CEO)
logo
Мы наблюдаем серьезные улучшения в мультимодальном понимании Claude Opus 4.7 — от чтения химических структур до интерпретации сложных технических диаграмм. Поддержка более высокого разрешения помогает компании Solve Intelligence создавать лучшие в своем классе инструменты для рабочих процессов с патентами в области наук о жизни: от составления заявок и их ведения до выявления нарушений и составления таблиц недействительности.
Сандж Ахилан (Sanj Ahilan)
Главный директор по исследованиям
logo
Claude Opus 4.7 выводит долгосрочную автономность в Devin на новый уровень. Она слаженно работает часами, преодолевает сложные проблемы вместо того, чтобы сдаваться, и открывает класс задач по глубокому исследованию, которые мы раньше не могли надежно выполнять.
Скотт Ву (Scott Wu)
Генеральный директор (CEO)
logo
Для Replit переход на Claude Opus 4.7 был простым решением. Для повседневных задач наших пользователей мы заметили, что она достигает того же качества при более низкой стоимости — она более эффективна и точна в таких задачах, как анализ логов и трассировок, поиск багов и предложение исправлений. Лично мне очень нравится, как она возражает во время технических дискуссий, помогая мне принимать более взвешенные решения. Это действительно ощущается как лучший коллега по работе.
Микеле Катаста (Michele Catasta)
Президент
logo
Claude Opus 4.7 демонстрирует высокую содержательную точность в тесте BigLaw Bench для Harvey, набирая 90,9% при высокой интенсивности работы. Модель отличается более точной калибровкой рассуждений при проверке таблиц и заметно более умной обработкой задач по редактированию неоднозначных документов. Она корректно различает положения об уступке прав (assignment) и положения о смене контроля (change-of-control) — задачу, которая исторически вызывала трудности у передовых моделей. Содержательная сторона стабильно оценивалась как сильная сторона во всех наших оценках: корректно, тщательно и с хорошими цитатами.
Нико Групен (Niko Grupen)
Руководитель отдела прикладных исследований
logo
Claude Opus 4.7 — это очень впечатляющая модель для написания кода, особенно благодаря своей автономности и более творческому подходу к рассуждениям. На тесте CursorBench модель Opus 4.7 демонстрирует значительный скачок в возможностях, преодолевая отметку в 70% по сравнению с 58% у Opus 4.6.
Майкл Труэлл
Соучредитель и генеральный директор
logo
Для сложных многоэтапных рабочих процессов Claude Opus 4.7 — это явный шаг вперед: прирост на 14% по сравнению с Opus 4.6 при меньшем расходе токенов и трети от прежнего количества ошибок при вызове инструментов. Это первая модель, которая успешно проходит наши тесты на неявные потребности и продолжает выполнять задачи несмотря на сбои в работе инструментов, которые раньше полностью останавливали Opus. Именно такой скачок надежности заставляет Notion Agent ощущаться как настоящий командный игрок.
Сара Закс
Руководитель отдела искусственного интеллекта
logo
В ходе наших оценок мы зафиксировали двузначный рост точности вызова инструментов и планирования у наших основных агентных оркестраторов. По мере того как пользователи задействуют Hebbia для планирования и выполнения таких задач, как поиск информации, создание презентаций или генерация документов, Claude Opus 4.7 демонстрирует потенциал для улучшения процесса принятия решений агентами в подобных рабочих процессах.
Адитья Раманатхан
Руководитель отдела прикладных исследований
logo
На Rakuten-SWE-Bench модель Claude Opus 4.7 успешно справляется с в 3 раза большим количеством рабочих задач в продакшене, чем Opus 4.6, демонстрируя двузначный прирост показателей качества кода и качества тестирования. Это значительный рывок и явное улучшение для инженерной работы, которую наши команды выпускают каждый день.
Юсукэ Кадзи
Генеральный менеджер по направлению «ИИ для бизнеса»
logo
Для задач проверки кода в CodeRabbit модель Claude Opus 4.7 оказалась самой эффективной из всех протестированных нами. Полнота поиска (recall) выросла более чем на 10%, позволив обнаружить самые трудновыявляемые ошибки в наших самых сложных пулл-реквестах, в то время как точность осталась стабильной несмотря на возросшее покрытие. Она работает немного быстрее, чем GPT-5.4 xhigh на нашей тестовой платформе, и мы планируем использовать её для выполнения самых ресурсоёмких задач по ревью кода с момента запуска.
Дэвид Локер
Вице-президент по искусственному интеллекту
logo
Для суперагента Genspark модель Claude Opus 4.7 идеально справляется с тремя ключевыми для продакшена факторами: устойчивостью к зацикливанию, согласованностью и плавным восстановлением после ошибок. Устойчивость к зацикливанию — важнейший из них. Модель, которая бесконечно зацикливается на одном из 18 запросов, впустую тратит вычислительные ресурсы и блокирует пользователей. Меньший разброс результатов означает меньше сюрпризов в продакшене. Кроме того, Opus 4.7 достигает самого высокого из измеренных нами соотношений качества на один вызов инструмента.
Кей Чжу
Соучредитель и технический директор
logo
Claude Opus 4.7 — это значительный шаг вперед для Warp. Opus 4.6 — одна из лучших моделей для разработчиков, а эта новинка вдобавок к этому стала заметно более тщательной в работе. Она успешно справилась с задачами на Terminal Bench, с которыми предыдущие модели Claude не справлялись, и преодолела сложную ошибку параллелизма, которую Opus 4.6 не смог осилить. Для нас это главный сигнал.
Зак Ллойд
Основатель и генеральный директор
logo
Claude Opus 4.7 — лучшая в мире модель для создания дашбордов и интерфейсов с большим количеством данных. Чувство стиля и дизайна поистине поражает — она принимает решения, которые я бы без сомнений отправил в продакшн. Теперь это моя основная модель для повседневной работы.
Эй Орбах
Соучредитель и генеральный директор
logo
Claude Opus 4.7 — это самая мощная модель из всех, что мы тестировали в Quantium. По результатам оценки с помощью нашего собственного бенчмарка в сравнении с ведущими ИИ-моделями, наибольший прирост проявился там, где это важнее всего: в глубине рассуждений, структурированном формулировании проблем и сложной технической работе. Меньше исправлений, быстрее итерации и более качественные результаты для решения самых сложных задач, с которыми к нам обращаются клиенты.
Бен Чан
Главный директор по искусственному интеллекту
logo
Claude Opus 4.7 ощущается как настоящий шаг вперед в плане интеллекта. Качество кода заметно улучшилось: модель избавляется от бессмысленных функций-оберток и резервных каркасов, которые раньше накапливались, и исправляет собственный код по ходу дела. Это самый чистый скачок со времён перехода от Sonnet 3.7 к серии Claude 4.
Бен Лафферти
Старший ведущий инженер
logo
Для задач взаимодействия с компьютером, которые лежат в основе автономного тестирования на проникновение от XBOW, новая модель Claude Opus 4.7 — это качественный скачок: 98,5% в нашем бенчмарке визуального восприятия против 54.5% у Opus 4.6. Наша главная проблема с Opus фактически исчезла, и это открывает возможности для ее использования в целом ряде задач, где раньше мы не могли ее применять.
Эге де Мур
Генеральный директор (CEO)
logo
Claude Opus 4.7 — это надежное обновление без регрессий для Vercel. Она феноменально справляется с задачами написания кода с первой попытки, работает точнее и полнее, чем Opus 4.6, и заметно честнее оценивает собственные ограничения. Она даже выполняет проверки системного кода перед началом работы — это новое поведение, которого мы не наблюдали у предыдущих моделей Claude.
Джо Хаддад
Ведущий инженер-программист
logo
Claude Opus 4.7 очень сильна и превосходит Opus 4.6, обеспечивая прирост успешности выполнения задач для Factory Droids на 10–15%, с меньшим количеством ошибок при использовании инструментов и более надежным выполнением этапов валидации до конца. Она доводит работу до завершения, а не останавливается на полпути, что и требуется корпоративным инженерным командам.
Лео Чураков
Технический специалист
logo
Claude Opus 4.7 автономно создала с нуля полноценный движок преобразования текста в речь на Rust (нейронную модель, SIMD-ядра, демо для браузера), а затем пропустила собственный результат через распознаватель речи, чтобы убедиться в его соответствие эталону на Python. Месяцы работы опытных инженеров, выполненные автономно. Прогресс по сравнению с Opus 4.6 очевиден, и кодовая база находится в открытом доступе.
Шон Уорд
Генеральный директор и сооснователь
logo
Claude Opus 4.7 успешно справилась с тремя задачами TBench, которые были не по зубам предыдущим моделям Claude, и внедряет исправления, пропущенные нашей лучшей прошлой моделью, включая состояние гонки (race condition). Она демонстрирует высокую точность в выявлении реальных проблем и выдает важные результаты, от которых другие модели либо отказывались, либо не могли их решить. В бенчмарке реального анализа кода от Qodo мы зафиксировали точность высшего уровня.
Итамар Фридман
Сооснователь и генеральный директор
logo
В OfficeQA Pro от Databricks модель Claude Opus 4.7 демонстрирует значительно более качественные навыки работы с документами: при обработке исходной информации количество ошибок на 21% меньше, чем у Opus 4.6. Среди всех наших бенчмарков агентских рассуждений над данными это лучшая модель Claude для корпоративного анализа документов.
Ханлин Танг
Технический директор по нейросетям
logo
Для компании Ramp модель Claude Opus 4.7 выделяется в рабочих процессах команд агентов. Мы видим более точное следование ролям, выполнение инструкций, координацию и сложные рассуждения, особенно в инженерных задачах, затрагивающих различные инструменты, кодовые базы и контекст отладки. По сравнению с Opus 4.6, ей требуется гораздо меньше пошаговых указаний, что помогает нам масштабировать внутренние рабочие процессы агентов, используемые нашими инженерными командами.
Остин Рей
Инженер-программист
logo
Claude Opus 4.7 заметно лучше Opus 4.6 в длительных задачах по созданию приложений для Bolt (в лучших случаях — до 10% лучше), и при этом без тех регрессий, которых мы привыкли ожидать от сильно агентных моделей. Она расширяет границы того, что наши пользователи могут выпустить в рамках одной сессии.
Эрик Саймонс
Генеральный директор и сооснователь
01 / 28

Ниже приведены основные моменты и заметки по результатам нашего раннего тестирования Opus 4.7:

  • Следование инструкциям. Opus 4.7 значительно лучше следует инструкциям. Интересно, что это означает: промпты, написанные для более ранних моделей, теперь иногда могут давать неожиданные результаты: там, где предыдущие модели интерпретировали инструкции вольно или вообще пропускали части, Opus 4.7 воспринимает их буквально. Пользователям следует соответствующим образом перенастроить свои промпты и рабочие окружения.
  • Улучшенная поддержка мультимодальности. У Opus 4.7 лучше развито зрение для изображений высокого разрешения: она может принимать изображения с размером по длинной стороне до 2576 пикселей (~3,75 мегапикселя), что более чем в три раза превышает показатели предыдущих моделей Claude. Это открывает широкие возможности для мультимодальных сценариев использования, зависящих от мелких визуальных деталей: агентов компьютерного использования, читающих плотные скриншоты, извлечения данных из сложных диаграмм и работы, требующей идеальной точности по пикселям.1
  • Реальные рабочие задачи. Помимо передовых результатов в оценке Finance Agent (см. таблицу выше), наше внутреннее тестирование показало, что Opus 4.7 является более эффективным финансовым аналитиком, чем Opus 4.6, создавая более строгие аналитические материалы и модели, профессиональные презентации и обеспечивая тесную интеграцию между задачами. Opus 4.7 также демонстрирует лучшие в своем классе результаты в GDPval-AA — сторонней оценке экономически ценной интеллектуальной работы в сферах финансов, юриспруденции и других областях.
  • Память. Opus 4.7 лучше использует память на основе файловой системы. Она запоминает важные заметки в ходе долгой работы, состоящей из множества сессий, и использует их для перехода к новым задачам, благодаря чему для них требуется меньше контекста на входе.

На графиках ниже представлены дополнительные результаты оценки, полученные в ходе предрелизного тестирования в различных предметных областях:

Офисные задачиЗрениеЛогика документовРассуждения в рамках длинного контекстаБиологияДолгосрочная согласованностьНаписание кода

Безопасность и соответствие принципам (оценка безопасности)

В целом Opus 4.7 демонстрирует профиль безопасности, схожий с Opus 4.6: наши оценки показывают низкие показатели нежелательного поведения, такого как обман, подхалимство и содействие неправомерному использованию. По некоторым параметрам, например, честности и устойчивости к злонамеренным атакам путем «внедрения инструкций» (prompt injection), Opus 4.7 превосходит Opus 4.6; по другим (например, склонность давать излишне подробные советы по снижению вреда применительно к контролируемым веществам), Opus 4.7 выглядит несколько слабее. Наша оценка соответствия принципам показала, что модель «в целом хорошо согласована и заслуживает доверия, хотя ее поведение не во всем идеально». Обратите внимание, что Mythos Preview по-прежнему остается лучшей по степени согласованности моделью из всех обученных нами, согласно нашим оценкам. Подробно наши оценки безопасности рассматриваются в системной карте Claude Opus 4.7.

Общий показатель несогласованного поведения по результатам нашего автоматизированного аудита поведения. В рамках этой оценки Opus 4.7 демонстрирует умеренное улучшение по сравнению с Opus 4.6 и Sonnet 4.6, однако у Mythos Preview по-прежнему наблюдаются самые низкие показатели несогласованного поведения.

Также сегодня запускается

В дополнение к самому Claude Opus 4.7 мы выпускаем следующие обновления:

  • Больше контроля над глубиной рассуждений (effort control): в Opus 4.7 представлен новый уровень xhigh («сверхвысокий») уровня усилий (effort level) между high и max, что дает пользователям более точный контроль над балансом между рассуждениями и задержкой при решении сложных задач. В Claude Code мы повысили уровень усилий по умолчанию до xhigh для всех тарифных планов. При тестировании Opus 4.7 для написания кода и агентских сценариев использования мы рекомендуем начинать с уровня усилий high или xhigh.
  • На платформе Claude (API): помимо поддержки изображений более высокого разрешения, мы также запускаем в публичном бета-тестировании бюджеты задач, предоставляя разработчикам инструмент для управления расходом токенов Claude, чтобы модель могла расставлять приоритеты при выполнении длительных процессов.
  • В Claude Code: новая команда /ultrareview запускает специальный сеанс проверки, который анализирует изменения и выявляет ошибки и архитектурные недочеты, которые заметил бы внимательный ревьюер. Пользователям Pro и Max в Claude Code мы даем три бесплатных ультраревью для тестирования этой функции. Кроме того, мы открыли доступ к автоматическому режиму (auto mode) для пользователей тарифного плана Max. Автоматический режим — это новая опция разрешений, в которой Claude принимает решения за вас, что позволяет выполнять более продолжительные задачи с меньшим количеством прерываний и с меньшим риском, чем при полном отключении разрешений.

Миграция с Opus 4.6 на Opus 4.7

Opus 4.7 представляет собой прямое обновление Opus 4.6, однако при переходе стоит учесть два изменения, которые влияют на использование токенов. Во-первых, в Opus 4.7 используется обновленный токенизатор, улучшающий обработку текста моделью. Обратная сторона заключается в том, что один и тот же объем исходных данных может занимать больше токенов — примерно в 1,0–1,35 раза в зависимости от типа контента. Во-вторых, Opus 4.7 глубже «размышляет» на более высоких уровнях усилий, особенно на поздних этапах в агентских сценариях. Это повышает надежность при решении сложных задач, но ведет к генерации большего числа выходных токенов.

Пользователи могут контролировать расход токенов различными способами: с помощью параметра уровня усилий, настройки бюджетов задач или запросов к модели с требованием большей лаконичности. По результатам нашего собственного тестирования, суммарный эффект является положительным — эффективность использования токенов на всех уровнях усилий улучшилась при прохождении внутреннего теста на написание кода, как показано ниже, — однако мы рекомендуем оценить разницу на реальных рабочих нагрузках. Мы подготовили руководство по миграции, в котором содержатся дополнительные рекомендации по переходу с Opus 4.6 на Opus 4.7.

Оценка в рамках внутреннего агентского бенчмарка по написанию кода как функция потребления токенов на каждом уровне усилий. В этом тесте модель работает автономно на основе единой подсказки пользователя, и результаты могут не отражать реальное потребление токенов при интерактивном программировании. Дополнительную информацию о настройке уровней усилий см. в руководстве по миграции.

Сноски

1 Это изменение на уровне модели, а не параметр API, поэтому изображения, отправляемые пользователями в Claude, просто обрабатываются с более высокой детализацией. Поскольку изображения с более высоким разрешением потребляют больше токенов, пользователи, которым не требуется избыточная детализация, могут уменьшать разрешение изображений перед отправкой модели.

  • Для GPT-5.4 и Gemini 3.1 Pro в графиках и таблицах производилось сравнение с лучшей из доступных через API версией модели.
  • MCP-Atlas: Оценка для Opus 4.6 была обновлена с учетом пересмотренной методологии оценивания от Scale AI.
  • SWE-bench Verified, Pro и Multilingual: Наши алгоритмы проверки на запоминание выявляют подмножество задач в этих бенчмарках SWE-bench. Если исключить задачи, демонстрирующие признаки заучивания, превосходство Opus 4.7 над Opus 4.6 сохраняется.
  • Terminal-Bench 2.0: Мы использовали тестовый обвязочный модуль Terminus-2 с отключенной функцией размышлений. Во всех экспериментах использовалось выделение ресурсов 1× (гарантированное) / 3× (предельное) в среднем по пять попыток на задачу.
  • CyberGym: Оценка Opus 4.6 была изменена с первоначально заявленных 66,6 до 73,8 в связи с обновлением параметров нашего тестового окружения для более эффективного выявления возможностей в сфере кибербезопасности.
  • SWE-bench Multimodal: Мы использовали внутреннюю реализацию как для Opus 4.7, так и для Opus 4.6. Полученные баллы напрямую не сопоставимы с результатами в публичных таблицах лидеров.

4 мая 2026 г.: График Логика документов обновлен с учетом актуальных оценок OfficeQA Pro для Opus 4.7.

Полный текст статьи читайте на Anthropic