Представляем Claude Opus 4.8

Introducing Claude Opus 4.8

Мы обновляем Claude Opus до новой версии: Claude Opus 4.8. Она создана на базе Opus 4.7 с улучшениями по всем бенчмаркам и стала еще более эффективным помощником. Модель доступна уже сегодня по прежней цене.

Opus 4.8 выходит одновременно с несколькими новыми функциями. Пользователи на claude.ai теперь могут управлять уровнем усилий, которые Claude вкладывает в задачу. В Claude Code появилась новая функция «динамических рабочих процессов» (dynamic workflows), позволяющая решать задачи очень большого масштаба. А быстрый режим для Opus 4.8, в котором модель может работать в 2,5 раза быстрее, теперь в три раза дешевле, чем для предыдущих моделей.

Возможности Opus 4.8

В таблице ниже показано, как Opus 4.8 соотносится со своим предшественником и другими моделями в тестах на программирование, навыки агентов, рассуждения и практические задачи по работе с информацией. Более подробная информация и гораздо более широкий спектр оценок возможностей приведены в системной карте Claude Opus 4.8.

Совместная работа с Opus 4.8

Первые тестировщики отметили, что Claude Opus 4.8 стал более надежным и точным в суждениях при выполнении задач агента. Ниже приведены цитаты многих из этих тестировщиков об их опыте совместной работы с Opus 4.8:

logo
Claude Opus 4.8 обладает заметно лучшим пониманием контекста. В Claude Code модель задает правильные вопросы, сама исправляет свои ошибки, возражает, если план несостоятелен, и обретает уверенность при решении комплексных задач, охватывающих множество сервисов, прежде чем вносить масштабные изменения. Это отличная модель для разработки.
Том Притчард
Ведущий инженер
logo
В нашем бенчмарке Super-Agent модель Claude Opus 4.8 стала единственной, которая полностью выполнила все сценарии от начала до конца, превзойдя предыдущие модели Opus и GPT-5.5 при сопоставимой стоимости. Для агентских продуктов в сфере перевода, глубоких исследований, создания презентаций и анализа она обеспечивает мощную надежность.
Кей Чжу
Сооснователь и технический директор
logo
В CursorBench модель Claude Opus 4.8 превосходит предыдущие версии Opus на всех уровнях производительности. Вызовы инструментов стали значительно эффективнее: для достижения того же уровня интеллектуальности требуется меньше шагов, при этом задачи доводятся до конца.
Майкл Труэлл
Сооснователь и генеральный директор
logo
Claude Opus 4.8 показывает самый высокий балл среди всех протестированных моделей в нашем бенчмарке Legal Agent Benchmark и является первой моделью, преодолевшей отметку в 10% в общем зачете по стандарту all-pass. Для серьезной юридической работы такой прирост точности напрямую влияет на то, какой объем реальной работы юристов наши клиенты могут уверенно делегировать искусственному интеллекту.
Нико Групен
Руководитель отдела прикладных исследований
logo
Claude Opus 4.8 ощущается как серьезное обновление комфорта использования по сравнению с Opus 4.7: она работает быстрее, с ней проще сотрудничать, и она лучше удерживает контекст и стилевое направление на протяжении длинной сессии. Opus 4.8 — это модель, к которой я продолжала возвращаться в работе, где авторский стиль, вкус и техническое исполнение должны сочетаться одновременно.
Кэти Пэрротт
Штатный автор
logo
Claude Opus 4.8 — это самая мощная модель для работы с компьютером и браузерными агентами из всех протестированных нами: она набрала 84% на Online-Mind2Web, что является значительным скачком по сравнению как с Opus 4.7, так и с GPT-5.5. Она сохраняет рассудительность и сосредоточенность на задаче, что необходимо для надежной работы агентских систем наших клиентов от начала до конца.
Мигель Гонсалес
Технический руководитель
logo
Claude Opus 4.8 чисто использует инструменты и следует инструкциям с той последовательностью, которая необходима для бесперебойной работы наших автономных инженерных систем в фоновом режиме. Она улучшает показатели Opus 4.6 и исправляет проблемы с избыточностью комментариев и вызовом инструментов, которые наблюдались в Opus 4.7. Этот релиз от Anthropic напрямую способствует ускоренному развитию возможностей для инженеров, создающих решения на базе Devin.
Скотт Ву
Генеральный директор
logo
В ходе наших долгосрочных оценок качество анализа Claude Opus 4.8 неизменно превосходило предыдущие версии Opus. Модель завершала работу быстрее и выдавала более богатые, насыщенные информацией результаты. В целом мы наблюдаем заметно лучшее соотношение сигнал/шум. Главным отличием стала склонность Opus 4.8 проактивно указывать на проблемы во входных и выходных данных анализа — то, что другие модели обычно упускали из виду, оставляя поиск ошибок пользователям.
Майкл Ран
Старший инвестиционный аналитик
logo
В платформе CoCounsel Legal модель Claude Opus 4.8 обеспечила значительное повышение стабильности и качества рассуждений по сравнению с предыдущими версиями Opus. Для ответственных профессиональных рабочих процессов, от которых зависят наши клиенты, такая надежность имеет решающее значение. По мере создания ИИ-систем фидуциарного уровня для юристов и налоговых экспертов подобные достижения помогают поднимать планку доверия к производительности искусственного интеллекта в реальных сценариях.
Джоэл Хрон
Технический директор
logo
Claude Opus 4.8 устанавливает новый стандарт для корпоративного ИИ. В Genie, ИИ-агенте Databricks для работы с данными и знаниями, новая модель Opus обеспечивает качественный скачок в агентских рассуждениях, быстрее справляясь с более глубокими многошаговыми задачами, чем любая предыдущая версия Opus. Кроме того, ее мультимодальные возможности позволяют Genie напрямую анализировать PDF-файлы, диаграммы и другой неструктурированный контент при стоимости токенов на 61% ниже, чем у Opus 4.7.
Ханлин Тан
Технический директор по нейронным сетям
logo
При работе с финансовыми документами в оркестраторе Hebbia модель Claude Opus 4.8 обеспечивает столь же высокое качество, как и Opus 4.7, но с заметно лучшей точностью цитирования и большей эффективностью использования токенов при поиске, что невероятно хорошо подходит для тех массивных отчетных документов, с которыми наши клиенты работают каждый день.
Аабхас Шарма
Технический директор (CTO)
01 / 11

Одно из самых заметных улучшений в Opus 4.8 — это его честность. Мы обучаем все наши модели быть честными — например, избегать заявлений, которые они не могут подкрепить доказательствами. Однако общей проблемой моделей ИИ является то, что они иногда делают поспешные выводы, уверенно заявляя о достигнутых успехах в работе, несмотря на скудность улик. Первые тестировщики отмечают, что Opus 4.8 с большей вероятностью указывает на неопределенность в своей работе и с меньшей — делает ничем не подкрепленные заявления. Это подтверждается нашими оценками, которые показывают, что Opus 4.8 примерно в четыре раза реже своего предшественника оставляет незамеченными изъяны в написанном им коде.

Как всегда, перед выпуском модели мы провели подробную оценку её соответствия этическим нормам (alignment). Что касается положительных черт, наша команда по согласованию пришла к выводу, что Opus 4.8 «достигает новых высот по нашим метрикам просоциальных качеств, таких как поддержка автономии пользователя и действо в интересах пользователя». Оценка также показала, что уровень несогласованного поведения Opus 4.8 (такого как дезинформация или содействие неправомерному использованию) существенно ниже, чем у Opus 4.7, и близок к нашей модели с наилучшим согласованием — Claude Mythos Preview. Полная оценка соответствия, сопровождаемая набором тестов безопасности перед развертыванием, представлена в системной карте Claude Opus 4.8.

Также сегодня запускается

В дополнение к Claude Opus 4.8 мы выпускаем следующие обновления:

  • Динамические рабочие процессы (Dynamic workflows). Эта новая функция, доступная в рамках исследовательского превью, позволяет Claude брать на себя еще более масштабные задачи в Claude Code. Claude может спланировать работу, а затем запустить сотни параллельных субагентов в рамках одной сессии (при этом с Opus 4.8 агенты могут работать еще дольше). После этого модель проверяет свои результаты перед отправкой отчета пользователю. Например, Claude Code с Opus 4.8 теперь может выполнять миграции в масштабе всей кодовой базы, охватывающие сотни тысяч строк кода — от старта до слияния веток, используя существующий набор тестов в качестве критерия качества. Вы можете узнать больше о динамических рабочих процессах, доступных в планах Claude Code для предприятий, команд и тарифе Max, в этой статье.
  • Контроль интенсивности (Effort control) в claude.ai и Cowork. Новый элемент управления рядом с селектором моделей позволяет пользователям выбирать, сколько усилий Claude вкладывает в формирование ответа. При настройках с более высокой интенсивностью Claude будет думать чаще и глубже, чтобы выдавать лучшие результаты. При более низких настройках Claude будет отвечать быстрее и медленнее расходовать лимиты пользователя. Теперь у пользователей есть такой выбор — контроль интенсивности доступен на всех тарифных планах.
  • API Messages теперь принимает системные записи внутри массива messages. Разработчики могут обновлять инструкции Claude прямо во время выполнения задачи без сброса кэша промптов или перенаправления обновления через пользовательский запрос. Это можно использовать в специальной обертке (harness) для обновления разрешений, бюджетов токенов или контекста среды по мере работы агента.

Заметка об интенсивности работы

Для Opus 4.8 по умолчанию установлена высокая интенсивность (high effort), которую мы считаем наилучшим общим балансом качества и пользовательского опыта. При решении задач по программированию этот уровень затрачивает примерно столько же токенов, сколько стандартный режим Opus 4.7, но обеспечивает более высокую производительность. Пользователи могут выбрать режим «extra» (»xhigh» в Claude Code) или «max», при этом модель потратит больше токенов для достижения лучших результатов; мы рекомендуем использовать режим «extra» для сложных задач и долго выполняющихся асинхронных рабочих процессов. Мы увеличили лимиты запросов в Claude Code, чтобы учесть повышенное потребление токенов при более высоких уровнях интенсивности; пользователи могут выбрать то, что лучше всего подходит для их конкретного проекта.

Что дальше?

Пользователи обнаружат, что Opus 4.8 представляет собой скромное, но ощутимое улучшение по сравнению с предшественником. Предстоит сделать еще многое: мы работаем над созданием и выпуском моделей, которые будут обеспечивать многие возможности Opus по более низкой цене.

Мало того, мы планируем выпустить новый класс моделей с еще более высоким уровнем интеллекта, чем у Opus. В рамках проекта Glasswing небольшое число организаций в настоящее время использует Claude Mythos Preview для работы в сфере кибербезопасности. Модели такого уровня возможностей требуют более надежных средств киберзащиты, прежде чем они смогут быть выпущены в общий доступ. Мы быстро продвигаемся в разработке этих средств защиты и рассчитываем предоставить модели класса Mythos всем нашим клиентам в ближайшие недели.

Доступность

Claude Opus 4.8 доступна везде уже сегодня. Цены на обычное использование не изменились по сравнению с Opus 4.7: 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов. Стоимость быстрого режима составляет 10 долларов за миллион входных токенов и 50 долларов за миллион выходных токенов. Разработчики могут использовать claude-opus-4-8 через Claude API.

Сноски

  • Terminal-Bench 2.1: Мы привели результаты для всех моделей с использованием публичной обертки Terminus-2. Результат GPT-5.5 с оберткой Codex CLI составляет 83.4%.
  • OSWorld-Verified: Мы изменили подход к проведению оценки OSWorld-Verified, чтобы более точно отражать производительность модели в реальных условиях, и обновили балл Opus 4.7 до 82.3%. Подробнее об этих обновлениях читайте в системной карте.
  • Finance Agent v2: Модель Gemini 3.5 Flash набирает 57.9% в тесте Finance Agent v2, что является значительным улучшением по сравнению с Gemini 3.1 Pro.

Полный текст статьи читайте на Anthropic