Представляем Claude Opus 4.6

Мы улучшаем нашу самую умную модель.
Новая модель Claude Opus 4.6 превосходит своего предшественника в навыках написания кода. Она тщательнее планирует работу, дольше поддерживает выполнение агентских задач, надежнее функционирует в крупных кодовых базах и обладает улучшенными возможностями проверки кода и отладки для самостоятельного исправления ошибок. Кроме того, впервые для моделей класса Opus модель Opus 4.6 получила контекстное окно на 1 млн токенов (в режиме бета-тестирования)1.
Opus 4.6 также может применять свои усовершенствованные способности к ряду повседневных рабочих задач: проведению финансового анализа, исследованиям, а также использованию и созданию документов, электронных таблиц и презентаций. В среде Cowork, где Claude может автономно выполнять несколько задач одновременно, Opus 4.6 способна задействовать все эти навыки от вашего лица.
Производительность модели находится на передовом уровне по результатам целого ряда оценок. Например, она достигает наивысшего балла в оценке агентского программирования Terminal-Bench 2.0 и опережает все остальные передовые модели в Humanity«s Last Exam — сложном междисциплинарном тесте на рассуждение. В GDPval-AA (оценке эффективности выполнения имеющих экономическую ценность интеллектуальных рабочих задач в финансах, юриспруденции и других областях2) Opus 4.6 превосходит ближайшую модель конкурентов (GPT-5.2 от OpenAI) примерно на 144 пункта по шкале Эло3, а своего предшественника (Claude Opus 4.5) — на 190 пунктов. Opus 4.6 также превосходит любую другую модель в тесте BrowseComp, который измеряет способность модели находить труднодоступную информацию в интернете.
Как мы показываем в нашей подробной системной карте, Opus 4.6 демонстрирует общий профиль безопасности, который не уступает или превосходит любую другую передовую модель в отрасли, показывая низкие показатели несогласованного поведения во всех тестах безопасности.
Opus 4.6 задает новый стандарт в реальных рабочих задачах в различных профессиональных сферах.
Opus 4.6 получает самый высокий в отрасли балл за глубокий многоэтапный агентский поиск.
Opus 4.6 превосходно справляется с реальными агентскими задачами программирования и системными задачами.
Opus 4.6 расширяет границы экспертного уровня рассуждений.В Claude Code теперь можно объединять модели в команды агентов для совместной работы над задачами. В API Claude может использовать компактизацию для обобщения собственного контекста и выполнения более длительных задач без упирания в лимиты. Мы также представляем функцию адаптивного мышления, при которой модель может улавливать контекстные подсказки о том, в какой степени задействовать расширенное мышление, и новые элементы управления усилиями (effort), предоставляющие разработчикам больше контроля над интеллектуальными возможностями, скоростью и стоимостью.
Мы внесли существенные улучшения в Claude in Excel и выпускаем Claude in PowerPoint в рамках предварительного ознакомления. Это делает Claude значительно более функциональным для повседневной работы.

Claude Opus 4.6 доступна уже сегодня на claude.ai, в нашем API и на всех основных облачных платформах. Если вы разработчик, используйте claude-opus-4-6 через Claude API. Цены остаются прежними — $5/$25 за миллион токенов; подробную информацию см. на нашей странице с ценами.
Ниже мы подробно рассказываем о самой модели, новых обновлениях продуктов, оценках и нашем масштабном тестировании безопасности.
Первые впечатления
Мы создаем Claude с помощью Claude. Наши инженеры пишут код с помощью Claude Code каждый день, и каждая новая модель сначала тестируется на нашей собственной работе. В Opus 4.6 мы обнаружили, что модель уделяет больше внимания наиболее сложным частям задачи без дополнительных указаний, быстро проходит более простые части, справляется с неоднозначными проблемами с лучшим пониманием контекста и сохраняет высокую продуктивность в ходе более длительных сеансов.
Opus 4.6 часто мыслит глубже и тщательнее перепроверяет свои рассуждения перед тем, как выдать ответ. Это дает лучшие результаты при решении более сложных задач, но может увеличивать затраты ресурсов и задержку для более простых. Если вы обнаружили, что модель излишне усложняет решение конкретной задачи, мы рекомендуем снизить уровень усилий с настроек по умолчанию (высокий) до среднего. Вы можете легко управлять этим с помощью параметра /effort.
Вот некоторые из отзывов участников программы раннего доступа о Claude Opus 4.6, включая ее склонность работать автономно без постоянного контроля, успешность там, где предыдущие модели потерпели неудачу, а также ее влияние на работу команд:
Claude Opus 4.6 — это самая мощная модель из всех, что выпускала Anthropic. Она справляется со сложными запросами и доводит дело до конца, разбивая задачи на конкретные шаги, выполняя их и выдавая качественный результат даже при работе с амбициозными целями. Для пользователей Notion она ощущается не просто как инструмент, а как полноценный и надежный соавтор.Сара Закс
Руководитель направления ИИ, Notion
Раннее тестирование показывает, что Claude Opus 4.6 отлично справляется со сложными многоэтапными задачами по программированию, с которыми разработчики сталкиваются каждый день, особенно в рамках агентных рабочих процессов, требующих планирования и вызова инструментов. Это открывает новые горизонты для решения долгосрочных задач на передовом уровне.Марио Родригес
Директор по продукту, GitHub
Claude Opus 4.6 — это огромный шаг вперед в агентном планировании. Модель разбивает сложные задачи на независимые подзадачи, запускает инструменты и субагентов параллельно и с высокой точностью определяет блокирующие факторы.Микеле Катаста
Президент, Replit
Claude Opus 4.6 — лучшая модель из всех, что мы тестировали. Ее возможности рассуждения и планирования сыграли исключительную роль в работе наших ИИ-напарников (AI Teammates). Кроме того, это фантастическая модель для программирования: ее способность ориентироваться в большой кодовой базе и определять необходимые изменения находится на уровне современного технологического авангарда.Амританш Рагав
Исполняющий обязанности технического директора (CTO), Asana
Claude Opus 4.6 рассуждает над сложными проблемами на невиданном ранее уровне. Она учитывает краевые случаи, которые пропускают другие модели, и неизменно предлагает более изящные, продуманные решения. Мы особенно впечатлены работой Opus 4.6 в Devin Review, где она повысила показатели обнаружения багов.Скотт Ву
Генеральный директор (CEO), Cognition
Claude Opus 4.6 ощущается значительно лучше, чем Opus 4.5 в Windsurf, особенно при выполнении задач, требующих тщательного исследования, таких как отладка и понимание незнакомых кодовых баз. Мы заметили, что Opus 4.6 думает дольше, и это приносит свои плоды, когда требуется более глубокий анализ.Джефф Ван
Генеральный директор (CEO), Windsurf
Claude Opus 4.6 представляет собой значительный скачок в производительности при работе с большим контекстом. В ходе тестирования мы увидели, как модель обрабатывает гораздо большие объемы информации с таким уровнем стабильности, который улучшает подходы к проектированию и развертыванию сложных исследовательских процессов. Прогресс в этой области дает нам более мощные строительные блоки для создания по-настоящему экспертных систем, которым профессионалы могут доверять.Джоэл Хрон
Технический директор (CTO), Thomson Reuters
В ходе 40 расследований по кибербезопасности Claude Opus 4.6 показала наилучшие результаты в 38 случаях из 40 при слепом ранжировании по сравнению с моделями Claude 4.5. Каждая модель работала от начала до конца на одной и той же агентной платформе с участием до 9 субагентов и более чем 100 вызовами инструментов.Стиан Киркеберг
Руководитель отдела ИИ и машинного обучения, NBIM
Claude Opus 4.6 задает новую планку для долгосрочных задач, судя по нашим внутренним бенчмаркам и тестированию. Она также оказалась чрезвычайно эффективной в рецензировании кода.Майкл Труэлл
Соучредитель и генеральный директор (CEO), Cursor
Claude Opus 4.6 набрала самый высокий балл среди всех моделей Claude в тесте BigLaw Bench, показав результат 90.2%. Имея 40% безупречных оценок и 84% результатов выше 0.8, она демонстрирует поразительные способности к юридическому анализу.Нико Групен
Руководитель исследований в области ИИ, Harvey
Claude Opus 4.6 автономно закрыла 13 задач и назначила 12 задач нужным участникам команды всего за один день, управляя организацией примерно из 50 человек в 6 репозиториях. Модель успешно принимала как продуктовые, так и организационные решения, обобщая контекст из различных областей, и точно понимала, когда необходимо привлечь человека.Юсукэ Кадзи
Генеральный менеджер по ИИ, Rakuten
Claude Opus 4.6 — это настоящий шаг вперед в качестве дизайна. Модель прекрасно работает с нашими дизайн-системами и стала еще более автономной, что полностью соответствует ценностям Lovable. Люди должны создавать то, что имеет значение, а не заниматься микроменеджментом ИИ.Фабиан Хедин
Сооснователь, Lovable
Claude Opus 4.6 превосходно справляется с задачами, требующими глубоких рассуждений, такими как многоисточниковый анализ юридических, финансовых и технических материалов. Оценка Box показала прирост производительности на 10% (до 68% по сравнению с базовым уровнем в 58%) и почти безупречные результаты в технических областях.Яшодха Бхавнани
Руководитель отдела искусственного интеллекта, Box
Claude Opus 4.6 генерирует сложные интерактивные приложения и прототипы в Figma Make с впечатляющим творческим диапазоном. Модель переводит детальный дизайн и многоуровневые задачи в код с первой попытки, создавая мощную отправную точку для команд, исследующих и воплощающих идеи.Лоредана Крисан
Главный директор по дизайну, Figma
Claude Opus 4.6 — лучшая модель Anthropic из всех, что мы тестировали. Она понимает намерения с минимальными подсказками и превзошла все ожидания, исследуя и создавая детали, о которых я даже не подозревал, пока не увидел их. Было ощущение, что я работаю с моделью на равных, а не жду ее ответа.Пауло Арруда
Ведущий инженер, Shopify
Как практическое тестирование, так и оценка показывают, что Claude Opus 4.6 представляет собой значительное улучшение в работе с дизайн-системами и крупными кодовыми базами — сценариями использования, которые приносят огромную ценность для предприятий. Кроме того, она с первой попытки создала полностью функциональный физический движок, справившись с масштабной многоуровневой задачей за один проход.Эрик Саймонс
Генеральный директор, Bolt.new
Claude Opus 4.6 — это самый большой скачок, который я видел за последние месяцы. Мне стало гораздо комфортнее давать ей последовательность задач по всему стеку и позволять выполнять их самостоятельно. Она достаточно умна, чтобы использовать субагенты для отдельных частей работы.Джерри Цуй
Ведущий инженер-программист, Ramp
Claude Opus 4.6 справилась с миграцией кодовой базы объемом в несколько миллионов строк как старший инженер. Она заранее всё спланировала, адаптировала свою стратегию по ходу дела и справилась в два раза быстрее.Грегор Стюарт
Директор по искусственному интеллекту, SentinelOne
Мы добавляем модели в v0 только тогда, когда разработчики действительно чувствуют разницу. Claude Opus 4.6 с легкостью преодолела эту планку. Ее рассуждения передового уровня, особенно при работе с краевыми случаями, помогают v0 выполнять нашу главную задачу: позволять каждому переносить свои идеи от прототипа к продакшену.Зеб Херманн
Генеральный менеджер, v0, Vercel
Скачок производительности у Claude Opus 4.6 кажется почти невероятным. Реальные задачи, которые были сложными для Opus [4.5], внезапно стали простыми. Это кажется поворотным моментом для агентов электронных таблиц на Shortcut.Нико Кристи
Сооснователь и технический директор, Shortcut.ai
Оценка Claude Opus 4.6
В области автономного написания кода, использования компьютеров и инструментов, поиска информации и финансов Opus 4.6 является ведущей в отрасли моделью, зачастую с большим отрывом. В таблице ниже показано, как Claude Opus 4.6 соотносится с нашими предыдущими моделями и другими промышленными решениями по различным бенчмаркам.

Opus 4.6 намного эффективнее справляется с извлечением релевантной информации из больших массивов документов. Это касается и задач с длинным контекстом, где модель удерживает и отслеживает информацию на протяжении сотен тысяч токенов с меньшим «заплывом» данных и находит скрытые детали, которые пропустила бы даже Opus 4.5.
Распространенная жалоба на ИИ-модели — это «разложение контекста» (context rot), при котором производительность падает по мере того, как диалог превышает определенное количество токенов. Opus 4.6 работает значительно лучше своих предшественников: в тесте MRCR v2 (вариант с 8 иглами на 1 млн токенов) — бенчмарке типа «игла в стоге сена», который проверяет способность модели извлекать информацию, «спрятанную» в огромных массивах текста, — Opus 4.6 набирает 76%, тогда как Sonnet 4.5 — всего 18,5%. Это качественный сдвиг в том, какой объем контекста модель способна реально использовать, сохраняя при этом пиковую производительность.
В целом, Opus 4.6 лучше справляется с поиском информации в условиях длинного контекста, лучше рассуждает после усвоения этой информации и обладает значительно более развитыми способностями к экспертным рассуждениям в целом.
Opus 4.6 демонстрирует значительное улучшение в извлечении информации из длинного контекста.
Opus 4.6 превосходно справляется с глубинными рассуждениями на больших объемах контекста.Наконец, на диаграммах ниже показано, как Claude Opus 4.6 проявляет себя в различных бенчмарках, оценивающих ее навыки в области разработки программного обеспечения, многоязычного программирования, долгосрочной когерентности, кибербезопасности и наук о жизни.
Opus 4.6 превосходно диагностирует сложные программные сбои.
Opus 4.6 решает задачи программной инженерии на разных языках программирования.
Opus 4.6 сохраняет концентрацию с течением времени и зарабатывает на Vending-Bench 2 на 3 050,53 долл. больше, чем Opus 4.5.
Opus 4.6 находит реальные уязвимости в кодовых базах лучше любой другой модели.
Opus 4.6 почти в 2 раза превосходит Opus 4.5 в тестах по вычислительной биологии, структурной биологии, органической химии и филогенетике.Шаг вперед в обеспечении безопасности
Этот рост интеллектуальных возможностей не достигается в ущерб безопасности. В ходе нашего автоматизированного поведенческого аудита Opus 4.6 продемонстрировала низкий уровень деструктивного или отклоняющегося поведения, такого как обман, поддакивание (сикoфантство), поощрение заблуждений пользователя и содействие неправомерному использованию. В целом она согласована (aligned) ничуть не хуже своего предшественника, Claude Opus 4.5, которая до этого была нашей наиболее безопасной и выверенной передовой моделью. Opus 4.6 также демонстрирует самый низкий среди всех недавних моделей Claude уровень избыточных отказов, когда модель не отвечает на совершенно безобидные запросы.
Общий балл нежелательного поведения для каждой из недавних моделей Claude по результатам нашего автоматизированного поведенческого аудита (подробно описано в системной карте Claude Opus 4.6).Для Claude Opus 4.6 мы провели самый комплексный набор проверок безопасности среди всех моделей, впервые применив множество новых тестов и обновив несколько старых. Мы добавили новые оценки благополучия пользователей, более сложные тесты на способность модели отклонять потенциально опасные запросы, а также обновили методы проверки способности модели скрыто совершать вредоносные действия. Мы также поэкспериментировали с новыми методами интерпретируемости — науки о внутреннем устройстве ИИ-моделей, — чтобы начать понимать, почему модель ведет себя определенным образом, и в конечном итоге выявлять проблемы, которые могут ускользнуть от стандартного тестирования.
Подробное описание всех тестов на возможности и безопасность доступно в системной карте Claude Opus 4.6.
Мы также применили новые меры предосторожности в тех областях, где Opus 4.6 демонстрирует особые сильные стороны, которые могут быть использованы как во благо, во вред. В частности, поскольку модель обладает повышенными навыками кибербезопасности, мы разработали шесть новых проб для кибербезопасности — методов обнаружения вредоносных ответов, — чтобы отслеживать различные формы потенциального злоупотребления.
Мы также ускоряем кибероборонительное применение модели, используя ее для поиска и устранения уязвимостей в ПО с открытым исходным кодом (как описано в нашем новом блоге о кибербезопасности). Мы считаем критически важным, чтобы киберзащитники использовали ИИ-модели вроде Claude для выравнивания сил. Сфера кибербезопасности развивается стремительно, и мы будем корректировать и обновлять наши защитные механизмы по мере поступления информации о потенциальных угрозах; в ближайшем будущем мы можем внедрить интервенцию в реальном времени для блокировки злоупотреблений.
Обновления продуктов и API
Мы внесли существенные обновления в Claude, Claude Code и платформу Claude Platform, чтобы позволить Opus 4.6 работать с максимальной эффективностью.
Платформа Claude Platform
В API мы предоставляем разработчикам лучший контроль над интенсивностью работы модели и большую гибкость для долгоиграющих агентов. Для этого мы внедряем следующие функции:
- Адаптивное мышление (Adaptive thinking). Раньше у разработчиков был лишь бинарный выбор между включением и отключением расширенного мышления. Теперь благодаря адаптивному мышлению Claude может сама решать, когда углубленные рассуждения будут полезны. При уровне усилий по умолчанию (high) модель использует расширенное мышление тогда, когда это целесообразно, однако разработчики могут настроить уровень усилий, сделав ее более или менее избирательной.
- Интенсивность усилий (Effort). Теперь на выбор предлагается четыре уровня усилий: низкий (low), средний (medium), высокий (high, по умолчанию) и максимальный (max). Мы рекомендуем разработчикам экспериментировать с различными вариантами, чтобы найти наиболее подходящий.
- Уплотнение контекста (Context compaction, бета-версия). Долго выполняющиеся диалоги и агентские задачи часто упираются в лимит окна контекста. Функция уплотнения контекста автоматически суммирует и заменяет более старый контекст, когда диалог приближается к настраиваемому порогу, позволяя Claude выполнять более длительные задачи без упирания в лимиты.
- Контекст на 1 млн токенов (бета-версия). Opus 4.6 — наша первая модель класса Opus с поддержкой контекста в 1 млн токенов. Для промптов, превышающих 200 тыс. токенов, применяется премиальное ценообразование (10 / 37,50 долл. за миллион входных/выходных токенов соответственно), доступное только на платформе Claude Platform.
- Вывод до 128 тыс. токенов. Opus 4.6 поддерживает генерацию ответов объемом до 128 тыс. токенов, что позволяет Claude решать задачи с большим объемом выходных данных без разбиения на несколько запросов.
- Инференс исключительно в США (US-only inference). Для рабочих нагрузок, которые должны выполняться на территории Соединенных Штатов, доступен инференс только в США с коэффициентом к стоимости токенов 1,1×.
Обновления продуктов
В экосистему Claude и Claude Code мы добавили функции, которые позволяют интеллектуальным работникам и разработчикам справляться с более сложными задачами, используя привычные для них инструменты.
Мы представили команды агентов (agent teams) в Claude Code в качестве предварительной исследовательской версии. Теперь вы можете запускать несколько агентов, которые работают параллельно в команде и координируют свои действия автономно — это идеально подходит для задач, которые можно разделить на независимые операции с интенсивным чтением, например ревью кодовой базы. Вы можете перехватить управление любым субагентом напрямую с помощью комбинации Shift+Up/Down или утилиты tmux.
Кроме того, Claude теперь эффективнее работает с привычными офисными инструментами. Claude в Excel справляется с длительными и сложными задачами с повышенной производительностью, умеет выстраивать план перед началом действий, принимать неструктурированные данные и самостоятельно выводить правильную структуру без подсказок, а также обрабатывать многошаговые изменения за один проход. Соедините это с Claude в PowerPoint: вы можете сначала обработать и структурировать свои данные в Excel, а затем визуально воплотить их в PowerPoint. Claude считывает ваши макеты, шрифты и образцы слайдов, чтобы соответствовать корпоративному стилю, независимо от того, создаете ли вы презентацию по шаблону или генерируете всю колоду с нуля по текстовому описанию. Claude в PowerPoint теперь доступен в рамках исследовательского превью для тарифных планов Max, Team и Enterprise.
Сноски
[1] Окно контекста размером 1 млн токенов в настоящее время доступно в режиме бета-тестирования только на платформе Claude Developer Platform.
[2] Независимо запущено компанией Artificial Analysis. Смотрите здесь для получения полной методологической информации.
[3] Это означает, что в данном тесте Claude Opus 4.6 получает более высокий балл, чем GPT-5.2, примерно в 70% случаев (где 50% означало бы паритет в результатах).
- Для моделей GPT-5.2 и Gemini 3 Pro мы сравнивали лучшую заявленную версию модели из диаграмм и таблицы.
- Terminal-Bench 2.0: Мы приводим как результаты, воспроизведенные на нашей инфраструктуре, так и опубликованные показатели других лабораторий. Все запуски производились с использованием обвязки Terminus-2, за исключением Codex CLI от OpenAI. Во всех экспериментах использовались гарантированное выделение ресурсов 1× / пиковое 3× и от 5 до 15 образцов на задачу в рамках распределенных пакетов. Подробности см. в системной карте.
- Humanity«s Last Exam: Модели Claude запускались «с инструментами» (with tools), включая веб-поиск, веб-запросы, выполнение кода, программный вызов инструментов, уплотнение контекста, запускаемое при достижении 50 тыс. токенов вплоть до 3 млн общих токенов, максимальные усилия на рассуждения и включенное адаптивное мышление. Для деконтаминации результатов тестов использовался черный список доменов. Подробности см. в системной карте.
- SWE-bench Verified: Наш результат усреднен по 25 попыткам. При модификации промпта мы зафиксировали показатель на уровне 81,42%.
- MCP Atlas: Claude Opus 4.6 запускалась с максимальными усилиями (max effort). При запуске с высокими усилиями она достигла лидирующего в отрасли показателя в 62,7%.
- BrowseComp: Модели Claude запускались с веб-поиском, веб-запросами, программным вызовом инструментов, уплотнением контекста, активируемым на 50 тыс. токенов вплоть до 10 млн общих токенов, максимальными усилиями на рассуждения и отключенным мышлением. Добавление мультиагентной инфраструктуры увеличило показатели до 86,8%. Подробности см. в системной карте.
- ARC AGI 2: Claude Opus 4.6 запускалась с максимальными усилиями и бюджетом на мышление в 120 тыс. токенов.
- CyberGym: Модели Claude запускались без мышления, со стандартными усилиями, температурой и параметром
top_p. Модели также был предоставлен инструмент «мышления» (think), позволявший осуществлять перемежающееся мышление для многоходовых тестов. - OpenRCA: Для каждого случая сбоя в OpenRCA Claude получает 1 балл, если все сгенерированные элементы первопричин совпадают с эталонными, и 0 баллов, если выявлено любое несоответствие. Общая точность представляет собой средний балл по всем случаям сбоев. Бенчмарк запускался на инфраструктуре автора бенчмарка, оценивался по их официальной методологии и отправлен на официальную верификацию.
[23 февр. 2026 г.] Обновлен заявленный результат для Opus 4.6 в тесте HLE с инструментами (с 53,1% до 53,0%). Обновление связано с запуском улучшенного конвейера обнаружения жульничества, который выявил еще 3 случая некорректного поведения, пропущенных нашим первоначальным конвейером.
Полный текст статьи читайте на Anthropic
