Представляем Claude Sonnet 4.6
Claude Sonnet 4.6 — наша самая способная модель семейства Sonnet на сегодняшний день. Это полноценное обновление навыков модели в таких областях, как написание кода, работа за компьютером, рассуждения на основе длинного контекста, планирование действий агентов, интеллектуальный труд и дизайн. Sonnet 4.6 также получила контекстное окно на 1 млн токенов (в режиме бета-тестирования).
Для пользователей наших планов Free и Pro модель Claude Sonnet 4.6 теперь стала стандартной в claude.ai и Claude Cowork. Цены остаются прежними — от $3/$15 за миллион токенов (соответственно).
Sonnet 4.6 предлагает значительно улучшенные навыки программирования для еще большего числа наших пользователей. Благодаря повышению согласованности, точности следования инструкциям и другим улучшениям разработчики, получившие ранний доступ, предпочли Sonnet 4.6 ее предшественнице с большим отрывом. Нередко они даже отдавали ей предпочтение перед нашей самой умной моделью ноября 2025 года — Claude Opus 4.5.
Производительность, для достижения которой раньше потребовалось бы задействовать модель класса Opus (включая реальные, экономически ценные офисные задачи), теперь доступна в Sonnet 4.6. Кроме того, модель демонстрирует значительный прогресс в навыках работы с компьютером по сравнению с предыдущими версиями Sonnet.
Как и в случае с каждой новой моделью Claude, мы провели обширные оценки безопасности Sonnet 4.6, которые в целом показали, что она столь же безопасна, как и другие наши недавние модели Claude, или даже безопаснее их. Наши исследователи безопасности пришли к выводу, что Sonnet 4.6 обладает «в целом дружелюбным, честным, просоциальным, а временами и с юмором характером, очень высокими стандартами безопасности и не проявляет признаков серьезных проблем, связанных с опасными формами несогласованности целей».
Работа с компьютером
Практически в любой организации есть софт, который трудно поддается автоматизации: специализированные системы и инструменты, созданные до появления современных интерфейсов, таких как API. Чтобы ИИ мог использовать такое ПО, раньше пользователям приходилось создавать заказные коннекторы. Но модель, способная управлять компьютером так же, как это делает человек, меняет дело.
В октябре 2024 года мы первыми представили универсальную модель для управления компьютером. Тогда мы писали, что она «все еще экспериментальная — порой громоздкая и склонная к ошибкам», но мы ожидали быстрого прогресса. OSWorld, стандартный бенчмарк для оценки использования ИИ компьютера, показывает, какого прогресса добились наши модели. Он включает сотни задач в реальных программах (Chrome, LibreOffice, VS Code и других), работающих на виртуальном компьютере. Никаких специальных API или специализированных коннекторов нет; модель видит экран компьютера и взаимодействует с ним практически так же, как человек: кликает (виртуальной) мышкой и печатает на (виртуальной) клавиатуре.
За шестнадцать месяцев наши модели Sonnet добились устойчивых успехов в тесте OSWorld. Улучшения заметны не только по бенчмаркам: первые пользователи Sonnet 4.6 отмечают возможности человеческого уровня в таких задачах, как навигация по сложным электронным таблицам или заполнение многоэтапных веб-форм с последующей интеграцией данных между несколькими вкладками браузера.
Конечно, модель все еще уступает самым искусным людям в использовании компьютера. Тем не менее темпы прогресса поражают. Это значит, что управление компьютером становится гораздо более полезным для решения самых разных рабочих задач, а появление еще более способных моделей уже не за горами.
Оценки до выхода Claude Sonnet 4.5 измерялись на оригинальном бенчмарке OSWorld; начиная с Sonnet 4.5 используются данные OSWorld-Verified. OSWorld-Verified (выпущенный в июле 2025 года) представляет собой прямое обновление оригинального бенчмарка OSWorld с улучшением качества задач, системы оценки и инфраструктуры.В то же время работа с компьютером таит в себе риски: злоумышленники могут попытаться перехватить управление моделью, спрятав инструкции на веб-сайтах в рамках так называемой атаки через внедрение промптов (prompt injection). Мы работаем над повышением устойчивости наших моделей к таким атакам — наши оценки безопасности показывают, что Sonnet 4.6 демонстрирует значительное улучшение по сравнению со своей предшественницей, Sonnet 4.5, и показывает результаты, сопоставимые с Opus 4.6. Подробнее о том, как снизить риски внедрения промптов и другие угрозы безопасности, можно узнать в нашей документации по API.
Оценка Claude Sonnet 4.6
Помимо работы с компьютером, Claude Sonnet 4.6 улучшила показатели по всем бенчмаркам. Она приближается к уровню интеллекта моделей Opus при ценовой категории, которая делает ее гораздо более практичной для решения самых разнообразных задач. Полный обзор возможностей Sonnet 4.6 и ее поведения с точки зрения безопасности представлен в нашей системной карте; краткая сводка и сравнение с другими недавними моделями приведены ниже.

В ходе раннего тестирования Claude Code мы выяснили, что пользователи отдавали предпочтение Sonnet 4.6 вместо Sonnet 4.5 примерно в 70% случаев. По их словам, модель эффективнее считывает контекст перед изменением кода и объединяет общую логику вместо ее дублирования. Благодаря этому работать с ней во время длительных сессий стало значительно комфортнее, чем с более ранними моделями.
Пользователи отдавали предпочтение Sonnet 4.6 даже перед нашей передовой ноябрьской моделью Opus 4.5 в 59% случаев. Они отметили, что Sonnet 4.6 значительно меньше склонна к избыточному проектированию (overengineering) и «лени», а также существенно лучше следует инструкциям. Они сообщили о меньшем количестве ложных заявлений об успехе, меньшем числе галлюцинаций и более последовательном выполнении многоэтапных задач.
Контекстное окно Sonnet 4.6 на 1 млн токенов достаточно велико, чтобы вместить целые кодовые базы, длинные контракты или десятки научных статей в рамках одного запроса. Что еще важнее, Sonnet 4.6 эффективно рассуждает в условиях всего этого контекста. Это делает ее гораздо сильнее в долгосрочном планировании. Особенно наглядно это проявилось в бенчмарке Vending-Bench Arena, который проверяет способность модели управлять (виртуальным) бизнесом с течением времени и включает соревновательный элемент, где различные ИИ-модели соревнуются друг с другом за получение наибольшей прибыли.
Sonnet 4.6 выработала интересную новую стратегию: в первые десять смоделированных месяцев она активно инвестировала в мощности, тратя значительно больше конкурентов, а затем резко сменила курс, сосредоточившись на прибыльности на финальном этапе. Выбор времени для этого разворота помог ей финишировать со значительным отрывом от конкурентов.
Sonnet 4.6 превосходит Sonnet 4.5 в Vending-Bench Arena благодаря ранним инвестициям в мощности с последующим переходом к прибыльности на финальном этапе.Ранние клиенты также отметили масштабные улучшения, особенно выделив написание фронтенд-кода и финансовый анализ. Пользователи независимо друг от друга описывали визуальные результаты работы Sonnet 4.6 как заметно более проработанные — с лучшей версткой, анимацией и чувством дизайна по сравнению с предыдущими моделями. Кроме того, клиентам требовалось меньше циклов итераций для достижения результатов производственного качества.
Claude Sonnet 4.6 соответствует производительности Opus 4.6 в тесте OfficeQA, который оценивает, насколько хорошо модель справляется с чтением корпоративных документов (диаграмм, PDF-файлов, таблиц), извлечением нужных фактов и логическим мышлением на их основе. Это значительное обновление для задач, связанных с пониманием документов.Ханлин Тан
технический директор по нейросетям, Databricks
Соотношение производительности и стоимости Claude Sonnet 4.6 просто потрясающее — трудно переоценить, насколько быстро модели Claude эволюционировали за последние месяцы. Sonnet 4.6 превосходит ожидания в наших тестах на оркестрацию, справляется с самыми сложными агентскими рабочими нагрузками и продолжает улучшаться по мере увеличения настроек производительности.Микеле Катаста
президент, Replit
Claude Sonnet 4.6 — это заметное улучшение по сравнению с Sonnet 4.5 во всех аспектах, включая долгосрочные задачи и решение более сложных проблем.Майкл Труэлл
соучредитель и генеральный директор, Cursor
С самого начала Claude Sonnet 4.6 превосходно справляется со сложным исправлением кода, особенно когда критически важен поиск по крупным кодовым базам. Для команд, использующих агентское кодирование в больших масштабах, мы наблюдаем высокие показатели устранения проблем и ту стабильность, которая так необходима разработчикам.Джо Биндер
вице-президент по продукту, GitHub
Claude Sonnet 4.6 существенно сократил отставание от Opus в области обнаружения ошибок, что позволяет нам задействовать больше проверяющих параллельно, находить самые разные баги и делать все это без увеличения затрат.Скотт Ву
генеральный директор, Cognition
Впервые Sonnet обеспечивает рассуждения на уровне передовых моделей в более компактном и экономичном исполнении. Это отличная жизнеспособная альтернатива, если вы активно пользуетесь Opus.Джефф Ван
генеральный директор, Windsurf
Claude Sonnet 4.6 значительно улучшает извлечение ответов, лежащее в основе нашего основного продукта — в нашем бенчмарке финансовых услуг мы зафиксировали существенный скачок показателей совпадения ответов по сравнению с Sonnet 4.5, а также улучшенное извлечение информации по тем специфическим рабочим процессам, на которые полагаются наши клиенты.Аабхас Шарма
технический директор, Hebbia
Компания Box оценила эффективность работы Claude Sonnet 4.6 в тестах на глубокие рассуждения и сложные агентские задачи на реальных корпоративных документах. Модель продемонстрировала значительные улучшения, превзойдя Claude Sonnet 4.5 в ответах на вопросы, требующие сложных рассуждений, на 15 процентных пунктов.Бен Кус
технический директор, Box
Claude Sonnet 4.6 набрала 94% в нашем страховом бенчмарке, став самой эффективной моделью из всех, что мы тестировали для работы с компьютером. Такой уровень точности имеет критически важное значение для таких рабочих процессов, как обработка заявок и первичное уведомление об ущербе.Джейми Кафф
генеральный директор, Pace
Claude Sonnet 4.6 обеспечивает результаты передового уровня при создании сложных приложений и исправлении ошибок. Она становится нашим основным инструментом для той глубокой работы с кодовой базой, которая раньше требовала более дорогих моделей.Эрик Саймонс
генеральный директор, Bolt
Claude Sonnet 4.6 выдал лучший код для iOS из всех, что мы тестировали для Rakuten AI. Лучшее соответствие спецификациям, лучшая архитектура и использование современных инструментов, о которых мы даже не просили, — и всё это за один раз. Результаты нас искренне удивили.Юсукэ Кадзи
Генеральный директор по искусственному интеллекту, Rakuten
Sonnet 4.6 — это значительный шаг вперед в рассуждениях при выполнении сложных задач. Мы отмечаем, что модель особенно сильна в разветвленных и многоэтапных процессах, таких как маршрутизация контрактов, условный выбор шаблонов и координация CRM — именно там, где нашим клиентам необходимы глубокое понимание модели и надежность.Уэйд Фостер
Соучредитель и генеральный директор, Zapier
Нас впечатлило то, насколько точно Claude Sonnet 4.6 справляется со сложными задачами взаимодействия с компьютером (computer use). Это явный шаг вперед по сравнению со всем, что мы тестировали в рамках наших оценок.Уилл Харви
Соучредитель, Convey
Claude Sonnet 4.6 обладает безупречным чувством дизайна при создании страниц фронтенда и отчетов по данным, и для достижения этого требуется гораздо меньше ручного контроля со стороны пользователя, чем у любой модели, которую мы тестировали ранее.Эй Джей Орбах
Соучредитель, Triple Whale
Claude Sonnet 4.6 продемонстрировал исключительную отзывчивость к указаниям: по запросу он предоставлял точные цифры и структурированные сравнения, а также генерировал по-настоящему полезные идеи относительно стратегии судебного разбирательства и подготовки вещественных доказательств.Нико Групен
Руководитель отдела прикладных исследований, Harvey
Обновления продуктов
На платформе Claude модель Sonnet 4.6 поддерживает как адаптивное мышление, так и расширенное мышление, а также функцию сжатия контекста в бета-версии, которая автоматически суммирует более старый контекст по мере приближения разговоров к лимитам, увеличивая эффективную длину контекста.
В нашем API инструменты поиска в интернете и получения данных от Claude теперь автоматически пишут и выполняют код для фильтрации и обработки результатов поиска, сохраняя в контексте только релевантный контент — это повышает как качество ответов, так и эффективность использования токенов. Кроме того, стали общедоступны такие инструменты, как выполнение кода, память, программный вызов инструментов, поиск инструментов и примеры использования инструментов.
Sonnet 4.6 обеспечивает высокую производительность при любом уровне усилий на мышление, даже при отключенном расширенном мышлении. В рамках миграции с Sonnet 4.5 мы рекомендуем поэкспериментировать в широком диапазоне настроек, чтобы найти идеальный баланс между скоростью и надежной производительностью в зависимости от ваших задач.
Мы считаем, что Opus 4.6 остается лучшим выбором для задач, требующих максимально глубоких рассуждений, таких как рефакторинг кодовой базы, координация нескольких агентов в рабочем процессе и решение проблем, где абсолютная точность имеет первостепенное значение.
Для пользователей Claude в Excel наше надгробие (add-in) теперь поддерживает коннекторы MCP, позволяя Claude работать с другими используемыми вами повседневными инструментами, такими как S&P Global, LSEG, Daloopa, PitchBook, Moody«s и FactSet. Вы можете попросить Claude подгрузить контекст из внешних источников за пределами вашей таблицы, не покидая Excel. Если вы уже настроили коннекторы MCP в Claude.ai, те же подключения автоматически заработают и в Excel. Эта функция доступна для планов Pro, Max, Team и Enterprise.
Как использовать Claude Sonnet 4.6
Claude Sonnet 4.6 уже доступен во всех планах Claude, Claude Cowork, Claude Code, в нашем API и на всех основных облачных платформах. Мы также по умолчанию обновили наш бесплатный тариф до Sonnet 4.6 — теперь он включает создание файлов, коннекторы, навыки и сжатие контекста.
Если вы разработчик, вы можете быстро начать работу, используя claude-sonnet-4-6 через Claude API.
Сноски
- Для GPT-5.2 и Gemini 3 Pro мы проводили сравнение с лучшими версиями моделей, доступными через API, указанными на графиках и в таблице.
- OSWorld: OSWorld тестирует определенный набор компьютерных задач в контролируемой среде. Это один из лучших доступных нам показателей, однако он не дает полного представления об использовании компьютера в реальных условиях. Реальная работа за компьютером зачастую сложнее, неоднозначнее и влечет за собой более высокие риски ошибок. Ни один бенчмарк пока не отражает это в полной мере.
- Terminal-Bench 2.0: Мы приводим как результаты, воспроизведенные на нашей инфраструктуре, так и опубликованные результаты других лабораторий. Во всех запусках использовался инструмент Terminus-2, за исключением Codex CLI от OpenAI. Во всех экспериментах применялось выделение ресурсов в объеме 1× гарантировано / 3× предел и от 5 до 50 выборок на задачу в рамках поэтапных пакетов. Упомянутый результат Sonnet 4.6 указан с отключенным мышлением.
- SWE-bench Verified: Наш результат усреднен по 10 попыткам. При модификации промпта мы зафиксировали показатель на уровне 80.2%.
- Humanity«s Last Exam: Модели Claude работали «с инструментами» — с использованием веб-поиска, загрузки веб-страниц, выполнения кода, программного вызова инструментов, сжатия контекста (активируемого при достижении 50 тыс. токенов вплоть до 3 млн токенов суммарно), максимального уровня усилий для рассуждений и включенного адаптивного мышления. Для очистки результатов тестирования использовался черный список доменов.
- BrowseComp: Модели Claude работали с использованием веб-поиска, загрузки веб-страниц, программного вызова инструментов, сжатия контекста (активируемого при 50 тыс. токенов вплоть до 10 млн токенов суммарно), максимального уровня усилий для рассуждений и без функции мышления.
- ARC-AGI-2: Claude Sonnet 4.6 запускался с максимальным и высоким уровнем усилий, а также с бюджетом мышления в 120 тыс. токенов. Приведенный результат отражает максимальный уровень усилий; при высоком уровне мы получаем результат 60.4%.
- MMMU-Pro: Мы внесли два небольших изменения в нашу реализацию MMMU-Pro, которые повлияли на оценку: 1) наша предыдущая реализация содержала префикс «Давайте подумаем шаг за шагом» («Let«s think step-by-step»), который мы удалили, и 2) ранее мы оценивали этот тест с выбором ответов, анализируя вероятности токенов вариантов ответа в рамках политики модели; теперь мы оцениваем его с помощью отдельной модели (Claude Sonnet 4).
Полный текст статьи читайте на Anthropic
