Представляем функции управления компьютером, новую модель Claude 3.5 Sonnet и Claude 3.5 Haiku

An illustration of Claude navigating a computer cursor

Обновление (03.12.2024): Мы пересмотрели цены на Claude 3.5 Haiku. Теперь стоимость модели составляет $0.80 за млн токенов на вход / $4 за млн токенов на выход.

Сегодня мы анонсируем обновленную версию Claude 3.5 Sonnet и новую модель — Claude 3.5 Haiku. Усовершенствованная Claude 3.5 Sonnet демонстрирует улучшения по всем направлениям по сравнению со своим предшественником, причем наиболее значительный прирост наблюдается в написании кода — сфере, в которой она и так была лидером. Claude 3.5 Haiku соответствует по производительности Claude 3 Opus (нашей предыдущей крупнейшей модели) во многих тестах, сохраняя при этом скорость работы на уровне предыдущего поколения Haiku.

Мы также представляем новую революционную функцию в режиме публичного бета-тестирования: управление компьютером (computer use). Начиная с сегодняшнего дня через API разработчики могут давать Claude указания взаимодействовать с компьютером так же, как это делают люди — глядя на экран, перемещая курсор, нажимая кнопки и вводя текст. Claude 3.5 Sonnet стала первой передовой ИИ-моделью, предложившей функцию управления компьютером в публичной бета-версии. На данном этапе эта функция остается экспериментальной — порой она бывает громоздкой и склонной к ошибкам. Мы выпускаем функцию управления компьютером на раннем этапе для сбора отзывов от разработчиков и рассчитываем на ее быстрое развитие в будущем.

Asana, Canva, Cognition, DoorDash, Replit и The Browser Company уже начали изучать эти возможности для выполнения задач, требующих десятков, а иногда и сотен шагов. Например, Replit использует возможности Claude 3.5 Sonnet по управлению компьютером и навигации по пользовательскому интерфейсу для разработки ключевой функции, которая оценивает приложения в процессе их создания для продукта Replit Agent.

Обновленная Claude 3.5 Sonnet теперь доступна всем пользователям. Начиная с сегодняшнего дня разработчики могут создавать решения с использованием бета-версии управления компьютером через Anthropic API, Amazon Bedrock и Google Cloud«s Vertex AI. Новая Claude 3.5 Haiku будет выпущена позднее в этом месяце.

Claude 3.5 Sonnet: передовые навыки разработки программного обеспечения

Обновленная модель Claude 3.5 Sonnet демонстрирует масштабные улучшения в отраслевых бенчмарках, причем особенно сильный рост заметен в задачах агентного программирования (agentic coding) и использования инструментов. В написании кода показатель успешности решения задач на бенчмарке SWE-bench Verified вырос с 33,4% до 49,0%, что выше результатов всех общедоступных моделей, включая рассуждающие модели вроде OpenAI o1-preview и специализированные системы для агентного программирования. Модель также улучшила результаты на TAU-bench (задаче на использование агентных инструментов): с 62,6% до 69,2% в сфере розничной торговли и с 36,0% до 46,0% в более сложной сфере авиаперевозок. Новая Claude 3.5 Sonnet предлагает эти достижения по той же цене и с той же скоростью, что и предшественница.

Первые отзывы клиентов показывают, что усовершенствованная Claude 3.5 Sonnet представляет собой значительный скачок в области разработки ПО с поддержкой ИИ. В GitLab, где модель тестировалась для задач DevSecOps, отметили более мощные возможности рассуждения (прирост до 10% в различных сценариях использования) без дополнительной задержки, что делает её идеальным выбором для многоэтапных процессов разработки программного обеспечения. Компания Cognition использует новую Claude 3.5 Sonnet для автономной оценки работы ИИ и отметила существенные улучшения в кодировании, планировании и решении задач по сравнению с предыдущей версией. В The Browser Company, применяя модель для автоматизации веб-процессов, отметили, что Claude 3.5 Sonnet превзошла все протестированные ими ранее модели.

В рамках нашего постоянного сотрудничества с внешними экспертами совместное тестирование новой модели Claude 3.5 Sonnet перед ее развертыванием провели Институт безопасности ИИ США (US AISI) и Институт безопасности Великобритании (UK AISI).

Мы также оценили обновленную Claude 3.5 Sonnet на предмет катастрофических рисков и пришли к выводу, что стандарт ASL-2, описанный в нашей Политике ответственного масштабирования (Responsible Scaling Policy), по-прежнему подходит для этой модели.

Claude 3.5 Haiku: передовые технологии, доступность и скорость

Claude 3.5 Haiku — это новое поколение нашей самой быстрой модели. При скорости, сопоставимой с Claude 3 Haiku, модель Claude 3.5 Haiku усовершенствована по всем направлениям и во многих интеллектуальных бенчмарках превосходит даже Claude 3 Opus — крупнейшую модель нашего предыдущего поколения. Claude 3.5 Haiku особенно сильна в написании кода. Например, она набирает 40,6% на бенчмарке SWE-bench Verified, опережая многие агенты, использующие общедоступные передовые модели, включая оригинальную Claude 3.5 Sonnet и GPT-4o.

Благодаря низкой задержке, улучшенному следованию инструкциям и более точному использованию инструментов Claude 3.5 Haiku отлично подходит для ориентированных на пользователя продуктов, специализированных задач субагентов и генерации персонализированного опыта на основе огромных объемов данных, таких как история покупок, цены или складские запасы.

Claude 3.5 Haiku станет доступна позже в этом месяце в нашем собственном API, а также на платформах Amazon Bedrock и Google Cloud«s Vertex AI — сначала в виде текстовой модели, а поддержка ввода изображений появится позже.

Обучение Claude безопасному управлению компьютером

Создавая функцию управления компьютером, мы пробуем принципиально новый подход. Вместо создания специфических инструментов для выполнения отдельных задач мы обучаем Claude общим компьютерным навыкам, позволяя ей использовать широкий спектр стандартных инструментов и программного обеспечения, созданных для людей. Разработчики могут использовать эту зарождающуюся способность для автоматизации повторяющихся процессов, создания и тестирования программного обеспечения, а также для проведения открытых исследований.

Чтобы реализовать эти общие навыки, мы создали API, позволяющий Claude воспринимать компьютерные интерфейсы и взаимодействовать с ними. Разработчики могут интегрировать этот API, чтобы Claude могла преобразовывать инструкции (например: «используй данные с моего компьютера и из интернета, чтобы заполнить эту форму») в компьютерные команды (например: проверить электронную таблицу; переместить курсор, чтобы открыть веб-браузер; перейти на соответствующие веб-страницы; заполнить форму данными с этих страниц и т. д.). На платформе OSWorld, которая оценивает способность ИИ-моделей пользоваться компьютером как человек, модель Claude 3.5 Sonnet набрала 14,9% в категории анализа только скриншотов — это заметно лучше результата следующей по эффективности ИИ-системы, составившего 7,8%. Если на выполнение задачи выделялось больше шагов, результат Claude составил 22,0%.

Хотя мы ожидаем, что в ближайшие месяцы эта способность будет быстро совершенствоваться, текущие возможности Claude по управлению компьютером несовершенны. Некоторые действия, которые люди выполняют без труда — прокрутка, перетаскивание, масштабирование — пока представляют для Claude определенные трудности, поэтому мы рекомендуем разработчикам начинать с задач с низким уровнем риска. Поскольку управление компьютером может открыть новый вектор для более привычных угроз, таких как спам, дезинформация или мошенничество, мы применяем упреждающий подход для обеспечения безопасного развертывания. Мы разработали новые классификаторы, которые могут определять, когда задействовано управление компьютером и не наносится ли вред. Подробнее о процессе исследования этого нового навыка, а также о мерах безопасности читайте в нашей статье о разработке функции управления компьютером.

Взгляд в будущее

Анализ опыта первоначального развертывания этой технологии, которая все еще находится на самых ранних этапах, поможет нам лучше понять как потенциал, так и последствия появления все более мощных систем искусственного интеллекта.

Мы рады предложить вам оценить наши новые модели и публичную бета-версию функции управления компьютером, а также приглашаем поделиться своими отзывами. Мы верим, что эти разработки откроют новые возможности для вашего взаимодействия с Claude, и с нетерпением ждем того, что вы создадите.

Полный текст статьи читайте на Anthropic