Агент для работы с компьютером
Запуск Operator с Computer-Using Agent — универсальным интерфейсом для взаимодействия ИИ с цифровым миром.
Сегодня мы представляем исследовательскую предварительную версию Operator — агента, который может выходить в веб и выполнять задачи за вас. В основе Operator лежит агент для работы с компьютером (Computer-Using Agent, CUA) — модель, объединяющая возможности визуального восприятия GPT-4o и продвинутые способности к рассуждению, полученные с помощью обучения с подкреплением. CUA обучен взаимодействовать с графическими пользовательскими интерфейсами (GUI) — кнопками, меню и текстовыми полями на экране — точно так же, как это делают люди. Это дает ему гибкость в выполнении цифровых задач без использования специфических для ОС или веб-среды API.
CUA опирается на многолетние фундаментальные исследования на стыке мультимодального понимания и рассуждений. Сочетая передовое восприятие GUI со структурированным решением проблем, модель способна разбивать задачи на многошаговые планы и адаптивно корректировать свои действия при возникновении трудностей. Эта возможность знаменует собой следующий шаг в развитии ИИ, позволяя моделям использовать те же инструменты, на которые люди полагаются ежедневно, и открывая двери для широчайшего спектра новых приложений.
Несмотря на то, что CUA находится на ранней стадии развития и имеет ограничения, он устанавливает новые стандарты производительности (state-of-the-art), достигая 38,1% успешных выполнения задач на OSWorld для полноценного управления компьютером, а также 58,1% на WebArena и 87% на WebVoyager для веб-задач. Эти результаты подчеркивают способность CUA ориентироваться и работать в самых разных средах, используя единое универсальное пространство действий.
Мы разработали CUA, уделяя особое внимание безопасности, чтобы справиться с вызовами, которые возникают при предоставлении агенту доступа к цифрому миру, как описано в нашем документе Operator System Card. В соответствии с нашей стратегией итеративного развертывания, мы выпускаем CUA в рамках исследовательской предварительной версии Operator на сайте operator.chatgpt.com для пользователей тарифного плана Pro в США в качестве первого шага. Сбор отзывов из реального мира позволит нам усовершенствовать меры безопасности и непрерывно развиваться по мере подготовки к будущему, в котором использование цифровых агентов будет только расти.
Как это работает

CUA обрабатывает данные в виде сырых пикселей для понимания происходящего на экране и использует виртуальные мышь и клавиатуру для выполнения действий. Он может решать многошаговые задачи, обрабатывать ошибки и адаптироваться к непредвиденным изменениям. Это позволяет CUA действовать в самых разных цифровых средах, выполняя такие задачи, как заполнение форм и навигация по веб-сайтам, без необходимости использования специализированных API.
Получив инструкцию пользователя, CUA работает в цикле итераций, объединяющем восприятие, рассуждение и действие:
- Восприятие: Снимки экрана компьютера добавляются в контекст модели, предоставляя визуальный снимок текущего состояния компьютера.
- Рассуждение: CUA обдумывает следующие шаги с помощью цепочки рассуждений (chain-of-thought), принимая во внимание текущие и прошлые снимки экрана и действия. Этот внутренний монолог повышает эффективность выполнения задач, позволяя модели оценивать свои наблюдения, отслеживать промежуточные шаги и динамически адаптироваться.
- Действие: Модель выполняет действия — клики, прокрутку или ввод текста — до тех пор, пока не решит, что задача завершена или требуется ввод данных пользователем. Хотя большинство шагов CUA выполняет автоматически, он запрашивает подтверждение пользователя для конфиденциальных действий, таких как ввод учетных данных для входа или решение CAPTCHA.
Оценки
CUA устанавливает новый стандарт как в бенчмарках использования компьютера, так и в бенчмарках использования браузера, используя единый универсальный интерфейс экрана, мыши и клавиатуры.
| Тип бенчмарка | Бенчмарк | Использование компьютера (универсальный интерфейс) | Агенты для веб-серфинга | Человек | |
|---|---|---|---|---|---|
| OpenAI CUA | Предыдущий SOTA | Предыдущий SOTA | |||
| Использование компьютера | OSWorld | 38.1% | 22.0% | - | 72.4% |
| Использование браузера | WebArena | 58.1% | 36.2% | 57.1% | 78.2% |
| WebVoyager | 87.0% | 56.0% | 87.0% | - |
Использование браузера
WebArena и WebVoyagerпредназначены для оценки эффективности агентов веб-серфинга при выполнении реальных задач с использованием браузеров. WebArena использует автономные веб-сайты с открытым исходным кодом, работающие в оффлайн-режиме, для имитации реальных сценариев в электронной коммерции, управлении контентом интернет-магазинов (CMS), на платформах социальных форумов и в других областях. WebVoyager проверяет производительность модели на реальных онлайн-сайтах, таких как Amazon, GitHub и Google Maps.
В этих бенчмарках CUA устанавливает новый стандарт, используя тот же универсальный интерфейс, который воспринимает экран браузера в виде пикселей и выполняет действия с помощью мыши и клавиатуры. CUA достигла уровня успешности 58.1% в WebArena и 87% в WebVoyager при выполнении веб-задач. Хотя CUA демонстрирует высокий процент успешности в WebVoyager, где большинство задач относительно просты, CUA все еще нуждается в дальнейших улучшениях, чтобы сократить разрыв с результатами человека в более сложных бенчмарках, таких как WebArena.
Использование компьютера
OSWorld— это бенчмарк, оценивающий способность моделей управлять полноценными операционными системами, такими как Ubuntu, Windows и macOS. В этом бенчмарке CUA достигает показателя успешности в 38.1%. Мы наблюдали масштабирование во время тестирования, что означает, что производительность CUA улучшается при разрешении большего количества шагов. На графике ниже производительность CUA сравнивается с предыдущими современными разработками (SOTA) при разном максимально допустимом количестве шагов. Результат человека в этом бенчмарке составляет 72.4%, так что остается значительный простор для улучшений.
На следующих визуализациях показаны примеры работы CUA при решении различных стандартных задач OSWorld.
CUA в Operator
Мы делаем CUA доступной в рамках исследовательской предварительной версии Operator — агента, способного выходить в веб для выполнения задач за вас. Operator доступен для пользователей Pro в США по адресу operator.chatgpt.com. Эта исследовательская предварительная версия — возможность учиться на опыте наших пользователей и более широкой экосистемы, итеративно дорабатывая и улучшая Operator. Как и любая технология на ранней стадии, мы пока не ожидаем от CUA надежной работы во всех сценариях. Тем не менее, она уже доказала свою полезность в различных ситуациях, и мы стремимся распространить эту надежность на более широкий круг задач. Выпуская CUA в составе Operator, мы надеемся собрать ценные отзывы от наших пользователей, которые помогут нам усовершенствовать ее возможности и расширить сферы применения.
В таблице ниже мы представляем результаты работы CUA в Operator для нескольких тестовых запросов, чтобы проиллюстрировать ее известные сильные и слабые стороны.
| Категория | Запрос (промпт) | Успешно / попыток | Примечание |
|---|---|---|---|
| Взаимодействие с различными компонентами пользовательского интерфейса для выполнения задач | Шаг 1: Найдите в Британнике подробную карту среды обитания медведей. Шаг 2: Отлично! А теперь перейдите по ссылкам на черного, бурого и белого медведей и предоставьте краткий общий обзор их физических характеристик, в частности их различий. Да, и сохраните ссылки для меня, чтобы я мог быстро к ним обратиться. | 10 / 10 | CUA может взаимодействовать с различными компонентами пользовательского интерфейса для поиска, сортировки и фильтрации результатов с целью нахождения нужной пользователю информации. Надежность варьируется для разных веб-сайтов и интерфейсов. |
| Мне нужны те скидки в Target. Можете проверить, есть ли у них скидка на пребиотическую газировку poppi? Если да, мне нужен арбузный вкус в банке объемом 12 жидких унций. Найдите тип скидки, который к этому прилагается, и проверьте, не содержит ли она глютен. | 9 / 10 | ||
| Я планирую переехать в Сиэтл и хочу, чтобы вы нашли на Redfin таунхаус как минимум с 3 спальнями, 2 ванными комнатами и энергоэффективным дизайном (например, солнечными панелями или сертификатом LEED). Мой бюджет составляет от 600 000 до 800 000 долларов, и в идеале площадь должна быть около 1500 кв. футов. | 3 / 10 | ||
| Задачи, которые можно решить с помощью повторяющихся простых взаимодействий с интерфейсом | Создайте новый проект в Todoist под названием «Покупки на выходные». Добавьте в него следующий список покупок с продуктами: Бананы (6 штук) Авокадо (2 спелых) Бэби-шпинат (1 пачка) Цельное молоко (1 галлон) Сыр чеддер (блок 8 унций) Картофельные чипсы (соленые, семейная упаковка) Темный шоколад (70% какао, 2 плитки) | 10 / 10 | CUA может надежно повторять простые действия в пользовательском интерфейсе многократно, чтобы автоматизировать простые, но рутинные задачи пользователей. |
| Найдите в Spotify самые популярные песни США 1990-х годов и создайте плейлист как минимум с 10 треками. | 10 / 10 | ||
| Задачи, в которых CUA демонстрирует высокий уровень успешности только тогда, когда промпты содержат подробные подсказки о том, как пользоваться веб-сайтом. | Посетите tagvenue.com и найдите концертный зал на 150 человек в Лондоне. Он нужен мне 22 февраля 2025 года на весь день с 9:00 до 00:00, главное, чтобы он стоил менее 90 фунтов стерлингов в час. Ой, не могли бы вы проверить раздел фильтров на наличие подходящих фильтров и убедиться, что там есть парковка и все помещение доступно для инвалидных колясок. | 8 / 10 | Даже для одной и той же задачи надежность CUA может меняться в зависимости от того, как мы составляем промпт. В данном случае мы можем повысить надежность, указав конкретную дату (например, с 9:00 до 00:00 против всего дня с 9:00) и предоставив подсказки о том, какой интерфейс следует использовать для поиска результатов (например, проверить раздел фильтров…) |
| Посетите tagvenue.com и найдите концертный зал на 150 человек в Лондоне. Он нужен мне 22 февраля 2025 года на весь день с 9:00, только убедитесь, что он стоит менее 90 фунтов стерлингов в час. Да, и убедитесь, что там есть парковка и все помещение доступно для инвалидных колясок. | 3 / 10 | ||
| Трудности при использовании незнакомого интерфейса и редактировании текста | Используйте html5editor, введите следующий текст с левой стороны, затем отредактируйте его в соответствии с моими инструкциями и сделайте скриншот всего экрана по завершении. Текст следующий: Hello world! This is my first text. I need to see how it would look like when programmed with HTML. Some parts should be red. Some bold. Some italic. Some underlined. Until my lesson is complete, and we shift to the other side. Hello world! should have header 2 applied | 4 / 10 | Когда CUA приходится взаимодействовать с интерфейсами, с которыми она мало сталкивалась во время обучения, ей сложно сообразить, как правильно использовать предоставленный интерфейс. Это часто приводит к многочисленным попыткам и ошибкам, а также неэффективным действиям. CUA неточно выполняет редактирование текста. Она часто делает много ошибок в процессе или выдает результат с ошибками. |
Безопасность
Поскольку CUA — это один из наших первых агентных продуктов, способных напрямую совершать действия в браузере, он сопряжен с новыми рисками и задачами, требующими решения. При подготовке к развертыванию Operator мы провели масштабное тестирование безопасности и внедрили средства защиты для трех основных категорий рисков: злонамеренного использования, ошибок модели и пограничных рисков. Мы считаем важным применять комплексный подход к безопасности, поэтому реализовали средства защиты во всем контексте развертывания: в самой модели CUA, системе Operator и процессах после развертывания. Наша цель — создать многоуровневую систему защиты, где каждый слой постепенно снижает профиль риска.
Первая категория рисков — злонамеренное использование. Помимо требования к пользователям соблюдать наши правила использования, мы разработали следующие меры для снижения риска причинения вреда из-за неправомерного применения Operator, опираясь на нашу работу над безопасностью GPT‑4o:
- Отказы: Модель CUA обучена отказываться от выполнения многих вредоносных задач, а также незаконной или регулируемой деятельности.
- Черный список: Operator не имеет доступа к веб-сайтам, которые мы превентивно заблокировали, таким как многие сайты с азартными играми, контент для взрослых, а также продавцы наркотиков или оружия.
- Модерация: Взаимодействие пользователей проверяется в режиме реального времени автоматизированными средствами проверки безопасности, которые призваны обеспечивать соблюдение правил использования и способны выносить предупреждения или блокировать запрещенную деятельность.
- Автономное обнаружение: Мы также разработали автоматизированные системы обнаружения и проверки с участием человека для выявления запрещенного использования в приоритетных сферах политики, включая безопасность детей и дезинформацию, что позволяет нам обеспечивать соблюдение наших правил использования.
Вторая категория рисков — ошибки модели, при которых модель CUA случайно совершает действие, не предусмотренное пользователем, что в свою очередь наносит вред пользователю или окружающим. Гипотетические ошибки могут варьироваться по степени тяжести: от опечатки в электронной почте до покупки не того товара или безвозвратного удаления важного документа. Чтобы минимизировать потенциальный вред, мы разработали следующие меры защиты:
- Подтверждения пользователя: Модель CUA обучена запрашивать у пользователя подтверждение перед завершением задач со внешними побочными эффектами (например, перед отправкой заказа, отправкой электронной почты и т. д.), чтобы пользователь мог перепроверить работу модели, прежде чем она станет окончательной.
- Ограничения на задачи: На данный момент модель CUA будет отказываться помогать с определенными задачами повышенного риска, такими как банковские транзакции и задачи, требующие принятия ответственных решений.
- Режим наблюдения: На особо чувствительных веб-сайтах, таких как электронная почта, Operator требует активного контроля со стороны пользователя, гарантируя, что пользователи смогут напрямую заметить и исправить любые потенциальные ошибки, которые может совершить модель.
Одной из особо важных категорий ошибок модели являются состязательные атаки на веб-сайты, которые заставляют модель CUA совершать непреднамеренные действия посредством промт-инъекций (prompt injections), побегов из «тюрьмы» (jailbreaks) и фишинговых попыток. В дополнение к упомянутым мерам защиты от ошибок модели мы разработали несколько дополнительных уровней обороны для защиты от этих рисков:
- Осторожная навигация: Модель CUA спроектирована так, чтобы распознавать и игнорировать промт-инъекции на веб-сайтах; она распознала все случаи, кроме одного, во время ранней внутренней сессии краудсорсингового тестирования на проникновение (red-teaming).
- Мониторинг: В Operator мы внедрили дополнительную модель для отслеживания и приостановки выполнения, если на экране обнаруживается подозрительный контент.
- Конвейер обнаружения: Мы используем как автоматизированное обнаружение, так и конвейеры проверки человеком для выявления подозрительных паттернов доступа, которые могут быть отмечены и оперативно (в течение нескольких часов) добавлены в систему мониторинга.
Наконец, мы оценили модель CUA на предмет пограничных рисков, описанных в нашей структуре готовности (Preparedness Framework), включая сценарии, связанные с автономной репликацией и инструментами биорисков. Эти оценки не выявили никаких дополнительных рисков по сравнению с GPT‑4o.
Для тех, кто заинтересован в более детальном изучении оценок и средств защиты, мы рекомендуем ознакомиться с системной картой Operator (Operator System Card) — постоянно обновляемым документом, который обеспечивает прозрачность нашего подхода к безопасности и текущих улучшений.
Поскольку многие возможности Operator новы, новыми являются и риски с реализованными нами подходами к их минимизации. Хотя мы стремились создать современные, разнообразные и взаимодополняющие меры защиты, мы ожидаем, что эти риски и наш подход будут эволюционировать по мере накопления опыта. Мы с нетерпением ждем периода исследовательского превью как возможности собрать отзывы пользователей, усовершенствовать наши средства защиты и повысить безопасность агентов.
Заключение
CUA опирается на многолетние достижения в области мультимодальности, рассуждений и безопасности. Мы добились значительного прогресса в глубоких рассуждениях с помощью серии o-моделей, в возможностях визуального восприятия с помощью GPT‑4o, а также в новых методах повышения надежности с помощью обучения с подкреплением и иерархии инструкций. Следующее пространство задач, которое мы планируем исследовать — это расширение пространства действий агентов. Гибкость, предлагаемая универсальным интерфейсом, решает эту задачу, позволяя создать агента, способного работать с любым программным инструментом, созданным для людей. Выходя за рамки специализированных удобных для агентов API, CUA может адаптироваться к любой доступной компьютерной среде, фактически охватывая «длинный хвост» цифровых сценариев использования, которые остаются недоступными для большинства моделей ИИ.
Мы также работаем над тем, чтобы сделать CUA доступным в API, чтобы разработчики могли использовать его для создания собственных агентов, использующих компьютер. Продолжая работу над CUA, мы с нетерпением ждем возможности увидеть различные сценарии использования, которые откроет для себя сообщество. Мы планируем использовать реальные отзывы, собранные в ходе этого раннего превью, для постоянного совершенствования возможностей CUA и средств снижения рисков в целях безопасного продвижения нашей миссии по распространению благ ИИ на каждого.
Авторы
Ссылки
Представляем функции работы с компьютером, новую модель Claude 3.5 Sonnet и Claude 3.5 Haiku
Дополнение к карточке модели: Claude 3.5 Haiku и обновленная Claude 3.5 Sonnet
Бенчмарк Kura WebVoyager
Проект Google Mariner
OSWorld: Бенчмаркинг мультимодальных агентов для задач с открытым концом в реальных компьютерных средах
WebVoyager: Создание сквозного веб-агента с использованием крупных мультимодальных моделей
WebArena: Реалистичная веб-среда для создания автономных агентов
Цитаты
Пожалуйста, ссылайтесь на OpenAI и используйте следующий BibTeX для цитирования: http://cdn.openai.com/cua/cua2025.bib
Полный текст статьи читайте на OpenAI
