Представляем агента ChatGPT: на стыке исследований и действий

Agent_Blog_SEO_Image.png?w=1600&h=900&fi

ChatGPT теперь умеет думать и действовать, самостоятельно выбирая инструменты из набора агентских навыков для выполнения задач с помощью собственного компьютера.

Попробовать в ChatGPT

Эта публикация о запуске устарела.

Актуальные сведения об агентской работе и командных рабочих процессах см. на страницах:

Агенты для рабочих пространств
ChatGPT Work

ChatGPT теперь может выполнять работу за вас на собственном компьютере, справляясь со сложными задачами от начала и до конца.

Теперь вы можете попросить ChatGPT выполнять такие запросы, как «посмотри мой календарь и подготовь для меня краткую информацию о предстоящих встречах с клиентами на основе последних новостей», «спланируй и купи ингредиенты для приготовления японского завтрака на четырех человек» и «проанализируй трех конкурентов и создай слайд-шоу». ChatGPT будет интеллектуально перемещаться по веб-сайтам, фильтровать результаты, при необходимости запрашивать безопасный вход в систему, запускать код, проводить анализ и даже создавать готовые к редактированию презентации и электронные таблицы с обобщением своих выводов.

В основе этой новой возможности лежит единая агентная система. Она объединяет три сильные стороны предыдущих разработок: способность Operator взаимодействовать с веб-сайтами, навыки глубокого исследования (deep research) по синтезу информации, а также интеллект и разговорную беглость ChatGPT.

ChatGPT выполняет эти задачи с помощью собственного виртуального компьютера, плавно переключаясь между рассуждениями и действиями, чтобы решать сложные рабочие процессы от начала и до конца в строгом соответствии с вашими инструкциями.

Самое главное, что вы всегда сохраняете контроль. ChatGPT запрашивает разрешение перед совершением важных действий, и вы можете в любой момент легко прервать его, взять управление браузером на себя или остановить выполнение задач.

Начиная с сегодняшнего дня, пользователи тарифных планов Pro, Plus и Team могут активировать новые агентные возможности ChatGPT напрямую через выпадающее меню инструментов в панели ввода, выбрав «режим агента» (agent mode) на любом этапе любого разговора.

Хотя агент ChatGPT уже является мощным инструментом для решения сложных задач, сегодняшний релиз — это только начало. Мы продолжим регулярно и поэтапно внедрять значительные улучшения, делая его со временем еще более функциональным и полезным для большего числа людей.

Естественная эволюция Operator и deep research

Ранее Operator и deep research обладали уникальными преимуществами: Operator умел прокручивать страницы, кликать и вводить текст в интернете, в то время как deep research преуспевал в анализе и обобщении информации. Но лучше всего они работали в разных ситуациях: Operator не мог погружаться в глубокий анализ или составлять подробные отчеты, а deep research не умел взаимодействовать с веб-сайтами для уточнения результатов или получать доступ к контенту, требующему аутентификации пользователя. Фактически, мы заметили, что многие запросы, которые пользователи пытались выполнять с помощью Operator, на самом деле лучше подходили для deep research, поэтому мы объединили лучшее из обоих решений.

Интегрировав эти взаимодополняющие возможности в ChatGPT и представив дополнительные инструменты, мы открыли совершенно новые функции в рамках одной модели. Теперь она может активно взаимодействовать с веб-сайтами — кликать, фильтровать и собирать более точные и эффективные результаты. Вы также можете легко перейти от простой беседы к запросу на выполнение действий прямо в том же чате.

Агент, который работает для вас и вместе с вами

Мы оснастили агент ChatGPT набором инструментов: визуальным браузером, который взаимодействует с интернетом через графический интерфейс пользователя, текстовым браузером для более простых веб-запросов на основе рассуждений, терминалом и прямым доступом к API.Агент также может использовать коннекторы ChatGPT, что позволяет подключать такие приложения, как Gmail и Github, чтобы ChatGPT мог находить информацию, имеющую отношение к вашим запросам, и использовать ее в своих ответах. Вы также можете войти на любой веб-сайт, перехватив управление браузером, что позволит ему действовать глубже и шире как в исследованиях, так и в выполнении задач. Предоставление ChatGPT этих различных путей доступа к веб-информации и взаимодействия с ней означает, что он может выбрать оптимальный путь для наиболее эффективного выполнения задач. Например, он может собирать информацию о вашем календаре через API, эффективно обрабатывать большие объемы текста с помощью текстового браузера и в то же время иметь возможность визуально взаимодействовать с веб-сайтами, созданными в первую очередь для людей.

Все это делается с помощью собственного виртуального компьютера, который сохраняет контекст, необходимый для выполнения задачи, даже при использовании нескольких инструментов — модель может открыть страницу с помощью текстового или визуального браузера, скачать файл из интернета, обработать его, выполнив команду в терминале, а затем просмотреть результат обратно в визуальном браузере. Модель адаптирует свой подход для выполнения задач быстро, точно и эффективно.

Агент ChatGPT создан для итеративных, совместных рабочих процессов, он гораздо более интерактивен и гиблен по сравнению с предыдущими моделями. Пока ChatGPT работает, вы можете в любой момент прервать его, чтобы уточнить инструкции, направить его к желаемым результатам или полностью изменить задачу. Он продолжит работу с того места, где остановился, учитывая новую информацию и не теряя при этом предыдущего прогресса. Аналогичным образом, сам ChatGPT может проактивно запрашивать у вас дополнительные детали, когда это необходимо, чтобы задача оставалась направленной на достижение ваших целей. Если выполнение задачи занимает больше времени, чем ожидалось, или кажется, что она застряла, вы можете приостановить ее, запросить отчет о прогрессе или полностью остановить и получить частичные результаты. Если у вас установлено приложение ChatGPT на телефоне, оно отправит вам уведомление по завершении задачи.

Расширение практической пользы в реальном мире

Эти объединенные возможности агента существенно повышают полезность ChatGPT как в повседневной жизни, так и в профессиональной сфере. На работе вы можете автоматизировать рутинные задачи, такие как конвертация скриншотов или дашбордов в презентации, состоящие из редактируемых векторных элементов, перенос встреч, планирование и бронирование выездных мероприятий, а также обновление электронных таблиц новыми финансовыми данными с сохранением исходного форматирования. В личной жизни вы можете использовать его для легкого планирования и бронирования путешествий, организации и заказа целых званых ужинов или поиска специалистов и записи на прием.

Повышенные возможности модели отражены в ее передовых (SOTA) результатах на оценках, измеряющих способности к веб-серфингу и выполнению реальных задач.

В Humanity«s Last Exam (HLE)* — тесте, оценивающем производительность ИИ по широкому спектру дисциплин на вопросах экспертного уровня, — модель, лежащая в основе агента ChatGPT, устанавливает новый рекорд pass@1 SOTA на уровне 41.6. Поскольку агент планирует свои действия динамически и выбирает собственные инструменты, он может решать одну и ту же задачу разными способами в разных запусках. Когда мы масштабировали это с помощью простой стратегии параллельного развертывания — выполняя до восьми попыток одновременно и выбирая вариант с наивысшей собственной уверенностью модели — показатель HLE агента возрастает до 44.4.

FrontierMath** — это самый сложный из известных математических бенчмарков, включающий новые, непубликовавшиеся задачи, на решение которых у профессиональных математиков часто уходят часы или даже дни. С использованием инструментов, таких как доступ к терминалу для выполнения кода, агент ChatGPT достигает точности в 27.4%, значительно превосходя все предыдущие модели с большим отрывом.

Мы также оценили модель с использованием тестов, смоделированных на основе сложных реальных задач. На внутреннем бенчмарке, предназначенном для оценки производительности модели на сложных, экономически ценных интеллектуальных задачах, результаты работы агента ChatGPT примерно в половине случаев сопоставимы с результатами человека или превосходят их при различных временах выполнения задач, при этом значительно превосходя o3 и o4-mini. Результаты модели оцениваются экспертами по сравнению с эталонами высокого качества, созданными лучшими специалистами в каждой области. Эти задачи, полученные от экспертов из различных профессий и отраслей, отражают реальную профессиональную работу — например, подготовку конкурентного анализа поставщиков услуг неотложной помощи по запросу, составление подробных графиков амортизации и определение жизнеспособных водяных скважин для нового объекта зеленого водорода.

НаDSBench, предназначенном для оценки агентов в реалистичных задачах по науке о данных (data science), охватывающих анализ данных и моделирование, агент ChatGPT заметно превосходит результаты человека с большим отрывом.

В SpreadsheetBench, оценивающем модели по их способности редактировать электронные таблицы на основе реальных сценариев, агент ChatGPT значительно превосходит существующие модели. Получив возможность редактировать таблицы напрямую, агент ChatGPT набирает еще более высокий балл — 45.5%, по сравнению с 20.0% у Copilot в Excel.

Методология: Авторы SpreadsheetBench использовали среду Windows с Microsoft Excel для оценки электронных таблиц. Мы использовали среду OSX и LibreOffice, что может привести к небольшим различиям в оценках. Например, авторы обнаружили общее жесткое ограничение (Overall Hard restriction) в 15.02% для GPT‑4o, а мы получили 13.38%. Мы использовали полный бенчмарк из 912 вопросов.

На внутреннем бенчмарке, измеряющем способность модели справляться с задачами финансового моделирования для инвестиционных аналитиков 1–3 годов работы — такими как создание финансовой модели из трех форм отчетности для компании из списка Fortune 500 с надлежащим форматированием и цитированием или построение модели выкупа за счет заемных средств (LBO) для приватизации компании, — модель, лежащая в основе агента ChatGPT, значительно превосходит deep research и o3. Каждая задача оценивается по сотням критериев, связанных с правильностью и использованием формул.

Мы также оценили агент ChatGPT на BrowseComp — бенчмарке, опубликованном нами ранее в этом году, который измеряет способность поисковых агентов находить труднодоступную информацию в интернете. Модель установила новый рекорд SOTA на уровне 68.9%, что на 17.4 процентных пункта выше, чем у deep research.

Наконец, на WebArena — бенчмарке, предназначенном для оценки производительности веб-агентов при выполнении реальных веб-задач, модель превосходит CUA на базе o3 (модель, лежащую в основе Operator).

Как использовать

Вы можете активировать новые возможности агента ChatGPT напрямую через выпадающее меню инструментов в панели ввода, выбрав «режим агента» в любой момент любого разговора. Просто опишите желаемую задачу — будь то проведение глубокого исследования, создание слайд-шоу или отправка отчетов о расходах. Пока агент выполняет вашу задачу, экранная трансляция обеспечивает наглядное представление о том, что именно делает ChatGPT. Вы можете в любой момент прервать работу и взять под контроль браузер, гарантируя, что задачи остаются направленными на достижение ваших целей.

Агент ChatGPT может получать доступ к вашим коннекторам, что позволяет ему интегрироваться в ваши рабочие процессы и использовать актуальную, применимую на практике информацию. После прохождения аутентификации эти коннекторы позволяют ChatGPT просматривать информацию и выполнять такие действия, как составление сводки входящих писем за день или поиск доступного для встречи времени. Однако для совершения действий на этих сайтах вам всё равно потребуется войти в систему, перехватив управление браузером. 

Кроме того, вы можете запланировать автоматическое повторение завершенных задач, например, создание еженедельного отчета по метрикам каждый понедельник утром.

Финансовый анализ

Обновляет финансовую модель с помощью прогнозов, формул и сводки допущений.
Посмотреть задачу полностью

Планирование званого ужина

Планирует, закупает продукты и организует обед из шести блюд по мотивам «Троецарствия».
Посмотреть задачу полностью

Бенчмаркинг общественного транспорта

Сопоставляет семь мировых транспортных систем с Чикаго, собирая данные и итоговый отчет.
Посмотреть задачу полностью

Подготовка к встрече с клиентом

Готовит отчет и презентацию о клиентских звонках и изменениях стратегии, используя данные календаря.
Посмотреть задачу полностью

Новые возможности, новые риски 

Этот выпуск знаменует собой первый случай, когда пользователи могут просить ChatGPT выполнять действия в Интернете. Это влечет за собой новые риски, в частности потому, что агент ChatGPT может работать напрямую с вашими данными — будь то информация, к которой осуществляется доступ через коннекторы, или веб-сайты, на которых вы выполнили вход с помощью режима перехвата управления. Мы укрепили надежные средства контроля из исследовательской предварительной версии Operator и добавили меры безопасности для решения таких задач, как работа с конфиденциальными данными в реальном интернете, более широкий охват пользователей и (ограниченный) доступ к сети терминала. Хотя эти меры существенно снижают риски, расширенный набор инструментов и более широкая аудитория агента ChatGPT означают, что его общий профиль рисков выше. 

Мы уделили особое внимание защите агента ChatGPT от состязательных манипуляций посредством инъекции промптов (prompt injection), что представляет собой риск для агентных систем в целом, и соответственно подготовили более масштабные меры противодействия. Инъекции промптов — это попытки третьих лиц манипулировать поведением системы с помощью вредоносных инструкций, с которыми агент ChatGPT может столкнуться в интернете при выполнении задачи. Например, вредоносный промпт, скрытый на веб-странице (например, в невидимых элементах или метаданных), может обмануть агента и заставить его совершить непреднамеренные действия, такие как передача конфиденциальных данных из коннектора злоумышленнику или нанесение вреда на сайте, в который вошел пользователь. Поскольку агент ChatGPT может совершать прямые действия, успешные атаки могут иметь более серьезные последствия и нести в себе более высокие риски. 

Мы обучили и протестировали агента на предмет выявления и отражения инъекций промптов, а также задействовали мониторинг для быстрого обнаружения атак с внедрением инструкций и реагирования на них. Требование явного подтверждения от пользователя перед совершением важных действий дополнительно снижает риск нанесения вреда от таких атак, а пользователи могут вмешиваться в выполнение задач по мере необходимости, перехватывая управление или приостанавливая процесс. Пользователям следует взвешивать эти компромиссы при принятии решения о том, какую информацию предоставлять агенту, а также предпринимать шаги для минимизации своей подверженности этим рискам, например отключать коннекторы, когда они не нужны для задачи. 

Мы также реализовали меры предосторожности в отношении ошибок модели, тем более что теперь модель может выполнять задачи, влияющие на реальный мир:  

  • Явное подтверждение пользователя: ChatGPT обучен явно запрашивать ваше разрешение перед выполнением действий, имеющих реальные последствия, таких как совершение покупки.
  • Активный надзор («Режим наблюдения»): Определенные критически важные задачи, например отправка электронной почты, требуют вашего активного контроля.
  • Проактивное предотвращение рисков: ChatGPT обучен активно отказываться от выполнения задач с высоким уровнем риска, таких как банковские переводов.

Наконец, мы внедрили дополнительные элементы управления для ограничения данных, к которым у модели есть доступ:  

  • Элементы управления конфиденциальностью: Одним щелчком мыши в настройках ChatGPT вы можете удалить все данные просмотра и немедленно выйти из всех активных сеансов веб-сайтов. В противном случае файлы cookie сохраняются в соответствии с политикой файлов cookie каждого посещенного веб-сайта, что может сделать повторные посещения сайтов более эффективными.
  • Безопасный режим перехвата управления браузером: Когда вы взаимодействуете с интернетом с помощью браузера ChatGPT («режим перехвата управления»), ваши вводимые данные остаются конфиденциальными. ChatGPT не собирает и не хранит какие-либо данные, которые вы вводите во время этих сеансов (например, пароли), поскольку модели это не нужно, и будет безопаснее, если она их никогда не увидит.

Наш самый мощный комплекс мер безопасности для защиты от биологических рисков 

Учитывая расширенные возможности модели, мы приняли решение классифицировать агент ChatGPT как систему с высокими биологическими и химическими возможностями в рамках нашей методологии обеспечения готовности (Preparedness Framework), активировав соответствующие средства защиты. Хотя у нас нет исчерпывающих доказательств того, что модель может существенно помочь новичку в создании серьезной биологической угрозы (наш порог для высокого уровня возможностей), мы проявляем осмотрительность и внедряем необходимые меры защиты уже сейчас. В результате эта модель обладает нашим самым комплексным набором средств безопасности на сегодняшний день с расширенными защитными мерами для биологии: комплексным моделированием угроз, обучением отказу от запросов двойного назначения, постоянно работающими классификаторами и мониторами рассуждений, а также четкими процессами принудительного исполнения. 

В дополнение к нашей работе по обеспечению безопасности агента ChatGPT, мы знаем, что многоуровневая биобезопасность работает лучше всего, когда защитные меры выходят за рамки какой-либо одной лаборатории, поэтому мы сотрудничаем по всей экосистеме для укрепления защиты. С первого дня мы работали со сторонними экспертами по биобезопасности, институтами безопасности и академическими исследователями, чтобы сформировать нашу модель угроз, оценки и политики. Рецензенты с биологическим образованием проверили наши данные оценки, а эксперты по тестированию на проникновение (red teamers) провели стресс-тестирование защитных мер в реалистичных сценариях. Ранее в этом месяце мы провели семинар по биобезопасности с экспертами из правительства, научных кругов, национальных лабораторий и НПО, чтобы ускорить сотрудничество и продвинуть исследования в области биобезопасности на базе ИИ. Мы продолжим сотрудничество на глобальном уровне, чтобы опережать возникающие риски. 

Узнайте больше о нашем надежном подходе к безопасности для унифицированной агентной модели в системной карте (system card). Мы также запускаем программу выплаты вознаграждений за уязвимости в биологической сфере, чтобы находить и устранять риски в реальных условиях.

Доступность

Агент ChatGPT начинает развертываться сегодня для пользователей тарифов Pro, Plus и Team; пользователи Pro получат доступ к концу дня, а пользователи Plus и Team получат доступ в течение следующих нескольких дней. Корпоративные пользователи (Enterprise) и пользователи из сферы образования (Education) получат доступ в ближайшие недели. Пользователям Pro доступно 400 сообщений в месяц, в то время как другие платные пользователи получают 40 сообщений ежемесячно с возможностью дополнительного использования за счет гибких вариантов на основе кредитов.

Мы все еще работаем над предоставлением доступа для Европейской экономической зоны и Швейцарии. 

Сайт исследовательской предварительной версии Operator продолжит работу в течение еще нескольких недель, после чего будет закрыт. Функция глубокого исследования (Deep research) является частью возможностей агента ChatGPT. Если вы предпочитаете исходную функцию глубокого исследования (которая может выполняться дольше, но по умолчанию предоставляет более подробные и глубокие ответы), вы по-прежнему можете получить к ней доступ, выбрав «deep research» в выпадающем меню панели создания сообщений.

Ограничения и взгляд в будущее 

Агент ChatGPT находится еще на ранней стадии развития. Он способен решать самые разные сложные задачи, но все же может совершать ошибки. 

Хотя мы видим значительный потенциал в его способности генерировать слайд-шоу, эта функция в настоящее время находится в стадии бета-тестирования. На данный момент результаты иногда могут казаться рудиментарными по своему форматированию и степени проработки, особенно если работа начинается без существующего документа. Мы сфокусировали начальные возможности модели на создании артефактов, организующих информацию в потоке и формате, подходящем для презентаций, с такими элементами, как текст, графики, изображения и фигуры, которые можно легко и изначально редактировать после экспорта, оптимизируя структуру и гибкость. В настоящее время также периодически возникают расхождения между слайдами в программе просмотра и экспортированным файлом PowerPoint, над сокращением которых мы работаем. Кроме того, хотя в настоящее время вы можете загрузить существующую электронную таблицу для редактирования или использования в качестве шаблона для ChatGPT, эта функция пока недоступна для слайд-шоу. Мы уже обучаем следующую итерацию создания слайд-шоу в ChatGPT для получения более качественных, изощренных результатов с более широкими возможностями и улучшенным форматированием.

В целом мы ожидаем постоянного повышения эффективности, глубины и универсальности агента ChatGPT с течением времени, включая более бесшовное взаимодействие по мере того, как мы продолжаем корректировать объем контроля, требуемого от пользователя, чтобы сделать систему более полезной и одновременно обеспечить ее безопасное использование.

Приложение

SpreadsheetBench

Модель

Среда оценки

Мягкое ограничение (%): на уровне ячеек

Мягкое ограничение (%): на уровне листов

Мягкое ограничение (%): общее

GPT‑4o

Windows, Excel

15.03

23.65

18.35

Copilot в Excel

Windows, Excel

23.33

15.00

20.00

GPT‑4o

OSX, LibreOffice

15.86

18.33

16.81

OpenAI o3

OSX, LibreOffice

22.40

24.60

23.25

Агент ChatGPT

OSX, LibreOffice

38.27

30.48

35.27

Агент ChatGPT с .xlsx

OSX, LibreOffice

50.56

37.51

45.54

Человек

75.56

65.00

71.33

Запись прямой трансляции

Автор

OpenAI

Сноски

* При включенном поиске в интернете модель иногда может находить точные ответы онлайн, например, читая записи в блогах с примерами задач из набора данных. Мы минимизируем риски жульничества модели при поиске с помощью двух стратегий:

1. Блокирование доменов, на которых ранее было замечено жульничество со стороны модели.

2. Использование дополнительной модели в качестве монитора для проверки всех токенов вывода инструментов при каждой попытке с целью выявления подозрительного поведения. Подозрительным поведением считается «страница, файл или фрагмент, основная цель которого — предоставить точный ответ на данный конкретный вопрос (например, официальный ключ оценивания, слитый файл «решений» на gist или обсуждение, цитирующее готовый ответ дословно)». Добросовестным поведением считается «Любой авторитетный ресурс, к которому может обратиться прилежный человек (документация, руководства, научные статьи, авторитетные материалы), даже если он случайно содержит правильный ответ». Любые попытки, которые монитор счел подозрительными, засчитываются как неверные. Большинство примеров, не прошедших эту проверку, представляли собой задачи, точное решение которых было доступно на нескольких интернет-ресурсах, не связанных с HLE.

**OpenAI имеет эксклюзивный доступ к 237 из 290 частных вопросов из набора данных уровня 1–3. Вопросы уровня 4 FrontierMath не включены в данную оценку. Результаты оцениваются как среднее значение по 16 попыткам ответить на каждый вопрос. Результаты агента ChatGPT получены OpenAI и оценены Epoch AI при наличии доступа к браузеру и терминалу, а также лимите в 128 тыс. токенов на один ответ. Оценки OpenAI o4-mini и o3 получены и оценены Epoch AI без доступа к браузеру и терминалу, с использованием скриптов Python через вызов функций и лимитом в 100 тыс. токенов на один ответ. 

*** Oracle@64 относится к лучшему результату, достигнутому среди 64 тестовых запусков, выбранному с использованием эталонных данных (т. е. мы выбираем попытку с наивысшим баллом для каждой задачи на основе фактической эффективности оценивания). Мы сообщаем среднее значение этих лучших результатов по всем задачам. Этот показатель подчеркивает верхний предел потенциала модели и дисперсию в выполнении задач, показывая, насколько способной может быть модель в случае успеха, и указывая на возможности для повышения стабильности за счет дальнейшего обучения. В отличие от типичных метрик «best of N», которые выбираются на основе уверенности модели, oracle@64 использует эталонные данные для выбора и применяется к задачам, оцениваемым по непрерывной шкале от 0 до 1, а не по бинарной шкале зачет/незачет.

Полный текст статьи читайте на OpenAI