Ускорение исследований: взгляд изнутри OpenAI

SEO_Card__11_.png?w=1600&h=900&fit=fill

Мы убеждены, что для того, чтобы общий искусственный интеллект (AGI) приносил пользу всему человечеству, он должен управляться демократическим путем. Это возможно лишь при условии осознанного общественного обсуждения возможностей, рисков и мер защиты высокоэффективных систем ИИ. Людям повсеместно необходимо понимать вероятную траекторию развития передового ИИ в будущем, чтобы они могли иметь весомый голос в процессе его создания.

Прозрачность в отношении конкретных рисков, инцидентов и мер безопасности необходима, но недостаточна. Мы считаем, что общественности также необходимо понимать, как развиваются самые мощные системы и как они стимулируют прогресс в исследованиях внутри передовых лабораторий.

Наша цель — безопасно создать автоматизированного исследователя на базе ИИ, способного работать под наблюдением человека для продвижения в области глубокого обучения и выравнивания (alignment), что обеспечит итеративные улучшения. Согласно нашим измерениям, мы уже достигли цели, объявленной прошлой осенью, — получить автоматизированного стажера-исследователя к сентябрю текущего года. Под «стажером-исследователем» мы понимаем систему, способную выполнять четко определенные исследовательские задачи под руководством человека, включая те, на которые у квалифицированного исследователя ушло бы несколько дней. Мы уверенно продвигаемся к созданию автоматизированного исследователя на базе ИИ к марту 2028 года.

В течение этого года повседневная работа исследователей OpenAI существенно изменилась. Исследователи используют агентов для написания кода в течение всего дня (часто в параллельных сессиях), и общий объем использования быстро растет, опережая рост показателей в других командах OpenAI. Исследователи быстрее пишут код и проводят больше экспериментов. Меняются и способы использования агентов: агенты справляются со все более сложными задачами и делают это успешнее. Исследования в области ИИ — это сложный процесс со множеством потенциальных узких мест, поэтому общие темпы прогресса вряд ли будут полностью соответствовать этим конкретным метрикам. Но в целом эти данные согласуются с общим впечатлением многих из нас внутри компании о том, что агентные инструменты существенно ускоряют исследовательский прогресс. Люди по-прежнему определяют наши исследовательские приоритеты, решают, какие идеи и результаты преследовать, и принимают решения о масштабировании, приостановке или развертывании систем.

Если действовать ответственно, мы верим, что автоматизированные исследования в области ИИ позволят создать модели, которые напрямую повысят благосостояние людей и будут способствовать выполнению миссии OpenAI. Это позволит снизить стоимость передового интеллекта, чтобы люди по всему миру смогли извлечь из него пользу. Мы занимаемся этой работой отчасти потому, что автоматизированные исследования могут помочь нам решить проблему выравнивания и создать защиту против все более способного ИИ. Автоматизированный исследователь на базе ИИ также может выступать в роли автоматизированного исследователя безопасности или выравнивания. Более способные, выровненные системы могут помочь защитить критическую инфраструктуру, отразить атаки опасных агентов ИИ и разработать новые защитные меры.

Это причины для развития полезных возможностей автоматизированных исследований, однако они не означают, что быстрое рекурсивное самосовершенствование (RSI) — это обязательно тот результат, к которому нам следует стремиться. Решение о том, стоит ли действовать и как именно, должно зависеть от нашей способности сохранять контроль со стороны человека и от осознанного демократического выбора в отношении преимуществ и рисков.

Мы пока не знаем, как безопасно дойти до конца в создании выровненного, полноценного RSI. Мы работаем над масштабированием мер выравнивания и безопасности параллельно с развитием возможностей. Но мы не можем предполагать, что прогресс в области выравнивания и безопасности будет идти в ногу с возможностями, а более мощные системы могут стать сложнее для мониторинга. Тщательная работа по выравниванию и обеспечению безопасности находится в центре этих усилий, и она начинается с измерения и устранения проблем безопасности, которые мы наблюдаем сегодня в системах генерации кода на базе агентов. Всякий раз, когда мы обнаруживаем, что продолжение работы создает неприемлемый риск для безопасности, мы будем реагировать соответствующим образом, в том числе замедляя или прекращая разработку или развертывание систем, которые мы не можем в достаточной мере защитить.

После недавнего инцидента с Hugging Face мы применили это обязательство на практике, приостановив обучение с подкреплением (RL) наших новейших моделей, предназначенных для развертывания, пока мы дополнительно укрепляли и тестировали на проникновение наши исследовательские среды, а также расширяли охват наших систем мониторинга. Это не остановило все исследования: часть рабочих процессов возобновилась под более жестким контролем, в то время как другие остались приостановленными. Мы повысили наши стандарты безопасности и выравнивания и перенесли работу по безопасности на более ранние этапы жизненного цикла модели, требуя более убедительных доказательств выровненного поведения на всех этапах обучения.

Сегодня мы предоставляем подробный обзор того, как агентные системы способствовали нашему прогрессу в направлении RSI за последние месяцы. Агентные системы новы и быстро меняются, а наши усилия по измерениям все еще носят предварительный характер. Делясь этими первыми результатами и методами, которые за ними стоят, мы стремимся проинформировать общественность, поощрять культуру публичного раскрытия информации и помочь отрасли приблизиться к общим стандартам измерений.

В конечном счете, как мы писали в нашей стратегии обеспечения безопасности передовых систем, мы считаем, что от нас и других компаний следует требовать публичного отслеживания нашего прогресса на пути к RSI. Даже при отсутствии такого требования мы планируем и дальше обеспечивать прозрачность нашего прогресса в области RSI. Мы будем развивать наш подход к прозрачности по мере совершенствования методов измерения и нашего понимания, соблюдая баланс с необходимостью защиты безопасности и проприетарной информации.

1. Агенты по написанию кода меняют повседневную работу исследователей OpenAI

В начале этого года медианный исследователь в OpenAI (по уровню использования агентов) задействовал агентов для написания кода лишь в скромных объемах. К середине августа медианный исследователь ежедневно интегрировал агентов в свою работу, используя инференс на сумму более 600 долларов в день по ценам API. Пользователь на 90-м процентиле в нашей исследовательской организации тратит на токены более 7000 долларов в день.

До июня 2026 года общее время работы агентов в исследовательской организации все еще уступало общему объему человеческого труда. С тех пор ситуация изменилась. Если исходить из стандартного 8-часового рабочего дня, по состоянию на середину августа исследовательская организация суммарно использует 3,1 рабочего дня агентов на каждый рабочий день человеческого труда.

Другой способ взглянуть на это — понять, сколько исследователей используют высококонкурентные рабочие процессы (например, запускают 4 или более агентов одновременно). Как показано ниже, это число увеличивается. Эти цифры включают суточные пики как агентов, запущенных непосредственно пользователем, так и субагентов, созданных в результате работы тех, кого пользователь запустил напрямую.

2. Исследователи пишут больше кода и проводят больше экспериментов

Значительную часть исследований в области ИИ можно рассматривать как трудоемкий процесс, цель которого — интеграция нового улучшения интеллекта или производительности модели в одну из наших базовых моделей. Процесс зависит от множества шагов, и возможности продвигаются вперед, когда все шаги складываются успешно: исследователям приходится проектировать новые улучшения, писать оценочные тесты для оценки производительности модели, создавать инфраструктуру для тестирования этих улучшений в масштабе, выявлять ошибки, а также небезопасное или нежелательное поведение в процессе обучения, и интегрировать успешные идеи в основной цикл обучения. Сбой на любом этапе исследовательского процесса может ограничить весь цикл.

Написание кода и проведение экспериментов — это два основных вида деятельности исследователей в рамках их работы, и у нас есть свидетельства того, что эти процессы ускоряются.

Эти точки данных относительно легко измерить, но их бывает трудно интерпретировать. По мере развития автоматизации задачи, которые поддаются автоматизации в меньшей степени, будут занимать большую долю усилий исследователей и станут важными узкими местами для будущего прогресса. Вычислительные мощности являются еще одним сдерживающим фактором для прогресса и могут со временем приобрести еще большую важность по мере уменьшения других узких мест.

К 2026 году количество экспериментов в расчете на одного активного исследователя увеличилось, причем август 2026 года стал абсолютным рекордсменом с момента начала отслеживания в январе 2025 года. Это коррелирует с ростом внедрения Codex, хотя мы отмечаем, что наши доступные вычислительные мощности также значительно выросли с 2025 года.

3. Характер задач, для которых исследователи используют агентов, меняется

Как качественные впечатления, так и внутренние данные показывают, что набор задач, которые исследователи делегируют агентам по написанию кода, меняется: со временем делегирование задач более высокого уровня и с более долгосрочным горизонтом становится все более распространенным.

Чтобы получить более четкое представление об этой тенденции, мы проанализировали недавнее использование в исследовательской организации с помощью недавно опубликованной таксономии различных видов работ, входящих в жизненный цикл НИОКР в области ИИ, разработанной Epoch AI. Эта таксономия, вдохновленная долгоживущей системой O*NET для классификации всех видов труда, специально адаптирована для передовых НИОКР в области ИИ и разбивает процесс на шесть основных фаз:

  1. Принятие решений (Decide): над чем работать, что продолжать, куда направлять ресурсы
  2. Проектирование (Design): исследовательские идеи и инженерные спецификации
  3. Создание (Build): код и наборы данных
  4. Запуск (Run): обучающие/оценочные запуски, аппаратное обеспечение, обслуживание
  5. Анализ (Analyze): эксперименты, модели, развертывание, внешняя работа
  6. Коммуникация (Communicate): результаты, обратная связь, статус, решения

Ниже мы классифицируем токены агентов по написанию кода в соответствии с этой таксономией.

Мы видим, что в период с января по август 2026 года объемы во всех категориях исследовательской деятельности увеличились. В январе доминирующей категорией были исследования и код инфраструктуры. Эта категория расширилась, но мы также наблюдаем заметный рост в других категориях, особенно в области технической помощи и мониторинга запусков. Планирование высокого уровня по-прежнему составляет минимальную долю выходных токенов агентов.

По отзывам коллег, агенты по написанию кода превосходно справляются с устранением неполадок во внутренней исследовательской инфраструктуре, что решает одну из важных проблем на пути к исследовательскому прогрессу. Несколько команд, которые ранее проводили консультационные часы для помощи исследователям в устранении неполадок в экспериментах, отметили снижение посещаемости в 2026 году, а одна из команд полностью прекратила проведение таких сессий, сосредоточившись вместо этого на других улучшениях систем.

Здесь мы строим график количества публикаций верхнего уровня в день в одном из основных внутренних каналов, где исследователи ищут техническую поддержку у других команд. Насколько нам известно, снижение активности в канале не было компенсировано переходом запросов в другой канал технической поддержки, управляемый людьми. Снижение трафика согласуется с этим более широким сдвигом.

Мы также можем изучить, насколько успешно агенты по написанию кода справляются с задачами, запрашиваемыми исследователями. С помощью агентного классификатора мы обнаруживаем, что с января по июль показатели успешности в целом возросли в различных категориях сложности (приблизительно оцениваемых по времени, которое потребовалось бы человеку для выполнения задачи) по тем задачам, для которых мы можем найти эталонный результат. Тем не менее, агентам по-прежнему требуется значительное вмешательство человека для достижения успеха, особенно по мере возрастания сложности задач. За последние 6 месяцев более половины успешных задач, занимающих от 4 до 8 часов, потребовали 1 или более вмешательств.

Процент успешных решений задач исследователями со временем увеличился. На графике не учтены классификации с неопределенным исходом, а также точки с количеством сеансов <50 или уникальных пользователей <50.

Успешность выполнения задач и частота вмешательств с января по июль, с разбивкой по временным горизонтам. Классификации с неопределенным исходом исключены.

4. Регулирование темпов разработки моделей

Прогресс в создании более способных систем для безопасного и полезного ОИИ (AGI) также будет зависеть от мер безопасности, необходимых для такой работы. Наша оценка необходимых средств защиты может измениться по мере получения новых данных о рисках.

Как мы уже отмечали, мы недавно обновили наши стандарты мониторинга, выравнивания и безопасности. Здесь мы показываем, как недавние ограничения повлияли на один из аспектов исследовательской деятельности.

*Большая часть вычислительных ресурсов Astra, показанных здесь в период с 20 июля по 6 августа, была выделена для тестирования внедрения улучшений безопасности и защищенности.

20 июля, после обнаружения того, что агенты скомпрометировали нашу исследовательскую инфраструктуру, мы временно отключили контейнерную службу, используемую для обучения, а затем восстановили ее со значительными дополнительными ограничениями.

Это привело к резкому сокращению объема вычислений для обучения с подкреплением (RL), пока команды перестраивали свои рабочие процессы для работы в рамках ужесточенной исследовательской среды. Представленный выше график включает двухнедельную паузу в обучении с подкреплением наших новейших моделей, предназначенных для развертывания. Эксперименты по RL с моделями класса Astra в период с 20 июля по 6 августа включают большинство запусков (по выделению графических процессоров), целью которых было тестирование внедрения улучшений безопасности и защищенности.

7 августа предварительные данные о том, что Astra может обладать критическими кибервозможностями в соответствии с нашей Платформой готовности (Preparedness Framework), привели к введению дополнительных ограничений безопасности для конкретной модели, что потребовало запуска Astra в исследовательской среде с повышенным уровнем безопасности. На следующей неделе выделение графических процессоров для моделей класса Astra сократилось еще на 59,2 процента, однако выделение ресурсов для моделей других классов возросло на 17,2 процента. Это увеличение компенсировало примерно 85 процентов спада по классу Astra, в результате чего общий объем выделенных ресурсов в анализируемых рабочих нагрузках RL остался практически неизменным. Эта закономерность согласуется с перенаправлением части обучения и экспериментов на модели, не относящиеся к классу Astra, на время действия ограничений для Astra, а также подтверждается неофициальными отчетами исследователей, которые нашли иное применение вычислительным мощностям, более не доступным для рабочих нагрузок, подпадающих под новые ограничения.

Эти данные служат полезным ориентиром для текущих дискуссий об обучении и безопасности: при введении новых мер контроля вычислительные мощности сохраняют свою ценность и гибкость, естественным образом перенаправляясь на альтернативные задачи в рамках исследовательской деятельности. В долгосрочной перспективе обсуждения темпов прогресса в области ИИ также должны затрагивать вопрос о том, как наиболее эффективно использовать вычислительные мощности, подпадающие под новые или предлагаемые ограничения.

5. Дальнейшие шаги

Оценка и понимание прогресса в направлении согласованного RSI важны для нашей миссии. Мы продолжим совершенствовать наши методы, сообщать о нашем меняющемся понимании и работать над информированными общественными дебатами и осмысленным демократическим управлением передовыми системами.

Приложение: Методология данной публикации

Исследования в области ИИ с использованием агентов все еще находятся на начальном этапе, и мы продолжаем учиться их измерять. Некоторые показатели, такие как объем генерируемого нашими исследовательскими группами кода, относительно легко собрать, но сложно интерпретировать, поскольку их связь с прогрессом исследований неочевидна. Метрики, более напрямую отражающие исследовательский прогресс — например, частота успешного выполнения агентами задач, поставленных исследователями, — могли бы быть более полезными, но их разработка и валидация сложны. Дополнительную трудность представляет стремительная эволюция инструментов и систем, на которые полагаются исследователи. Углубление понимания ускорения исследований является одним из ключевых приоритетов для OpenAI.

Во всех этих аналитических материалах, если не указано иное:

  • «Исследователь» — это собирательный термин для любого сотрудника нашей исследовательской организации, включая тех, кто создает исследовательскую инфраструктуру, управляет исследовательскими проектами или иным образом поддерживает деятельность предприятия.
  • Метрики использования агентов для написания кода охватывают большинство, но не все случаи использования, что обусловлено быстрым развитием инструментов и систем, используемых исследователями.

Автор

OpenAI

Полный текст статьи читайте на OpenAI прочитано 353 раза