Укрепление нашей экосистемы безопасности с помощью внешнего тестирования

oai_GA_Stories_16.9.png?w=1600&h=900&fit

Наш подход к независимой оценке передовых систем искусственного интеллекта.

В OpenAI мы убеждены, что независимые и авторитетные сторонние оценки играют важнейшую роль в укреплении системы безопасности передового ИИ. Сторонняя оценка — это тестирование передовых моделей, цель которого подтвердить или дополнить аргументы в пользу их ключевых возможностей в области безопасности и мер защиты. Такие оценки помогают проверить заявления о безопасности, защитить систему от слепых зон и повысить прозрачность в отношении возможностей и рисков моделей. Привлекая внешних экспертов к тестированию наших передовых моделей, мы также стремимся укрепить доверие к глубине наших оценок возможностей и мер предосторожности, а также способствовать развитию всей экосистемы безопасности ИИ.

С момента выпуска GPT‑4 компания OpenAI сотрудничает с самыми разными внешними партнерами для тестирования и оценки наших моделей. В целом наше сотрудничество со сторонними экспертами принимает три основные формы:

  • Независимые оценки ключевых областей передовых возможностей и рисков, таких как биобезопасность, кибербезопасность, самосовершенствование ИИ и стратегическое поведение (scheming);
  • Рецензирование методологий, оценивающее то, как именно мы оцениваем и интерпретируем риски;
  • Анализ профильными экспертами (SME), в ходе которого эксперты напрямую оценивают модель на реальных экспертных задачах и предоставляют структурированные данные для оценки её возможностей и сопутствующих мер защиты1.

В этой статье блога рассказывается о том, как мы используем каждый из этих видов внешней оценки, почему они важны, как они повлияли на решения о развертывании моделей и какими принципами мы руководствуемся при организации такого сотрудничества. Руководствуясь принципом прозрачности, мы также подробнее рассказываем об условиях конфиденциальности и публикации, которые регулируют нашу работу со сторонними тестировщиками.

Почему это важно?

Сторонние оценщики добавляют независимый уровень проверки в дополнение к нашей внутренней работе, повышая строгость подходов и обеспечивая дополнительную защиту от предвзятости подтверждения. Их выводы служат дополнительным доказательством наряду с нашими собственными оценками, помогая принимать ответственные решения о развертывании мощных систем.

Мы также рассматриваем сторонние оценки как часть формирования устойчивой экосистемы безопасности. Наши команды проводят масштабное внутреннее тестирование возможностей и рисков, однако независимые организации привносят новые точки зрения и методологические подходы. Мы стремимся поддерживать широкий круг квалифицированных организаций-оценщиков, которые могут регулярно тестировать передовые модели вместе с нами.

Наконец, мы стремимся к прозрачности в том, как эти отзывы помогают формировать наш процесс обеспечения безопасности. Мы регулярно публикуем сторонние оценки — например, включая краткие результаты предварительного тестирования в системные карты (system cards) и помогая организациям-оценщикам публиковать более подробные отчеты после проверки на предмет конфиденциальности и точности. Такая прозрачность укрепляет доверие, демонстрируя, как внешние отзывы влияют на оценку наших возможностей и меры предосторожности.

Долгосрочные отношения, основанные на доверительном доступе, прозрачности и обмене знаниями, помогают всей экосистеме опережать возникающие риски, а также способствуют созданию гибких и применимых на практике оценок, необходимых для внедрения более строгих стандартов и более информированного управления системами передового ИИ.

Независимые оценки внешними лабораториями

Начиная с выпуска GPT‑4, мы поддерживаем проведение независимых оценок ранних контрольных точек моделей (checkpoints) до их развертывания. С тех пор мы расширили сотрудничество с рядом сторонних организаций, обладающих глубокой экспертизой в оценке ключевых возможностей и рисков передового ИИ. Мы определяем работу независимых лабораторий как открытое тестирование, в рамках которого сторонние команды применяют собственные методы для формирования выводов или оценок, касающихся конкретных передовых возможностей.

Например, для GPT‑5 компания OpenAI координировала широкий спектр внешних оценок возможностей в ключевых областях риска, таких как долгосрочная автономия, стратегическое поведение (scheming), обман и подрыв контроля, осуществимость планирования в лабораторных условиях (wet lab), а также оценки на предмет наступательной кибербезопасности.

Эти независимые оценки дополняют проверки, проводимые в соответствии с «Фреймворком готовности» (Preparedness Framework) OpenAI, и включают такие бенчмарки, как оценка временного горизона организации METR или оценка способностей вирусологии (VCT) от SecureBio.

Для поддержки этих оценок мы предоставили безопасный доступ к ранним контрольным точкам моделей, избранные результаты тестирования для демонстрации достигаемых улучшений возможностей, условия без сохранения данных (при необходимости), а также модели с меньшим количеством средств защиты. Например, организации, проводившие тестирование в областях кибербезопасности и биобезопасности, исследовали модели как с мерами безопасности, так и без них, чтобы выявить базовые возможности. Несколько других организаций получили прямой доступ к цепочке рассуждений (chain-of-thought), что позволило им изучить логические шаги модели. Этот шаг по повышению прозрачности позволил оценщикам выявлять случаи симуляции ограничений (sandbagging)2 или стратегического поведения, которые могут быть заметны только при чтении цепочки рассуждений. Доступ предоставлялся с соблюдением мер безопасности, и мы продолжаем обновлять эти элементы управления по мере развития возможностей моделей и потребностей тестирования.

Рецензирование методологии

В определенных контекстах внешние оценщики имеют все возможности для проведения методологического рецензирования, привнося дополнительные взгляды на фреймворки и доказательную базу, на которые опираются передовые лаборатории при оценке рисков. Например, во время выпуска gpt-oss мы использовали состязательную дообучательную настройку (adversarial fine-tuning) для оценки наихудших сценариев возможностей моделей с открытыми весами (open weight), как описано в статье Оценка наихудших рисков передовых LLM с открытыми весами. Главный вопрос безопасности заключался в том, сможет ли злоумышленник дообучить модель так, чтобы достичь высокого уровня возможностей в таких областях, как биология или кибербезопасность в рамках нашего Фреймворка готовности. Поскольку это потребовало ресурсоемкой состязательной дообучательной настройки, мы пригласили сторонних экспертов для рецензирования и подготовки рекомендаций по нашим внутренним методам и результатам, а не стали повторять аналогичную работу силами сторон.

Это потребовало многонедельной работы по обмену результатами оценок и деталями подхода к состязательной дообучательной настройке, а также сбору структурированных рекомендаций по улучшению методологии и тестированию наихудших передовых рисков. Отзывы оценщиков привели к изменениям в финальном процессе состязательной дообучательной настройки и продемонстрировали ценность методологического подтверждения. Мы зафиксировали элементы, которые были внедрены, в исследовании и системной карте для gpt-oss, а также предоставили обоснования для тех предложений, которые не были приняты.

В данном случае рецензирование методологии оказалось более подходящим вариантом, чем независимые оценки: последние предполагали проведение крупномасштабных экспериментов с наихудшими сценариями, что требует инфраструктуры и технической экспертизы, которые редко встречаются за пределами крупных лабораторий ИИ. Это означало, что независимые оценки вряд ли смогли бы напрямую привести к пониманию худших сценариев, поэтому было продуктивнее сосредоточить внешних экспертов на подтверждении выводов. Внешние оценщики проанализировали методы и фактические данные, выделив критические для принятия решений пробелы, которые были устранены в рамках цикла обратной связи с рекомендациями. Мы надеемся распространить этот подход на другие направления, где требования к доступу или инфраструктуре делают нецелесообразным самостоятельное проведение оценок сторонними организациями, или где внешние оценки еще не существуют.

Анализ профильными экспертами (SME)

Еще один способ привлечения внешних экспертов — профильный анализ (SME probing), в ходе которого специалисты напрямую оценивают модель и предоставляют структурированные данные через опросы для оценки ее возможностей. Это отличается от ред-тиминга (red teaming), цель которого заключается в стресс-тестировании конкретных средств защиты. Такой подход позволяет дополнить оценки в рамках Фреймворка готовности предметными инсайтами, отражающими экспертное суждение и реальный контекст, который статические оценки могут упустить. Например, мы пригласили группу профильных экспертов поработать с моделью, ориентированной исключительно на помощь пользователю (helpful-only model)3, чтобы протестировать собственные комплексные биосценарии для агента ChatGPT и GPT‑5. Они оценивали, насколько модель способна повысить квалификацию эксперта по сравнению с менее опытным новичком, основываясь на полезности предоставленных в их сценариях рекомендаций. Цель состояла в том, чтобы собрать дополнительные данные о том, насколько эффективно система может приблизить мотивированного новичка к компетентному выполнению задач: эксперты подвергли стресс-тестированию наши заявления о «помощи новичкам» в рамках реалистичных рабочих процессов и дали детальные отзывы о том, где модель дала существенную пошаговую помощь, а где — менее полезные сводки. Это экспертное тестирование было включено в общую оценку для развертывания этих моделей и отражено в системных картах для обоих релизов.

Что делает сотрудничество по сторонним оценкам успешным?

Продолжая курс на прозрачность, мы подробно рассказываем о том, на каких условиях сторонние эксперты соглашаются работать с нами, и о принципах, которые определяют наше сотрудничество:

  • Прозрачность с четкими границами конфиденциальности: Сторонние оценщики подписывают соглашения о неразглашении, что позволяет делиться конфиденциальной, непубличной информацией для поддержки их оценок. В Приложении к этой публикации мы приводим соответствующие выдержки из контрактов со сторонними оценщиками, в которых описаны права на публикацию и требования к проверке. Мы руководствуемся принципом прозрачности и стремимся содействовать публикации материалов, которые расширяют понимание безопасности и сопутствующих оценок, не раскрывая при этом конфиденциальную информацию или интеллектуальную собственность. В рамках этого мы проверяем и одобряем публикации по результатам сторонних оценок, чтобы гарантировать как конфиденциальность, так и фактическую точность. За последние несколько лет несколько сторонних экспертов опубликовали свои работы параллельно с нашей публикацией кратких результатов оценок в системных картах. Некоторые примеры работ, опубликованных после нашей проверки на предмет конфиденциальности и точности: [отчет METR по GPT‑5, отчет Apollo Research по OpenAI o1, оценка GPT‑5 от Irregular].
  • Продуманное раскрытие информации и безопасный доступ к чувствительным данным: По умолчанию мы предоставляем информацию и доступ к моделям, которые предназначены для публичного использования или готовы к производственной эксплуатации. Когда того требуют оценки, мы предоставляем более глубокий доступ — например, к моделям, ориентированным исключительно на помощь пользователю, или к непубличной информации. Компания OpenAI предоставляла такие формы доступа везде, где это было необходимо для решения критических вопросов безопасности сторонних оценщиков. Важно отметить, что такие типы конфиденциального доступа требуют строгих мер безопасности, и мы продолжаем обновлять эти элементы управления по мере развития возможностей моделей и потребностей тестирования.
  • Сбалансированные финансовые стимулы: Мы считаем важным обеспечивать надлежащее финансирование и устойчивость экосистемы сторонних оценок. Поэтому мы предлагаем компенсацию всем нашим сторонним оценщикам, хотя некоторые из них предпочитают отказываться от нее в силу своей организационной философии. Формы компенсации включают прямую оплату работы и/или субсидирование расходов на использование моделей посредством API-кредитов или иным образом. Никакие выплаты никогда не зависят от результатов сторонней оценки.

В совокупности эти факторы помогают сторонним оценкам защищать конфиденциальную информацию, способствуют прозрачности в сфере безопасности ИИ и создают условия для того, чтобы сторонние эксперты получали компенсацию за свое время.

Взгляд в будущее

В будущем мы видим необходимость дальнейшего укрепления экосистемы организаций, способных проводить надежные и релевантные для принятия решений оценки систем передового ИИ. Эффективная сторонняя оценка требует специализированной экспертизы, стабильного финансирования и методологической строгости. Непрерывные инвестиции в квалифицированные организации-оценщики, развитие науки об измерениях и обеспечение безопасности конфиденциального доступа будут иметь решающее значение для того, чтобы оценки успевали за развитием возможностей моделей.

Сторонние оценки — это лишь один из способов привлечения внешних взглядов к нашей работе по безопасности, и они действуют наряду с другими механизмами. Мы также сотрудничаем с внешними экспертами посредством структурированных инициатив по ред-тимингу, проектов коллективного выравнивания, работы с Институтами безопасности ИИ США (CAISI) и Великобритании (AISI), а также консультативных групп, таких как наша Глобальная сеть врачей и Экспертный совет по вопросам благополучия и ИИ, которые помогают направлять нашу работу в области психического здоровья и благополучия пользователей. Эти усилия привносят различные формы экспертизы и формируют более широкую, надежную основу для оценки и управления передовыми системами ИИ.

Приложение

Ниже приведены показательные выдержки из наших соглашений со сторонними организациями, сотрудничающими с нами по вопросам предварительной оценки.

Научные публикации: […] Настоящим Поставщик сохраняет за собой или OpenAI предоставляет Поставщику обратно (в зависимости от применимых условий) право использовать Рабочие результаты поставщика, созданные или обнаруженные Поставщиком в исследовательских, академических, научных и/или образовательных целях, при условии, что такое использование (a) не носит коммерческого характера, (b) не раскрывает Конфиденциальную информацию OpenAI (за исключением случаев, прямо и предварительно разрешенных OpenAI в письменной форме) и © предоставляется в OpenAI для письменного рассмотрения и утверждения до публикации или раскрытия. «Конфиденциальная информация» OpenAI включает в себя, помимо прочего, Непубличные модели OpenAI и их результаты, включая любые Рабочие результаты поставщика, которые были созданы или обнаружены в результате использования Непубличных моделей. «Непубличные модели» означают модели искусственного интеллекта и машинного обучения OpenAI, включая их версии и снимки (snapshots), которые не были выпущены для широкой общественности на момент предполагаемой даты публикации Поставщика.

Конфиденциальная информация. Для целей настоящего Соглашения «Конфиденциальная информация» означает и включает в себя: (i) любую информацию, материалы или знания об OpenAI и ее бизнесе, финансовом состоянии, продуктах, методологии программирования, клиентах, поставщиках, технологиях либо научно-исследовательских и опытно-конструкторских разработках, которые раскрываются Исполнителю или к которым Исполнитель получает доступ в связи с оказанием Услуг; (ii) Рабочие результаты Исполнителя; и (iii) условия настоящего Соглашения. Конфиденциальная информация не включает в себя какую-либо информацию, которая: (a) является или становится частью общественного достояния не по вине Исполнителя либо любого представителя или агента Исполнителя; (b) доказана Исполнителем как законно находившаяся в распоряжении Исполнителя на момент раскрытия без каких-либо ограничений на ее использование или раскрытие; или © правомерно получена Исполнителем от третьей стороны, которая имеет право ее раскрывать и предоставляет ее без ограничений на использование или раскрытие. Исполнитель обязуется соблюдать строгую конфиденциальность всей Конфиденциальной информации, не использовать ее каким-либо образом — в коммерческих или иных целях, — кроме как для оказания Услуг для OpenAI, и не раскрывать ее третьим лицам. Исполнитель обязуется предпринять все действия, обоснованно необходимые для защиты конфиденциальности всей Конфиденциальной информации, включая, помимо прочего, внедрение и соблюдение процедур по минимизации возможности несанкционированного использования или раскрытия Конфиденциальной информации.

Не предоставляя каких-либо прав или лицензий, Раскрывающая сторона соглашается с тем, что вышесказанное не применяется в отношении (a) любой информации по истечении 2 лет с момента ее раскрытия, за исключением информации, являющейся коммерческой тайной, на которую распространяются обязательства по соблюдению конфиденциальности по настоящему Соглашению до тех пор, пока она является коммерческой тайной; (b) любой информации, содержащейся в некоммерческом исследовании или академической публикации Исследователя в той мере, в какой такая информация либо (i) одобрена в письменной форме OpenAI до публикации, либо (ii) получена в результате той версии Технологии OpenAI, которая была официально предоставлена OpenAI в общий доступ для широкой общественности (и, во избежание сомнений, не включает какую-либо информацию, результаты или выходные данные версий Технологии OpenAI, которые не были сделаны общедоступными); или © любой информации, которую Получающая сторона может документально подтвердить как (i) ставшую или становящуюся (не в результате неправомерных действий или бездействия Получающей стороны либо любого ее аффилированного лица, агента, консультанта или сотрудника) общедоступной, (ii) находившуюся в ее владении или известную ей без каких-либо ограничений до получения от Раскрывающей стороны, (iii) правомерно раскрытую ей третьей стороной без ограничений, или (iv) независимо разработанную без использования какой-либо Проприетарной информации Раскрывающей стороны должностными лицами, директорами, сотрудниками, консультантами, представителями, советниками или аффилированными лицами Получающей стороны, которые не имели доступа к такой Проприетарной информации. Получающая сторона может осуществлять раскрытие информации, требуемое законом или судебным приказом, при условии, что Получающая сторона прилагает все разумные и усердные усилия для ограничения раскрытия и получения режима конфиденциальности или защитного приказа, а также позволяет Раскрывающей стороне принять участие в разбирательстве.

Автор

OpenAI

Сноски

  1. 1

    Это отличается от ред-тиминга (red teaming), целью которого является детальное стресс-тестирование средств защиты и предоставление данных для разработки методов оценки.

  2. 2

    Ситуация, когда модель намеренно демонстрирует худшие результаты или скрывает свои истинные возможности при обнаружении того, что она проходит оценку или тестирование.

  3. 3

    Модели, ориентированные только на помощь пользователю, отвечают на любые запросы, даже если такие запросы являются вредоносными. Они создаются с помощью методов постобучения, обеспечивающих такое поведение.

Полный текст статьи читайте на OpenAI