Системная карта Deep Research

LHT_System_Card_16.9.png?w=1600&h=900&fi

В этом отчете описана работа по обеспечению безопасности, проделанная перед выпуском Deep Research, включая внешнее тестирование на проникновение (red teaming), оценку рисков передовых моделей в рамках нашей Методологии готовности (Preparedness Framework), а также обзор средств защиты, созданных нами для устранения ключевых областей риска.

Читать системную картуВклад участников

Системная карта Deep Research

Конкретные области риска

  • Промпт-инъекции
  • Запрещенный контент
  • Конфиденциальность
  • Возможность выполнения кода
  • Предвзятость
  • Галлюцинации

Оценочная таблица готовности (Preparedness Scorecard)

  • ХБРЯ (CBRN)
    Средний
  • Кибербезопасность
    Средний
  • Убеждение
    Средний
  • Автономность модели
    Средний

Оценки в таблице готовности

  • Низкий
  • Средний
  • Высокий
  • Критический

К развертыванию допускаются только модели с оценкой «средний» или ниже после применения мер защиты.
К дальнейшей разработке допускаются только модели с оценкой «высокий» или ниже после применения мер защиты.

Введение

Deep Research — это новая агентная функция, которая выполняет многоэтапные исследования в интернете для решения сложных задач. Модель Deep Research работает на базе ранней версии OpenAI o3, оптимизированной для веб-сёрфинга. Deep Research использует рассуждения для поиска, интерпретации и анализа огромных объемов текста, изображений и PDF-файлов в интернете, перестраивая стратегию по мере необходимости в зависимости от обнаруженной информации. Она также может читать предоставленные пользователем файлы и анализировать данные путем написания и выполнения кода на Python. Мы верим, что Deep Research окажется полезной для людей в самых разных ситуациях.

Перед запуском Deep Research и предоставлением доступа к ней нашим Pro-пользователям мы провели тщательное тестирование безопасности, оценки в рамках Методологии готовности и экспертные проверки. Мы также провели дополнительное тестирование безопасности, чтобы лучше понять дополнительные риски, связанные со способностью Deep Research просматривать веб-страницы, и внедрили новые средства защиты. Ключевые направления новой работы включали усиление защиты конфиденциальности в отношении личной информации, публикуемой в сети, а также обучение модели противостоять вредоносным инструкциям, с которыми она может столкнуться при поиске в интернете.

В то же время тестирование Deep Research позволило нам выявить возможности для дальнейшего совершенствования наших методов тестирования. Перед расширением выпуска Deep Research мы уделили время дополнительному тестированию с участием людей и автоматизированным тестам на предмет определенных рисков.

Опираясь на устоявшиеся практики безопасности OpenAI и Методологию готовности (Preparedness Framework), эта системная карта предоставляет более подробную информацию о том, как мы создавали Deep Research, изучали ее возможности и риски, а также повышали уровень безопасности до запуска.

Авторы

OpenAI

Полный текст статьи читайте на OpenAI