Обновление систем безопасности OpenAI

Делимся нашими практиками в рамках Сеульского саммита по искусственному интеллекту.

An abstract painting of a soft, pastel-colored sky at sunset or sunrise. Shades of pink, purple, orange, and yellow blend together, with gentle cloud formations and a hint of blue near the horizon, creating a peaceful, serene atmosphere.

Мы гордимся тем, что создаем и выпускаем модели, лидирующие в отрасли как по своим возможностям, так и по безопасности.

Более ста миллионов пользователей и миллионы разработчиков полагаются на работу наших команд по безопасности. Мы рассматриваем безопасность как сферу, в которую необходимо инвестировать и добиваться успеха в различных временных горизонтах — от согласования текущих моделей до значительно более мощных систем, которые мы ожидаем в будущем. Эта работа всегда велась во всех подразделениях OpenAI, и наши инвестиции будут только расти со временем.

Мы верим в сбалансированный, научный подход, при котором меры безопасности интегрируются в процесс разработки с самого начала. Это гарантирует, что наши ИИ-системы будут одновременно инновационными и надежными, а также принесут пользу обществу.

На сегодняшнем Сеульском саммите по искусственному интеллекту мы присоединяемся к лидерам индустрии, правительственным чиновникам и представителям гражданского общества для обсуждения безопасности ИИ. Хотя нам еще многое предстоит сделать, нас воодушевляют дополнительные обязательства в области безопасности передового ИИ, которые OpenAI и другие компании согласовали сегодня. Эти обязательства призывают компании безопасно разрабатывать и внедрять свои передовые ИИ-модели, одновременно обмениваясь информацией о мерах по снижению рисков, что согласуется с шагами, которые мы уже предприняли. К ним относится обязательство публиковать такие фреймворки безопасности, как Фреймворк готовности, который мы разработали и приняли в прошлом году.

Мы делимся 10 практиками, которые мы активно используем и совершенствуем.

  1. Эмпирическое тестирование моделей на уязвимости (red-teaming) и проверка перед выпуском: Мы эмпирически оцениваем безопасность моделей до их выпуска, как внутри компании, так и с привлечением внешних экспертов, в соответствии с нашим Фреймворком готовности и добровольными обязательствами. Мы не выпустим новую модель, если она превышает порог риска «Средний» по нашему Фреймворку готовности, до тех пор, пока мы не внедрим достаточные меры безопасности, чтобы вернуть показатель после смягчения рисков до уровня «Средний». Более 70 внешних экспертов помогли оценить риски, связанные с GPT‑4o, в рамках наших инициатив по внешнему тестированию на уязвимости, и мы использовали полученные знания для создания оценок на основе слабых мест в более ранних контрольных точках, чтобы лучше понять более поздние.
  2. Исследования в области согласованности (alignment) и безопасности: Со временем наши модели стали значительно безопаснее. Это объясняется созданием более умных моделей, которые обычно делают меньше фактических ошибок и с меньшей вероятностью выдают вредоносный контент даже в состязательных условиях, таких как джейлбрейк (обход ограничений). Это также результат наших целенаправленных инвестиций в практическую согласованность, системы безопасности и исследования в области постобучения. Эти усилия направлены на повышение качества данных донастройки, создаваемых людьми, а в будущем — и инструкций, которым наши модели обучены следовать. Мы также проводим и публикуем фундаментальные исследования, направленные на кардинальное улучшение устойчивости наших систем к атакам, таким как джейлбрейк.
  3. Мониторинг злоупотреблений: По мере внедрения все более мощных языковых моделей через наш API и ChatGPT мы задействовали широкий спектр инструментов, включая специализированные моделимодерации и использование наших собственных моделей для мониторинга рисков безопасности и злоупотреблений. Мы поделились некоторыми критическими выводами, включая совместное раскрытие (с Microsoft) информации о злоупотреблении нашей технологией со стороны поддерживаемых государствами хакерских группировок, чтобы другие могли лучше защититься от подобных рисков. Мы также используем GPT‑4 для разработки правил модерации контента и принятия решений по нему, что обеспечивает более быстрый цикл обратной связи для доработки политик и снижает количество вредоносных материалов, с которыми сталкиваются человеческие модераторы.
  4. Систематический подход к безопасности: Мы внедряем комплекс мер безопасности на каждом этапе жизненного цикла модели: от предварительного обучения до развертывания. По мере продвижения в разработке более безопасного и согласованного поведения моделей мы также инвестируем в безопасность данных предварительного обучения, управление поведением моделей на системном уровне, циклы обратной связи по данным для постоянного повышения безопасности и надежную инфраструктуру мониторинга.
  5. Защита детей: Ключевым направлением нашей работы по безопасности является защита детей. Мы встроили надежные стандартные средства защиты и меры безопасности в ChatGPT и DALL·E, которые снижают потенциальные риски для детей. В 2023 году мы начали сотрудничество со службой Thorn«s Safer для обнаружения, проверки и передачи материалов с изображениями сексуального насилия над детьми в Национальный центр пропавших и эксплуатируемых детей, если пользователи пытаются загрузить их в наши инструменты для работы с изображениями. Мы продолжаем сотрудничать с организациями Thorn, Tech Coalition, All Tech is Human, Commonsense Media и широким технологическим сообществом для поддержания принципов безопасности на этапе проектирования (Safety by Design).
  6. Целостность выборов: Мы сотрудничаем с правительствами и заинтересованными сторонами, чтобы предотвращать злоупотребления, обеспечивать прозрачность контента, созданного ИИ, и улучшать доступ к точной информации о голосовании. Для этого мы представили инструмент для идентификации изображений, созданных с помощью DALL·E 3, вошли в руководящий комитет Инициативы по подлинности контента (C2PA) и внедрили метаданные C2PA в DALL·E 3, чтобы помочь людям понимать источник медиафайлов, найденных в сети. Теперь ChatGPT направляет пользователей на официальные источники информации о голосовании в США и Европе. Кроме того, мы поддерживаем двухпартийный «Закон о защите выборов от вводящего в заблуждение ИИ», предложенный в Сенате США, который запрещает использование вводящего в заблуждение контента, созданного ИИ, в политической рекламе.
  7. Инвестиции в оценку воздействия и анализ политики: Наши усилия по оценке воздействия оказали большое влияние на исследования, отраслевые нормы и политику, включая нашу раннюю работу по оценке химических, биологических, радиологических и ядерных (ХБРЯ) рисков, связанных с ИИ-системами, а также наше исследование, оценивающее степень, в которой различные профессии и отрасли могут пострадать от языковых моделей. Мы также публикуем новаторские работы о том, как общество может наилучшим образом управлять сопутствующими рисками — например, сотрудничая с внешними экспертами для оценки последствий использования языковых моделей в операциях влияния.
  8. Меры безопасности и контроля доступа: Мы уделяем первостепенное внимание защите наших клиентов, интеллектуальной собственности и данных. Мы предоставляем наши ИИ-модели миру в виде сервисов, контролируя доступ через API, что позволяет обеспечивать соблюдение политик. Наши усилия в области кибербезопасности включают ограничение доступа к обучающим средам и высокоценным алгоритмическим секретам на основе принципа служебной необходимости, внутреннее и внешнее тестирование на проникновение, программу выплаты вознаграждений за найденные ошибки (bug bounty) и многое другое. Мы верим, что защита передовых ИИ-систем выиграет от эволюции инфраструктурной безопасности, и изучаем новые средства контроля, такие как конфиденциальные вычисления для графических процессоров и применение ИИ для киберзащиты, чтобы защитить нашу технологию. Для усиления киберзащиты мы финансируем сторонних исследователей безопасности в рамках нашей программы грантов на кибербезопасность.
  9. Партнерство с правительствами: Мы сотрудничаем с правительствами по всему миру, чтобы способствовать разработке эффективной и адаптируемой политики безопасности ИИ. Это включает демонстрацию наших наработок и обмен опытом, совместное пилотирование проверок со стороны правительств и других третьих лиц, а также участие в общественных дискуссиях по поводу новых стандартов и законов.
  10. Принятие решений по безопасности и надзор Совета директоров: В рамках нашего Фреймворка готовности у нас действует операционная структура для принятия решений в области безопасности. Наша многофункциональная Консультативная группа по безопасности (Safety Advisory Group) рассматривает отчеты о возможностях моделей и дает рекомендации перед их развертыванием. Руководство компании принимает окончательные решения, а Совет директоров осуществляет надзор за этими решениями.

Этот подход позволил нам создавать и внедрять безопасные и мощные модели на текущем уровне возможностей.

По мере продвижения к нашей следующей передовой модели мы понимаем, что нам потребуется развивать наши практики — в частности, повышать уровень защищенности, чтобы в конечном итоге противостоять сложным атакам со стороны поддерживаемых государством хакеров, и выделять больше времени на тестирование безопасности перед крупными запусками. Перед нами и всей индустрией стоит сложная задача по безопасному и выгодному внедрению все более мощного ИИ. Мы планируем поделиться подробностями об этих развивающихся практиках в ближайшие недели.

Автор

OpenAI

Полный текст статьи читайте на OpenAI