Наш подход к безопасности ИИ
Обеспечение безопасности разработки, развертывания и использования систем искусственного интеллекта имеет решающее значение для нашей миссии.

Иллюстрация: Джастин Джей Ван (Justin Jay Wang) × DALL·E
OpenAI стремится к тому, чтобы мощные системы искусственного интеллекта были безопасными и приносили широкую пользу. Мы знаем, что наши ИИ-инструменты приносят много пользы современным людям. Пользователи по всему миру говорят нам, что ChatGPT помогает повысить их продуктивность, раскрыть творческий потенциал и получить индивидуальный опыт обучения. Мы также понимаем, что, как и любая технология, эти инструменты несут в себе реальные риски, поэтому мы работаем над тем, чтобы безопасность была заложена в нашу систему на всех уровнях.
Создание все более безопасных систем ИИ
Перед выпуском любой новой системы мы проводим строгие тесты, привлекаем внешних экспертов для получения отзывов, работаем над улучшением поведения модели с помощью таких методов, как обучение с подкреплением на основе отзывов человека (RLHF), а также создаем масштабные системы безопасности и мониторинга.
Например, после завершения обучения нашей последней модели, GPT‑4, мы потратили более 6 месяцев на совместную работу по всей организации, чтобы сделать её более безопасной и согласованной перед публичным выпуском.
Мы считаем, что мощные системы ИИ должны проходить строгую оценку безопасности. Регулирование необходимо для обеспечения внедрения таких практик, и мы активно взаимодейруем с правительствами относительно наилучшей формы такого регулирования.
Изучение опыта реального использования для совершенствования средств защиты
Мы прилагаем все усилия для предотвращения предсказуемых рисков до развертывания систем, однако существуют ограничения в том, чему мы можем научиться в лаборатории. Несмотря на обширные исследования и тестирование, мы не можем предсказать все полезные способы использования нашей технологии людьми, равно как и все способы её злоупотребления. Именно поэтому мы считаем, что обучение на опыте реального использования является важнейшим компонентом создания и постепенного выпуска все более безопасных систем ИИ.
Мы осторожно и постепенно выпускаем новые системы ИИ — со значительными мерами защиты — для неуклонно расширяющейся группы людей и вносим постоянные улучшения на основе извлеченных уроков.
Мы предоставляем доступ к нашим наиболее способным моделям через наши собственные сервисы и через API, чтобы разработчики могли встраивать эту технологию непосредственно в свои приложения. Это позволяет нам отслеживать случаи злоупотребления и принимать меры, а также постоянно создавать средства защиты, которые реагируют на реальные способы злоупотребления нашими системами, а не только на теоретические предположения о том, как такое злоупотребление может выглядеть.
Опыт реального использования также привел нас к разработке более детальных правил против поведения, представляющего реальную угрозу для людей, при сохранении возможности многочисленных полезных применений нашей технологии.
Что еще более важно, мы считаем, что у общества должно быть время на адаптацию к возможностям ИИ, и что каждый, кого затрагивает эта технология, должен иметь весомое слово в том, как ИИ будет развиваться дальше. Итеративное развертывание помогло нам вовлечь различных заинтересованных лиц в обсуждение вопросов внедрения ИИ гораздо эффективнее, чем если бы у них не было личного опыта работы с этими инструментами.
Защита детей
Одной из важнейших задач в рамках обеспечения безопасности является защита детей. Мы требуем, чтобы пользователям наших ИИ-инструментов было 18 или более лет (либо от 13 лет с разрешения родителей), и изучаем возможности проверки возраста.
Мы не разрешаем использовать нашу технологию для генерации контента, содержащего призывы к ненависти, домогательства, сцены насилия или материалы для взрослых, среди прочих категорий. Наша последняя модель, GPT‑4, на 82% реже отвечает на запросы о запрещенном контенте по сравнению с GPT‑3.5, и мы создали надежную систему мониторинга нарушений. GPT‑4 теперь доступна подписчикам ChatGPT Plus, и мы надеемся сделать её доступной для еще большего числа людей со временем.
Мы приложили значительные усилия для минимизации вероятности создания нашими моделями контента, наносящего вред детям. Например, когда пользователи пытаются загрузить известные материалы с изображениями сексуального насилия над детьми (CSAM) в наши инструменты для работы с изображениями, мы используем инструмент Safer от организации Thorn для их обнаружения, проверки и передачи информации в Национальный центр пропавших и эксплуатируемых детей (NCMEC).
В дополнение к нашим стандартным средствам защиты мы сотрудничаем с такими разработчиками, как некоммерческая организация Khan Academy, которая создала ассистента на базе ИИ, выполняющего роль виртуального репетитора для учащихся и помощника в классе для учителей, внедряя индивидуальные меры безопасности для их сценариев использования. Мы также работаем над функциями, которые позволят разработчикам устанавливать более строгие стандарты для результатов работы моделей, чтобы лучше поддерживать разработчиков и пользователей, которым требуется такая функциональность.
Уважение к частной жизни
Наши большие языковые модели обучаются на обширном корпусе текстов, включающем общедоступный контент, лицензированный контент и контент, созданный людьми-рецензентами. Мы не используем данные для продажи наших услуг, рекламы или создания профилей людей — мы используем данные для того, чтобы наши модели приносили больше пользы людям. ChatGPT, например, совершенствуется за счет дополнительного обучения на разговорах, которые люди ведут с ним.
Хотя некоторые из наших обучающих данных включают личную информацию, доступную в общедоступной сети Интернет, мы хотим, чтобы наши модели изучали мир, а не частных лиц. Поэтому мы работаем над удалением личной информации из набора обучающих данных там, где это возможно, настраиваем модели так, чтобы они отклоняли запросы на предоставление личной информации частных лиц, и удовлетворяем запросы пользователей об удалении их личных данных из наших систем. Эти шаги минимизируют вероятность того, что наши модели могут генерировать ответы, содержащие личную информацию частных лиц.
Повышение фактической точности
Современные большие языковые модели прогнозируют следующую серию слов на основе паттернов, которые они видели ранее, включая текстовый ввод пользователя. В некоторых случаях наиболее вероятные следующие слова могут быть неточными с фактической точки зрения.
Повышение фактической точности является важным направлением для OpenAI и многих других разработчиков ИИ, и мы добиваемся успехов. Используя отзывы пользователей о результатах работы ChatGPT, помеченных как неверные, в качестве основного источника данных, мы повысили фактическую точность GPT‑4. Вероятность того, что GPT‑4 создаст фактический контент, на 40% выше по сравнению с GPT‑3.5.
Когда пользователи регистрируются для использования инструмента, мы стремимся быть максимально прозрачными в отношении того, что ChatGPT не всегда может быть точным. Тем не менее, мы понимаем, что предстоит еще очень большая работа по дальнейшему снижению вероятности галлюцинаций и просвещению общественности о текущих ограничениях этих ИИ-инструментов.
Продолжение исследований и взаимодействия
Мы считаем, что практический подход к решению проблем безопасности ИИ заключается в том, чтобы уделять больше времени и ресурсов исследованию эффективных мер защиты и методов согласования, а также их тестированию на предмет реальных злоупотреблений.
Важно отметить, что мы также верим: повышение безопасности и возможностей ИИ должно идти рука об руку. Наши лучшие на сегодняшний день результаты в области безопасности были достигнуты благодаря работе с нашими самыми мощными моделями, поскольку они лучше следуют инструкциям пользователей и ими проще управлять или «направлять» их.
Мы будем действовать все более осторожно при создании и развертывании более мощных моделей и продолжим совершенствовать меры предосторожности по мере эволюции наших систем ИИ.
Хотя мы ждали более 6 месяцев, прежде чем развернуть GPT‑4, чтобы лучше понять его возможности, преимущества и риски, иногда может потребоваться больше времени для повышения безопасности систем ИИ. Поэтому директивным органам и поставщикам ИИ необходимо будет обеспечить эффективное регулирование разработки и развертывания ИИ в глобальном масштабе, чтобы никто не шел на обходные пути ради лидерства. Это сложнейшая задача, требующая как технических, так и институциональных инноваций, но мы рады внести свой вклад в ее решение.
Решение проблем безопасности также требует широких дебатов, экспериментов и взаимодействия, в том числе относительно границ поведения систем ИИ. Мы поощряли и будем продолжать поощрять сотрудничество и открытый диалог между заинтересованными сторонами для создания безопасной экосистемы искусственного интеллекта.
- Узнайте больше о безопасности ИИ
Автор
Полный текст статьи читайте на OpenAI
