Наша приверженность безопасности сообщества

Frame-1.png?w=1600&h=900&fit=fill

Массовые расстрелы, угрозы в адрес государственных деятелей, попытки терактов, а также нападения на сообщества и отдельных людей — это неприемлемая и суровая реальность современного мира. Эти инциденты служат напоминанием о том, насколько реальна угроза насилия и как быстро насильственные намерения могут перейти от слов к действиям.

Люди также могут привносить эти моменты и чувства в ChatGPT. Они могут задавать вопросы о новостях, пытаться понять произошедшее, выражать страх или гнев либо рассуждать о насилии в вымышленном, историческом, политическом, личном или потенциально опасном контексте. Мы работаем над тем, чтобы обучить ChatGPT распознавать разницу и проводить чѐткую черту, когда разговор начинает смещаться в сторону угроз, потенциального вреда окружающим или планирования противоправных действий в реальном мире.

Мы рассказываем о том, что делаем для минимизации использования наших сервисов в целях пропаганды насилия или причинения иного вреда: как наши модели обучаются безопасно отвечать на запросы, как наши системы выявляют потенциальный риск причинения вреда и какие меры мы принимаем при нарушении наших правил. Мы постоянно совершенствуем принимаемые нами меры по защите людей и сообществ, опираясь на мнения психологов, психиатров, экспертов по гражданским свободам и правоохранительным органам, а также других специалистов, которые помогают нам принимать сложные решения в области безопасности, конфиденциальности и равного доступа к технологиям.

Как мы снижаем риски причинения вреда в ChatGPT.

В нашей спецификации моделей (Model Spec) изложены наши давние принципы в отношении того, как должны вести себя наши модели: максимизация полезности и свободы пользователей при одновременном снижении риска причинения вреда с помощью разумных настроек по умолчанию.

Мы обучаем наши модели отказывать в предоставлении инструкций, тактик или планов, которые могут существенным образом способствовать совершению насилия. В то же время пользователи могут задавать нейтральные вопросы о насилии в фактологических, исторических, образовательных или профилактических целях, и мы стремимся разрешать подобные обсуждения, сохраняя при этом чѐткие границы безопасности — например, опуская детальные оперативные инструкции, которые могут облегчить причинение вреда. Грань между безопасным и вредоносным использованием может быть едва уловимой, поэтому мы постоянно совершенствуем наш подход и сотрудничаем с экспертами, чтобы научиться отличать безопасные, ограниченные рамками ответы от практических шагов по реализации насилия или причинению иного вреда в реальном мире.

В рамках этой непрерывной работы мы продолжаем расширять наши средства защиты, чтобы помочь ChatGPT лучше распознавать тонкие признаки риска причинения вреда в различных контекстах. Некоторые риски для безопасности становятся очевидными только со временем: отдельное сообщение само по себе может казаться безобидным, но более широкий паттерн в рамках длинного диалога или между разными диалогами может указывать на нечто более тревожное. Опираясь на многолетний опыт работы в области обучения моделей, оценок, тестирования на проникновение (red teaming) и постоянного привлечения экспертов, мы усовершенствовали способность ChatGPT распознавать скрытые предупреждающие знаки в долгих и критически важных диалогах и аккуратно на них реагировать. В ближайшие недели мы поделимся более подробной информацией об этой работе.

Наша работа по обеспечению безопасности также распространяется на ситуации, когда пользователи могут находиться в состоянии психологического кризиса или риска самоповреждения. В такие моменты наша цель заключается не только в том, чтобы не способствовать совершению вредных действий, но и в том, чтобы помочь снизить накал ситуации и направить людей к реальной поддержке. ChatGPT выводит локализованные кризисные ресурсы, призывает пользователей обращаться к специалистам в области психического здоровья или к заслуживающим доверия близким людям, а в наиболее серьезных случаях направляет за экстренной помощью.

Как мы отслеживаем соблюдение наших правил и обеспечиваем их выполнение.

Мы исходим из лучших побуждений наших пользователей, но когда мы обнаруживаем, что кто-то пытается использовать наши инструменты для потенциального планирования или совершения насилия, мы принимаем меры, включая отмену доступа к сервисам OpenAI. Наши Правила использования устанавливают чѐткие требования к приемлемому использованию и предупреждают, что мы можем запретить применение сервиса для угроз, запугивания, домогательств, терроризма или насилия, разработки оружия, противоправной деятельности, уничтожения имущества или систем, а также попыток обойти наши защитные механизмы. Мы относимся к этим правилам со всей серьезностью и прилагаем большие усилия для обеспечения их соблюдения.

Мы используем автоматизированные системы обнаружения для масштабного выявления потенциально тревожной активности. Эти системы анализируют пользовательский контент и поведение с помощью различных инструментов, предназначенных для поиска сигналов, которые могут указывать на нарушения правил или вредоносную деятельность, включая классификаторы, модели рассуждений, технологии сопоставления хэшей, черные списки и другие системы мониторинга.

Когда аккаунт или диалог попадает под подозрение, он оценивается в контексте обученными сотрудниками. Эти специалисты по проверке проходят подготовку по нашим правилам и протоколам и действуют в рамках установленных мер безопасности и конфиденциальности. Это означает, что их доступ к информации пользователей ограничен, осуществляется в защищенных системах и подчиняется требованиям конфиденциальности и защиты данных. Их роль заключается в том, чтобы оценить помеченную активность в контексте, включая содержание взаимодействия, сопутствующий разговор и любые релевантные модели поведения с течением времени. Такой контекстуальный анализ важен, поскольку автоматизированные системы могут фиксировать сигналы потенциальной опасности, не улавливая при этом полностью намерения или нюансы.

Цель состоит в томм, чтобы определить, нарушает ли выявленная активность наши правила и/или указывает ли она на то, что пользователь может совершить акт насилия, требует ли она эскалации для более детальной проверки человеком, либо может быть отклонена или признана низкорисковой и не нарушающей правила. Когда мы устанавливаем факт совершения нарушения, за которое полагается блокировка, мы стремимся немедленно отозвать доступ к сервисам OpenAI. Это может включать в себя отключение аккаунта, блокировку других аккаунтов того же пользователя, а также принятие мер по обнаружению и пресечению создания новых учетных записей. У нас действует политика нулевой терпимости к использованию наших инструментов для содействия совершению насилия. Пользователи могут обжаловать решения о принятии мер принудительного характера, и мы рассматриваем такие апелляции для подтверждения окончательного результата.

Мы предоставляем реальную поддержку и при необходимости обращаемся в правоохранительные органы.

Большинство мер принудительного характера, включая блокировки за насилие, происходят непосредственно между OpenAI и пользователем, четко показывая, что была перейдена черта. Но в некоторых деликатных случаях мы можем связаться с другими организациями, которые имеют наилучшие возможности для оказания помощи.

Если мы оцениваем, что в каком-то деле присутствуют признаки потенциально серьезного вреда в реальном мире, оно передается на рассмотрение для более углубленного расследования, включая оценку общего уровня риска с использованием структурированных критериев. Этот этап предназначен лишь для небольшой части случаев и призван гарантировать, что сценарии с более высоким уровнем риска оцениваются с привлечением дополнительного контекста и экспертных знаний. Когда беседы указывают на неизбежный и достоверный риск причинения вреда окружающим, мы уведомляем правоохранительные органы. Эксперты в области психического здоровья и поведения помогают нам оценивать сложные ситуации, а наши критерии передачи дел являются гибкими, чтобы учитывать тот факт, что пользователь может не обсуждать явно цель, средства и время планируемого насилия в диалоге с ChatGPT, однако при этом может сохраняться потенциальный риск неизбежного и реального насилия.

Прошлой осенью мы представили родительский контроль, чтобы помочь семьям регулировать работу ChatGPT дома. Родительский контроль позволяет родителям связать свой аккаунт с аккаунтом подростка и настроить параметры для обеспечения безопасного и подходящего по возрасту опыта. У родителей нет доступа к перепискам подростков, но в редких случаях, когда наша система и обученные специалисты по проверке обнаруживают возможные признаки острого кризисного состояния, родители могут быть уведомлены — однако только той информацией, которая необходима для обеспечения безопасности их ребенка. Родители автоматически получают уведомления по электронной почте, с помощью SMS, push-уведомлений или всеми тремя способами сразу.

Тесно сотрудничая с экспертами из нашего Совета по благополучию и искусственному интеллекту (Council on Well-Being and AI) и нашей Сети врачей со всего мира (Global Physicians Network), мы также вскоре представим функцию доверенного контакта, которая позволит взрослым пользователям назначить человека, готового получать уведомления, когда им может потребоваться дополнительная поддержка.

Мы учимся, совершенствуемся и корректируем курс.

Мы продолжаем укреплять наши модели, методы обнаружения, процессы проверки и критерии эскалации в ответ на наблюдаемые сценарии использования, возникающие риски, а также мнения внутренних и внешних экспертов. Мы уделяем особое внимание сложным случаям: например, когда неясно, является ли конкретный запрос правомерным или представляет ли он риск вреда; изощренным попыткам обойти защитные механизмы; или когда люди неоднократно пытаются злоупотреблять нашими сервисами. Мы продолжим ставить безопасность на первое место, соблюдая при этом баланс между конфиденциальностью и другими гражданскими свободами, чтобы иметь возможность реагировать на серьезные риски.

Вы можете прочитать подробнее о нашей работе и обязательствах в области безопасности и подписаться на получение обновлений о нашей политике.

  • Усиление ответов ChatGPT в деликатных разговорах
  • Наш подход к определению возраста
  • Обновление спецификации моделей с учетом защиты подростков
  • Представляем функции родительского контроля

Автор

OpenAI

Полный текст статьи читайте на OpenAI