Снижение предвзятости и повышение безопасности в DALL·E 2

Сегодня мы внедряем новую технику, благодаря которой DALL·E будет создавать изображения людей, точнее отражающие разнообразие мирового населения.

An abstract oil painting of diverse people gathering, generated by DALL·E 2

Сегодня мы внедряем новую технику, благодаря которой DALL·E будет генерировать изображения людей, точнее отражающие разнообразие мирового населения. Эта техника применяется на системном уровне, когда DALL·E получает запрос с описанием человека, не уточняющим расу или пол, например «пожарный».

По результатам нашей внутренней оценки, после применения этой техники пользователи в 12 раз чаще отмечали, что изображения DALL·E включают людей с разным происхождением. Мы планируем совершенствовать эту технику по мере сбора дополнительных данных и отзывов.

В апреле мы начали предварительное знакомство с исследованием DALL·E 2 для ограниченного числа людей, что позволило нам лучше понять возможности и ограничения системы, а также усовершенствовать наши системы безопасности.

В ходе этой фазы предварительного просмотра первые пользователи указали на чувствительные и предвзятые изображения, что помогло сформировать и оценить это новое средство минимизации рисков.

Мы продолжаем исследовать, каким образом системы искусственного интеллекта, такие как DALL·E, могут отражать предвзятость в обучающих данных, и изучаем различные способы борьбы с этим.

В ходе исследовательского предварительного просмотра мы предприняли и другие шаги по улучшению наших систем безопасности, в том числе:

  • Минимизация риска неправомерного использования DALL·E для создания вводящего в заблуждение контента путем отклонения загружаемых изображений, содержащих реалистичные лица, а также попыток воспроизвести внешность публичных фигур, включая знаменитостей и известных политических деятелей.
  • Повышение точности наших фильтров контента, чтобы они эффективнее блокировали запросы и загружаемые изображения, нарушающие нашу политику в отношении контента, но при этом по-прежнему позволяли проявлять творческий подход.
  • Совершенствование автоматизированных и ручных систем мониторинга для предотвращения злоупотреблений.

Эти улучшения помогли нам обрести уверенность в возможности предоставить доступ к DALL·E большему количеству пользователей.

Расширение доступа — важная часть нашей концепции ответственного развертывания систем искусственного интеллекта, поскольку оно позволяет нам больше узнать об использовании в реальном мире и продолжать совершенствовать наши системы безопасности.

Автор

OpenAI

Полный текст статьи читайте на OpenAI