Системная карта Sora

Sora-systems_card_v1.jpg?w=1600&h=900&fi
Читать анонс

Введение

Обзор Sora

Sora — это модель генерации видео от OpenAI, созданная для обработки текстовых, графических и видеовходов с целью создания нового видео в качестве результата. Пользователи могут создавать видео с разрешением до 1080p (продолжительностью до 20 секунд) в различных форматах, генерировать новый контент по текстовому описанию, а также улучшать, ремикшировать и объединять собственные материалы. Пользователи смогут изучать ленты «Избранное» (Featured) и «Недавние» (Recent), в которых демонстрируются творения сообщества и предлагаются идеи для нового творчества. Sora базируется на разработках моделей DALL·E и GPT и призвана предоставить людям расширенные инструменты для повествования и творческого самовыражения. 

Sora представляет собой диффузионную модель, которая генерирует видео, начиная с базового видеоряда, похожего на статический шум, и постепенно преобразуя его путем удаления шума за множество шагов. Предоставляя модели возможность предвидеть сразу множество кадров, мы решили сложную задачу обеспечения стабильности объекта в кадре, даже когда он временно уходит из поля зрения. Подобно моделям GPT, Sora использует архитектуру трансформера, что обеспечивает превосходную масштабируемость производительности. 

В Sora применяется техника повторного описания (recaptioning) из DALL·E 3, которая заключается в генерации высокодетализированных подписей для визуальных обучающих данных. Благодаря этому модель способна более точно следовать текстовым инструкциям пользователя в сгенерированном видео.

Помимо возможности создавать видео исключительно на основе текстовых инструкций, модель способна принимать существующее статическое изображение и генерировать из него видео, анимируя содержимое картинки с высокой точностью и вниманием к мелким деталям. Модель также может взять существующее видео, продлить его или заполнить недостающие кадры⁠. Sora служит основой для моделей, способных понимать реальный мир и моделировать его — эта способность, как мы полагаем, станет важной вехой на пути к достижению общего искусственного интеллекта (AGI).

Возможности Sora также могут порождать новые риски, такие как потенциальная возможность неправомерного использования чужих образов или генерация вводящего в заблуждение или откровенного видеоконтента. Для безопасного внедрения Sora в продукт мы опирались на опыт обеспечения безопасности при развертывании DALL·E в ChatGPT и API, а также на меры безопасности для других продуктов OpenAI, таких как ChatGPT. В этой системной карте описывается итоговый комплекс мер защиты, результаты внешнего тестирования на проникновение (red teaming), оценки и текущие исследования, направленные на дальнейшее совершенствование этих защитных механизмов.

Данные модели

Как описано в нашем техническом отчете1 от февраля 2024 года, Sora вдохновлена крупными языковыми моделями (LLM), которые приобретают универсальные способности благодаря обучению на данных масштаба интернета. Успех парадигмы LLM отчасти обеспечивается использованием токенов, которые изящно объединяют различные модальности текста — код, математику и различные естественные языки. В случае с Sora мы задумались о том, как генеративные модели визуальных данных могут унаследовать подобные преимущества. В то время как у LLM есть текстовые токены, у Sora есть визуальные патчи. Ранее было доказано, что патчи являются эффективным представлением для моделей визуальных данных. Мы выяснили, что патчи представляют собой отлично масштабируемое и эффективное представление для обучения генеративных моделей на разнообразных типах видео и изображений. На высоком уровне мы превращаем видео в патчи, сначала сжимая их в пространство признаков более низкой размерности, а затем декомпозируя полученное представление на пространственно-временные патчи.

Sora обучалась на разнообразных наборах данных, включая смесь общедоступных данных, проприетарных данных, полученных через партнерские отношения, и пользовательских наборов данных, разработанных внутри компании. Они включают в себя:

  • Избранные общедоступные данные, в основном собранные из стандартных для индустрии наборов данных машинного обучения и веб-краулов.
  • Проприетарные данные от партнерских организаций. Мы заключаем партнерские соглашения для получения доступа к непубличным данным. Например, мы сотрудничали с Shutterstock⁠ и Pond5 в области создания и предоставления изображений, сгенерированных с помощью ИИ. Мы также заключаем партнерства для заказа и создания наборов данных, отвечающих нашим потребностям.
  • Человеческие данные: отзывы от инструкторов по ИИ, специалистов по тестированию на проникновение и сотрудников. 

Фильтрация предварительного обучения и предобработка данных

В дополнение к мерам минимизации рисков, реализуемым после этапа предварительного обучения, фильтрация на этапе претренинга обеспечивает дополнительный уровень защиты, который наряду с другими мерами безопасности помогает исключать нежелательный и вредоносный контент из наших наборов данных. Перед началом обучения все датасеты проходят через этот процесс фильтрации, в ходе которого удаляется наиболее откровенный, жестокий или иной чувствительный контент (например, некоторая символика ненависти). Это является продолжением методов, использовавшихся для фильтрации данных, на которых обучались другие наши модели, включая DALL·E 2 и DALL·E 3.

Выявление рисков и подготовка к развертыванию

Мы предприняли масштабные шаги для понимания как потенциального неправомерного использования, так и реальных творческих сценариев применения, чтобы учесть их при разработке Sora и создании мер безопасности. После анонса Sora в феврале 2024 года мы работали с сотнями визуальных художников, дизайнеров и кинорежиссеров из более чем 60 стран, чтобы получить отзывы о том, как сделать модель максимально полезной для творческих профессионалов. Мы также разработали ряд оценок как внутри компании, так и с привлечением внешних специалистов по тестированию на проникновение (red-teamers), чтобы выявлять и оценивать риски, а также итеративно улучшать наши механизмы безопасности и минимизации угроз. 

Наш стек безопасности для Sora опирается на эти выводы, на существующие меры защиты, применяемые в других наших моделях и продуктах (таких как DALL·E и ChatGPT), а также на специализированные механизмы защиты, созданные специально для видеопродукта. Поскольку это мощный инструмент, мы применяем итеративный подход к безопасности, особенно в тех областях, где важен контекст или где мы предвидим новые риски, связанные с видео. Примерами нашего итеративного подхода являются ограничение по возрасту (доступ только для пользователей от 18 лет и старше), ограничение на использование чужих образов и загрузку лиц, а также более консервативные пороги модерации для промптов и загрузки материалов несовершеннолетних на момент запуска. Мы хотим продолжать изучать то, как люди используют Sora, и совершенствовать систему, чтобы наилучшим образом соблюдать баланс безопасности и максимального раскрытия творческого потенциала наших пользователей. 

Внешнее тестирование на проникновение (Red Teaming)

OpenAI сотрудничала с независимыми экспертами по тестированию на проникновение из девяти разных стран для проверки Sora, выявления слабых мест в мерах безопасности и получения отзывов о рисках, связанных с новыми возможностями продукта. Эксперты имели доступ к продукту Sora с различными итерациями средств защиты и разной степенью зрелости системы в период с сентября по декабрь 2024 года, проведя тестирование более чем 15 000 генераций. Эта работа продолжает деятельность начала 2024 года, когда тестировалась модель Sora без средств защиты, предназначенных для продакшена.

Специалисты по red teaming исследовали новые потенциальные риски модели Sora и инструментов продукта, а также тестировали механизмы безопасности по мере их разработки и совершенствования. Эти кампании по тестированию охватывали различные типы нарушающего правила и запрещенного контента (сексуальный и эротический контент, насилие и расчленение, причинение себе вреда, нелегальный контент, дезинформация и фейки и т. д.), состязательные тактики (как в отношении промптов, так и использования инструментов/функций) для обхода средств безопасности, а также способы эксплуатации этих инструментов для постепенного ослабления систем модерации и защитных механизмов. Эксперты также поделились своими впечатлениями о Sora в таких областях, как предвзятость и общая производительность. 

Мы исследовали генерацию видео по текстовому описанию, используя как прямые запросы, так и состязательные тактики промптинга во всех упомянутых выше категориях контента. Функция загрузки медиафайлов тестировалась с использованием широкого спектра изображений и видео, включая изображения публичных личностей, а также разнообразных категорий контента для проверки способности генерировать запрещенный контент. Мы также протестировали различные варианты использования и комбинации инструментов модификации (раскадровки, перезапись, ремикширование и смешивание), чтобы оценить их пригодность для создания запрещенного контента. 

Эксперты по тестированию выделили важные наблюдения как для конкретных видов запрещенного контента, так и для общих состязательных тактик. Например, они обнаружили, что использование текстовых запросов, связанных с медицинскими ситуациями или научно-фантастическими/фэнтезийными сеттингами, снижает эффективность защитных механизмов против генерации эротического и сексуального контента до тех пор, пока не будут созданы дополнительные средства защиты. Тестировщики использовали состязательные тактики для обхода элементов стека безопасности, включая суггестивные (наводящие) промпты и использование метафор для задействования возможностей модели к выводам. Сделав множество попыток, они смогли выявить тенденции в запросах и словах, которые активируют защитные механизмы, и протестировать различные формулировки для обхода отказов. В конечном итоге эксперты отбирали наиболее проблемные результаты генерации, чтобы использовать их в качестве исходных медиаматериалов для дальнейшей работы по созданию запрещенного контента, который невозможно было получить с помощью методов одиночных промптов. Методы взлома (jailbreak) иногда оказывались эффективными для ослабления политик безопасности, что позволило нам также усовершенствовать эту защиту.

Участники тестирования также проверяли загрузку медиафайлов и инструменты Sora (раскадровки, перезапись, ремикширование и смешивание) как с общедоступными изображениями, так и с контентом, созданным с помощью ИИ. Это выявило пробелы в фильтрации входных и выходных данных, которые нужно было устранить до выпуска Sora, и помогло улучшить защиту при загрузке медиафайлов с изображением людей. Тестирование также показало необходимость более строгой классификационной фильтрации для снижения риска превращения разрешенных медиафайлов при модификации в запрещенный эротический контент, сцены насилия или дипфейки.

Отзывы и данные, полученные от тестеров, позволили создать дополнительные уровни защитных мер и усовершенствовать существующие оценки безопасности, которые описаны в разделах «Специфические области риска и меры защиты» (Specific Risk Areas and Mitigations⁠). Эти усилия позволили провести дополнительную настройку фильтрации промптов, черных списков и порогов классификаторов для обеспечения соответствия модели целям безопасности.

Выводы из раннего доступа для художников

За последние девять месяцев мы проанализировали отзывы пользователей по более чем 500 000 запросов к модели от более чем 300 пользователей из более чем 60 стран. Эти данные помогли улучшить поведение модели и ее соответствие протоколам безопасности. Например, отзывы художников помогли нам осознать ограничения, которые видимый водяной знак накладывает на их рабочие процессы. Это привело к решению разрешить платящим пользователям скачивать видеофайлы без видимого водяного знака при сохранении внедренных данных C2PA. 

Эта программа раннего доступа также показала нам, что если Sora задумывается как расширенный инструмент для повествования и творческого самовыражения, нам потребуется предоставить художникам большую гибкость в некоторых чувствительных областях, к которым мы подходили бы иначе в универсальном инструменте вроде ChatGPT. Мы рассчитываем, что художники, независимые кинематографисты, студии и другие организации индустрии развлечений будут использовать Sora как важнейшую часть своих производственных процессов. В то же время выявление как позитивных сценариев использования, так и потенциальных злоупотреблений позволило нам определить сферы, где требуются более строгие меры на уровне продукта для снижения риска причинения вреда или неправомерного применения.

Оценка модели (Evaluations)

Мы разработали внутренние системы оценки, ориентированные на ключевые сферы, включая наготу, вводящий в заблуждение контент о выборах, членовредительство и насилие. Эти тесты были созданы для поддержки доработки мер защиты и определения наших порогов модерации. Система оценки объединяет входные запросы, подаваемые в модель генерации видео, с входными и выходными классификаторами, применяемыми либо к преобразованным промптам, либо к итоговым созданным видео.

Входные запросы для этих оценок поступали из трех основных источников: данных, собранных на этапе ранней альфа-версии (как описано в Разделе 3.2), состязательных примеров от тестировщиков (упомянутых в Разделе 3.1) и синтетических данных, сгенерированных с помощью GPT‑4. Данные альфа-тестирования дали представление о сценариях реального использования, материалы от тестеров помогли обнаружить состязательный и пограничный контент, а синтетические данные позволили расширить наборы для оценки в таких областях, как непреднамеренный откровенный контент, примеры которого в естественных условиях встречаются редко.

Готовность (Preparedness)

Фреймворк оценки готовности предназначен для проверки того, создают ли возможности передовых моделей значительные риски в четырех отслеживаемых категориях: убеждение (persuasion), кибербезопасность, ОМУ (химическое, биологическое, радиологическое и ядерное оружие — CBRN) и автономность моделей. У нас нет доказательств того, что Sora представляет какой-либо значительный риск в отношении кибербезопасности, ОМУ или автономности моделей. Эти риски тесно связаны с моделями, взаимодействующими с компьютерными системами, научными знаниями или принимающими автономные решения, что в настоящее время выходит за рамки возможностей Sora как инструмента генерации видео. 

Возможности Sora по генерации видео могут создавать потенциальные риски убеждения, такие как риски выдачи себя за другое лицо, дезинформации или социальной инженерии. Для устранения этих рисков мы разработали комплекс мер защиты, описанных в разделах ниже. Они включают в себя меры, призванные предотвратить создание изображений и образов известных общественных деятелей. Кроме того, учитывая, что контекст и понимание того, является ли видео реальным или созданным ИИ, могут иметь ключевое значение при оценке его убедительности, мы сосредоточились на создании многоуровневого подхода к определению происхождения контента, включающего метаданные, водяные знаки и цифровую дактилоскопию (fingerprinting).

Стек мер минимизации рисков Sora

В дополнение к конкретным рискам и мерам их минимизации, описанным ниже, решения, принятые при обучении Sora, разработке продукта и формировании политик, помогают в целом снизить риск появления вредного или нежелательного контента. Их можно условно разделить на системные и модельные технические средства защиты, а также продуктовые политики и обучение пользователей.

Системные и модельные меры защиты

Ниже мы подробно описываем основные формы мер безопасности, которые применяются до того, как пользователю будет показан запрошенный результат:

Модерация текста и изображений с помощью мультимодального классификатора модерации

Наш мультимодальный классификатор модерации, лежащий в основе внешнего API модерации, используется для выявления текстовых, графических или видеопромптов, которые могут нарушать наши правила использования (как на входе, так и на выходе). Запросы, в которых система обнаружит нарушения, повлекут за собой отказ в генерации. Узнайте больше о нашем мультимодальном API модерации здесь.2

Кастомная фильтрация на базе LLM

Одним из преимуществ технологии генерации видео является возможность выполнения асинхронных проверок модерации без увеличения задержки для общего пользовательского опыта. Поскольку генерация видео изначально занимает несколько секунд на обработку, это окно времени может быть использовано для запуска высокоточных целевых проверок модерации. Мы настроили нашу собственную модель GPT для достижения высокой точности модерации по ряду конкретных тем, включая выявление материалов третьих лиц, а также вводящего в заблуждение контента. 

Фильтры являются мультимодальными: в контекст каждого вызова LLM включаются как загруженные изображения/видео, так и текстовые промпты и результаты генерации. Это позволяет нам обнаруживать нарушающие правила комбинации текста и изображений. 

Классификаторы вывода изображений

Для борьбы с потенциально вредным контентом непосредственно в результатах Sora использует выходные классификаторы, включая специализированные фильтры для контента для взрослых (NSFW), материалов с участием несовершеннолетних, сцен насилия и возможного неправомерного использования образов людей. Sora может блокировать видео до того, как они будут переданы пользователю, если эти классификаторы срабатывают. 

Черные списки

Мы поддерживаем текстовые черные списки по различным категориям, основанные на нашей предыдущей работе над DALL·E 2 и DALL·E 3, проактивном выявлении рисков и результатах раннего тестирования пользователями.

Продуктовые политики

В дополнение к средствам защиты, встроенным в модель и систему для предотвращения создания нарушающего правила контента, мы также предпринимаем дополнительные шаги по снижению риска злоупотреблений. В настоящее время мы предоставляем доступ к Sora только пользователям в возрасте от 18 лет и применяем фильтры модерации к контенту, отображаемому в лентах «Обзор» (Explore) и «Избранное» (Featured).

Мы также четко доносим правила политики компании с помощью материалов внутри продукта и общедоступных образовательных ресурсов, посвященных следующим темам:

  • использование изображения другого человека без его разрешения, а также запрет на демонстрацию реальных несовершеннолетних;
  • создание незаконного контента или контента, нарушающего права интеллектуальной собственности;
  • генерация откровенного и вредоносного контента, такого как интимные материалы без согласия, контент, используемый для буллинга, травли или клеветы, либо контент, предназначенный для пропаганды насилия, ненависти или страданий других людей; и 
  • создание и распространение контента, используемого для мошенничества, обмана или введения в заблуждение.

Некоторые из этих видов злоупотреблений пресекаются с помощью средств защиты на уровне модели и системы, однако другие носят более контекстуальный характер: сцена протеста может использоваться в законных творческих целях, но та же сцена, преподнесенная как реальное текущее событие, может быть распространена и как дезинформация, если сопровождается определенными утверждениями. 

Sora разработана для того, чтобы дать людям возможность выражать самые разные творческие идеи и взгляды. Предотвращение любой формы контекстуально проблематичного контента является нецелесообразным и невозможным.

Мы предоставляем пользователям возможность пожаловаться на видео в Sora, которые, по их мнению, могут нарушать наши правила, одновременно используя средства автоматизации и ручную проверку для активного мониторинга моделей использования. Мы создали механизмы принудительного исполнения для удаления видео-нарушителей и применения санкций к пользователям. Когда пользователи нарушают наши правила, мы уведомляем их и предоставляем возможность высказать свое мнение о том, что они считают справедливым. Мы намерены отслеживать эффективность этих мер защиты и совершенствовать их со временем.

Конкретные области риска и меры по их снижению

Помимо общих мер безопасности, описанных выше, раннее тестирование и оценка помогли выявить несколько областей, требующих особого внимания к безопасности. 

Безопасность детей

Компания OpenAI твердо намерена решать3проблемы безопасности детей и уделяет первостепенное внимание предотвращению, обнаружению и сообщению о материалах, связанных с сексуальным насилием над детьми (CSAM), во всех наших продуктах, включая Sora. Усилия OpenAI в области обеспечения безопасности детей включают ответственную подготовку наших наборов данных для защиты от CSAM, партнерство с Национальным центром пропавших и эксплуатируемых детей (NCMEC) в целях предотвращения сексуального насилия над детьми и их защиты, ред-тестинг в соответствии с рекомендациями организации Thorn и с соблюдением юридических ограничений, а также надежное сканирование на наличие CSAM во всех входных и выходных данных. Это включает сканирование пользователей как собственной разработки, так и сторонних разработчиков (API и Enterprise), если клиенты не соответствуют строгим критериям для отмены сканирования на CSAM. Для предотвращения генерации CSAM мы создали надежный стек безопасности, используя средства защиты на уровне системы, которые мы применяем в других наших продуктах, таких как ChatGPT и DALL·E4, а также дополнительные рычаги управления, разработанные специально для Sora.

Классификаторы входных данных

Для обеспечения безопасности детей мы используем 3 различных метода фильтрации входных данных для текста, изображений и видео:  

  • Для всех загружаемых изображений и видео мы интегрируемся с инструментом Safer, разработанным компанией Thorn, для обнаружения совпадений с известными материалами CSAM. Подтвержденные совпадения отклоняются и передаются в NCMEC. Кроме того, мы используем классификатор CSAM от компании Thorn для выявления потенциально нового, нехешированного контента CSAM.
  • Мы используем мультимодальный классификатор модерации для обнаружения и модерации любого контента сексуального характера с участием несовершеннолетних, поступающего в виде текста, изображений и видео. 
  • Для Sora мы разработали классификатор, анализирующий текст и изображения, чтобы предсказать, изображен ли на них человек в возрасте до 18 лет или ссылается ли сопутствующая подпись на несовершеннолетнего. Мы отклоняем запросы на преобразование изображения в видео, если они содержат лиц моложе 18 лет. Если в ходе анализа текста для преобразования в видео выясняется, что речь идет о лице моложе 18 лет, мы применяем гораздо более строгие пороги модерации в отношении контента сексуального, насильственного характера или контента, пропагандирующего селфхарм.

Ниже представлена оценка работы нашего классификатора лиц до 18 лет. Мы оцениваем наш классификатор на предмет отклонения реалистичных людей в возрасте до 18 лет на датасете, содержащем около 5000 изображений в категориях [ребенок | взрослый] и [реалистичный | вымышленный]. Наша позиция заключается в том, чтобы отклонять изображения реалистичных детей, разрешая при этом вымышленный контент, включая анимированный стиль, мультфильмы или скетчи, при условии, что он не носит сексуального характера. Мы заняли осторожный подход к контенту с участием несовершеннолетних и будем продолжать оценивать наш подход по мере получения опыта использования продукта, чтобы найти правильный баланс между обеспечением свободы творчества и безопасности. 

В настоящее время наши классификаторы обладают высокой точностью, но они могут иногда по ошибке помечать изображения взрослых или нереалистичные изображения детей. Кроме того, мы признаем, что исследования и существующая литература указывают на потенциальную предрасположенность моделей прогнозирования возраста к расовым предвзятостям. Например, эти модели могут систематически занижать возраст людей из определенных расовых групп.5 Мы стремимся повышать производительность нашего классификатора, минимизировать количество ложноположительных срабатываний и углублять наше понимание потенциальных предвзятостей в ближайшие месяцы.

Ожидаемый результат

n_samples

count (is_child)

count (not_child)

Оцениваемые метрики

Реалистичный ребенок

Классифицировать изображения как «ребенок»

1589

1555

34

Точность (Accuracy): 97.86%

Реалистичный взрослый

Классифицировать изображения как «не ребенок»

1370

36

1334

Точность (Accuracy): 99.28%

Вымышленный взрослый

Классифицировать изображения как «не ребенок»

965

7

958

Точность (Accuracy): 97.37%

Вымышленный ребенок

Классифицировать изображения как «не ребенок»

1050

323

727

Точность (Accuracy): 69.24%

Итого

4974

1921

3053

Precision: 80.95% Recall: 97.86%

Примечание: точность (precision) рассчитывается как процент классификаций is_child, являющихся реалистичными детьми, а полнота (recall) рассчитывается как процент изображений реалистичных детей, классифицированных как is_child

Выходные данные

Как упоминалось выше, после того как наш классификатор лиц до 18 лет обнаруживает во входных текстовых данных упоминание несовершеннолетних, мы применяем строгие пороги модерации выходных данных в отношении контента сексуального характера, насилия или селфхарма. Ниже приведены два классификатора выходных данных, которые мы используем для достижения этой цели:  

  • Мультимодальный классификатор модерации, который сканирует видео на предмет небезопасного контента и отклоняет запросы, которые могут быть особенно чувствительными. 
  • Мы также используем наш существующий классификатор изображений DALL·E для поиска нарушений, связанных с безопасностью детей.

Наши классификаторы выходных данных сканируют 2 кадра в секунду и при определении видео как небезопасного блокируют любые результаты.

В дополнение к нашим классификаторам и автоматической модерации мы задействуем ручную проверку в качестве дополнительного уровня защиты от потенциальных нарушений безопасности детей. 

Политика в отношении продуктов

Наши правила запрещают использование Sora для генерации контента сексуального характера с участием несовершеннолетних. Нарушение правил безопасности детей может привести к удалению контента и блокировке пользователя.

Нагота и контент откровенного характера

Одной из новых областей риска, связанных с возможностями генерации видео с помощью ИИ, является потенциальное создание контента NSFW (Not Safe for Work — нежелательно для работы) или NCII (Non-Consensual Intimate Imagery — интимные изображения без согласия). Аналогично подходу DALL·E, Sora использует многоуровневую стратегию модерации для блокировки откровенного контента. Она включает трансформацию промптов, классификаторы выходных изображений и списки блокировок, которые в совокупности обеспечивают работу системы, ограничивающей контент откровенного характера, особенно для аудитории соответствующего возраста. Пороги для наших классификаторов строже для загружаемых изображений, чем для текстовых промптов. 

Видео, отображаемые в разделе «Обзор», дополнительно фильтруются с использованием более жестких порогов для обеспечения просмотра широкой аудиторией.  

Ниже приведены результаты наших оценок наготы и откровенного контента, направленных на оценку эффективности многоуровневой защиты входных и выходных данных. Основываясь на полученных результатах, мы пересмотрели наши пороговые значения и применили более строгую модерацию к изображениям, загружаемым вместе с людьми.

Категория

Точность* (на входе)

Точность* (на выходе, т.е. сквозная)

Нагота и контент откровенного характера

97.25%

97.59%

Пояснение к оценке:

N = общее количество образцов-нарушителей (~200 на категорию)
I = общее количество образцов-нарушителей, прошедших проверки модерации на входе
O = общее количество образцов-нарушителей, прошедших проверки модерации на выходе

Точность на входе =
(N — I) / N
Точность на выходе (сквозная) = (N — O) / N 

Политика в отношении продуктов

Наши правила запрещают использование Sora для генерации откровенного контента сексуального характера, включая интимные материалы без согласия. Нарушение этих правил может привести к удалению контента и применению санкций к пользователю.

Вводящий в заблуждение контент

Злоупотребление чужим образом и опасные дипфейки

Монитор модерации Sora для промптов, использующих чужие образы, предназначен для выявления потенциально опасного дипфейк-контента с тем расчетом, что видео с участием узнаваемых лиц будут тщательно проверяться. Фильтр злоупотребления образами дополнительно отсеивает промпты, которые пытаются изменить людей или изобразить их потенциально опасным или вводящим в заблуждение образом. Общие преобразования промптов в Sora дополнительно снижают риск того, что модель сгенерирует нежелательный образ частного лица на основе промпта, содержащего чье-либо имя.

Вводящий в заблуждение контент

Классификаторы входных и выходных данных Sora призваны предотвращать создание вводящего в заблуждение контента, связанного с выборами, который описывает мошенническую, неэтичную или иную незаконную деятельность. Метрики оценки Sora включают классификаторы для выявления стилей или методов фильтрации, которые могут создавать вводящие в заблуждение видео в контексте выборов, тем самым снижая риск злоупотреблений в реальном мире.

Ниже приведены результаты оценок нашего LLM-фильтра вводящего в заблуждение предвыборного контента, нацеленного на помощь в выявлении случаев, когда может присутствовать умысел на создание запрещенного контента в различных типах входных данных (например, текст и видео). Наша система также сканирует 1 кадр в секунду выходного видео для оценки возможных нарушений.

Классификатор

Полнота (Recall)

Точность (Precision)

Результат при срабатывании

Вводящий в заблуждение предвыборный контент

98.23%

88.80%

Блокировка генерации контента

 N=~500, на основе промптов с синтетическими данными

Инвестиции в обеспечение происхождения контента

Учитывая, что многие риски, связанные с Sora, такие как вредоносный контент дипфейков, сильно зависят от контекста, мы уделили первоочередное внимание совершенствованию наших инструментов установления происхождения (провенанса). Мы признаем, что не существует единого решения для определения происхождения контента, но стремимся улучшать экосистему провенанса и помогать выстраивать контекст и прозрачность для контента, созданного с помощью Sora. 

Для общего доступа наши инструменты безопасности происхождения будут включать:

  • Метаданные C2PA для всех ресурсов (проверяемое происхождение, отраслевой стандарт)
  • Анимированные видимые водяные знаки Sora по умолчанию (для понимания зрителями, что это ИИ)
  • Внутренний инструмент обратного поиска видео, помогающий членам команды OpenAI по разведке и расследованиям с высокой степенью уверенности оценивать, создан ли контент с помощью Sora. 

Политика в отношении продуктов

Наши правила запрещают использовать Sora для мошенничества, обмана или введения других лиц в заблуждение, в том числе путем создания и распространения дезинформации. Они также запрещают использование чужого образа без разрешения. Нарушение этих правил может привести к удалению контента и применению санкций к пользователю.

Художественные стили

Когда пользователь использует в запросе имя живого художника, модель может сгенерировать видео, в котором некоторым образом воспроизводится стиль работ этого автора. В сфере творчества существует давняя традиция опираться на стили других художников, однако мы понимаем, что у некоторых авторов могут возникнуть вопросы. Мы решили занять консервативный подход в отношении этой версии Sora по мере того, как мы изучаем, как именно модель используется творческим сообществом. Чтобы решить эту задачу, мы добавили автоматическое переписывание запросов, которое срабатывает, когда пользователь пытается сгенерировать видео в стиле живущего художника. 

Подобно нашим другим продуктам, редактор Sora использует языковую модель (LLM) для переработки отправленного текста с целью более эффективного составления запросов для Sora. Этот процесс способствует соблюдению наших правил, включая удаление имен публичных личностей, привязку людей к конкретным характеристикам и описание брендированных объектов в общем виде. Мы поддерживаем текстовые списки заблокированных тем в различных категориях, опираясь на нашу предыдущую работу над DALL·E 2 и DALL·E 3, проактивное выявление рисков, а также на результаты тестирования группами «красных команд» (red teamers) и первыми пользователями. 

Дальнейшая работа

OpenAI применяет стратегию итеративного развертывания, чтобы обеспечить ответственный и эффективный выпуск своих продуктов. Этот подход объединяет поэтапный запуск, регулярное тестирование и непрерывный мониторинг с учетом отзывов пользователей и реальных данных, что позволяет со временем совершенствовать нашу работу и повышать уровень безопасности. Ниже представлен перечень задач, которые мы планируем выполнить в рамках итеративного развертывания Sora.

Пилотный проект по работе с изображениями лиц и сходством

Возможность генерировать видео с использованием загруженной фотографии или видео реального человека в качестве «основы» (seed) представляет собой потенциальный вектор злоупотреблений, к которому мы подходим с особой осторожностью, чтобы изучать паттерны раннего использования. Первые отзывы художников показывают, что это мощный творческий инструмент, который они ценят, однако, учитывая потенциал для злоупотреблений, мы пока не делаем его доступным для всех пользователей. Вместо этого, в соответствии с нашей практикой итеративного развертывания, возможность загружать изображения или видео людей будет предоставлена ограниченному кругу пользователей, и мы организуем активный, углубленный мониторинг, чтобы оценить пользу этой функции для сообщества Sora и корректировать наш подход к безопасности по мере накопления опыта. Загрузка изображений несовершеннолетних в ходе этого тестирования не разрешена.

Инициативы по установлению происхождения контента и обеспечению прозрачности

Будущие итерации Sora продолжат укреплять возможности отслеживания происхождения за счет исследований в области инструментов обратного поиска вложений (reverse embedding search) и дальнейшего внедрения мер прозрачности, таких как C2PA. Мы с энтузиазмом рассматриваем потенциальное партнерство с НПО и исследовательскими организациями с целью развития и улучшения экосистемы подтверждения происхождения контента, а также тестирования нашего внутреннего инструмента обратного поиска изображений для Sora.

Расширение инклюзивности и репрезентативности в результатах генерации

Мы стремимся сократить потенциальные предвзятости и смещения в генерируемом контенте с помощью улучшения промптов, циклов обратной связи и постоянного выявления эффективных средств защиты, понимая при этом, что избыточные исправления могут быть столь же вредными. Мы признаем такие проблемы, как предвзятость в отношении особенностей телосложения и демографическая репрезентативность, и продолжим совершенствовать наш подход для обеспечения сбалансированных и инклюзивных результатов.

Непрерывное обеспечение безопасности, политики и этического соответствия

OpenAI планирует продолжать регулярную оценку Sora и работу по дальнейшему повышению соответствия модели политикам и стандартам безопасности OpenAI. Планируются дополнительные улучшения в таких областях, как безопасность внешности и предотвращение создания вводящего в заблуждение контента, с опорой на развивающиеся передовые практики и отзывы пользователей.

Выражение признательности

Большое спасибо всем внутренним командам OpenAI, включая отделы коммуникаций (Comms), дизайна коммуникаций, глобальных связей (Global Affairs), обеспечения честности и добросовестности, аналитики и расследований (Intel & Investigations), юридический отдел, отдел разработки продуктовой политики, систем безопасности и операционной работы с пользователями (User Ops), чья поддержка сыграла важнейшую роль в разработке и внедрении мер безопасности для Sora, а также в создании этого системного отчета (system card).

Мы выражаем признательность нашей группе художников альфа-тестировщиков и нашим экспертам из «красных команд», которые делились отзывами, помогали тестировать наши модели на ранних этапах разработки и внесли свой вклад в оценку рисков и проведение экспертиз. Участие в процессе тестирования не означает одобрения планов развертывания OpenAI или политик компании.

  • Участники тестирования на проникновение (в алфавитном порядке): Александра Гарсия Перес, Арджун Сингх Пури, Кэролайн Фридман Леви, Дани Мадрид-Моралес, Эмили Линелл Эдвардс, Грант Брейлсфорд, Герман Вассерман, Хавьер Гарсия Арредондо, Кейт Турецки, Келли Бер, Мэтт Гроу, Максимилиан Мюллер, Наоми Харт, Натан Хит, Патрик Коги, Пер Викман Сван, Рафаэль Гонсалес-Васкес, Сара Кингсли, Шелби Гроссман, Винсент Нестлер
  • Организации, участвовавшие в тестировании: ScaleAI

Авторы

OpenAI

Ссылки

  1. 1

    OpenAI. Модели генерации видео как симуляторы мира.

  2. 2

    OpenAI. (б. д.). Обновление API модерации с помощью нашей новой мультимодальной модели модерации. 2024

  3. 3

    OpenAI. (б. д.). Безопасность детей: внедрение принципов SBD. OpenAI. Дата обращения: 6 декабря 2024 г.

  4. 4

    OpenAI. Системный отчет DALL·E 3. 2023.

  5. 5

    Panić, N., Marjanović, M., & Bezdan, T. (2024). Устранение демографической предвзятости в моделях оценки возраста за счет оптимизированного состава набора данных. Mathematics, 12(15), 2358.

Полный текст статьи читайте на OpenAI