Понимание происхождения того, что мы видим и слышим в интернете
Мы представляем новые инструменты, помогающие исследователям изучать подлинность контента, и присоединяемся к Руководящему комитету Коалиции за происхождение и подлинность контента (C2PA).
В этой публикации изложен наш подход к определению происхождения контента в 2024 году.
Для ознакомления с нашей последней работой:
Воспользуйтесь нашим общедоступным инструментом верификации
Узнайте о наших достижениях в области происхождения контента
Обновление от 4 августа 2024 г.
Делимся некоторыми новостями о нашей продолжающейся работе по определению происхождения контента с момента публикации этой статьи в блоге в мае:
Исследование текстовых решений
- Наши команды отдали приоритет запуск решений для определения происхождения аудиовизуального контента, который общепризнано представляет более высокие уровни риска на текущем этапе возможностей наших моделей.
- Мы также провели обширные исследования в области происхождения текста и изучили ряд решений, включая классификаторы, водяные знаки и метаданные. Вы можете подробнее прочитать об этих усилиях в этом тематическом исследовании, проведенном нами совместно с Партнерством по искусственному интеллекту (Partnership on AI).
- Несколько обновлений о некоторых подходах, которые мы в настоящее время исследуем и рассматриваем:
- Текстовые водяные знаки
- Наши команды разработали метод текстовых водяных знаков, который мы продолжаем рассматривать при поиске альтернатив.
- Хотя этот метод показал высокую точность и даже эффективность против локальных манипуляций, таких как перефразирование, он менее устойчив к глобальным манипуляциям, например, использованию систем перевода, переписыванию с помощью другой генеративной модели или запросу к модели вставить специальный символ между каждым словом с последующим его удалением — что делает обход защиты тривиальной задачей для злоумышленников.
- Еще один важный риск, который мы оцениваем, заключается в том, что наши исследования показывают потенциал метода текстовых водяных знаков оказывать непропорциональное влияние на определенные группы. Например, он может стигматизировать использование ИИ в качестве полезного инструмента письма для лиц, для которых английский язык не является родным.
- Текстовые метаданные
- Наши команды также исследуют, как метаданные могут использоваться в качестве метода определения происхождения текста.
- Мы все еще находимся на ранних этапах изучения, поэтому пока рано оценивать эффективность этого подхода, однако у метаданных есть характеристики, которые делают этот подход особенно перспективным.
- Например, в отличие от водяных знаков, метаданные криптографически подписаны, что означает отсутствие ложноположительных результатов. Мы ожидаем, что это будет приобретать все большее значение по мере роста объема генерируемого текста. Хотя текстовые водяные знаки имеют низкий уровень ложноположительных срабатываний, их применение к большим объемам текста приведет к большому общему количеству ложных тревог.
- Текстовые водяные знаки
Расширение инструментов обнаружения изображений по мере создания новых функций
- В рамках наших постоянных усилий по определению происхождения контента мы работаем над включением метаданных C2PA — широко используемого стандарта для цифрового контента — по мере обновления функций в наших продуктах. Поскольку пользователи теперь могут редактировать изображения, созданные DALL-E 3, в ChatGPT, мы хотели убедиться, что информация о происхождении продолжает отображаться вместе с этими изменениями. Если пользователь редактирует изображение, мы заложили механизм, позволяющий нашим учетным данным C2PA показывать, что изображение было отредактировано и каким именно образом.
- На примере изображения вы можете видеть оригинальную картинку гусеницы, созданную ИИ, а затем отредактированную так, чтобы гусеница была в новогодней шапке Санты. Когда пользователь редактирует это изображение, учетные данные C2PA обновляются, отражая эти изменения, что обеспечивает прозрачность. Учетные данные C2PA включают в себя такие детали, как использованное приложение и инструмент (DALL-E от OpenAI), выполненные действия (например, конвертация формата и правки) и другие модификации. Таким образом, вся история изображения отслеживается и отображается.

Люди по всему миру активно используют генеративный ИИ для создания и редактирования изображений, видео и аудио способами, которые колоссально повышают творческий потенциал, производительность и возможности обучения. По мере того как сгенерированный аудиовизуальный контент становится все более распространенным, мы считаем крайне важным для общества в целом принять новые технологии и стандарты, которые помогают людям понимать инструменты, использованные для создания обнаруженного ими в интернете контента.
В OpenAI мы решаем эту задачу двумя способами: во-первых, объединяя усилия с другими игроками для внедрения, разработки и продвижения открытого стандарта, который помогает людям проверять инструменты, использовавшиеся для создания или редактирования различных видов цифрового контента, а во-вторых, создавая новые технологии, которые целенаправленно помогают людям идентифицировать контент, созданный нашими собственными инструментами.
Вклад в стандарты подлинности
Миру необходимы общие способы обмена информацией о том, как был создан цифровой контент. Стандарты могут помочь прояснить, как был создан контент, и предоставить другую информацию о его происхождении в легко распознаваемом в различных ситуациях виде — будь то исходный материал с камеры или художественное произведение, созданное с помощью такого инструмента, как DALL·E 3.
Сегодня OpenAI присоединяется к Руководящему комитету C2PA — Коалиции за происхождение и подлинность контента. C2PA — это широко используемый стандарт сертификации цифрового контента, разработанный и принятый широким кругом участников, включая софтверные компании, производителей камер и онлайн-платформы. Стандарт C2PA может использоваться для доказательства того, что контент поступает из определенного источника.
Ранее в этом году мы начали добавлять метаданные C2PA ко всем изображениям, созданным и отредактированным с помощью DALL·E 3 — нашей новейшей модели генерации изображений — в ChatGPT и OpenAI API. Мы также интегрируем метаданные C2PA для Sora, нашей модели генерации видео, после ее широкого запуска.

Люди по-прежнему могут создавать обманчивый контент без этой информации (или удалять ее), но подделать или изменить ее непросто, что делает ее важным ресурсом для укрепления доверия. По мере роста популярности стандарта эта информация сможет сопровождать контент на протяжении всего его жизненного цикла, включающего совместное использование, модификацию и повторное использование. Мы верим, что со временем метаданные такого рода станут привычным стандартом ожидания для пользователей, заполнив важнейший пробел в практике обеспечения подлинности цифрового контента.
Чтобы стимулировать внедрение и понимание стандартов происхождения контента, включая C2PA, мы вместе с Microsoft объявляем о создании фонда социальной устойчивости. Этот фонд объемом 2 миллиона долларов поддержит образование и понимание вопросов, связанных с ИИ, в том числе через такие организации, как Older AdultsTechnology Services from AARP, International IDEA и Partnership on AI.
Что мы создаем: новые инструменты для идентификации контента, созданного нашими сервисами
В дополнение к инвестициям в C2PA компания OpenAI также разрабатывает новые методы установления происхождения для повышения целостности цифрового контента. Это включает в себя внедрение устойчивых к взлому водяных знаков — маркировку цифрового контента, такого как аудио, невидимым сигналом, который сложно удалить, —, а также классификаторов обнаружения, то есть инструментов на основе искусственного интеллекта для оценки вероятности того, что контент создан генеративными моделями. Эти инструменты призваны быть более устойчивыми к попыткам удалить сигналы о происхождении контента.
Начиная с сегодняшнего дня мы открываем прием заявок на получение доступа к классификатору обнаружения изображений OpenAI для нашей первой группы тестеров — включая исследовательские лаборатории и ориентированные на исследования некоммерческие журналистские организации — для сбора отзывов через нашу программу исследовательского доступа (Researcher Access Program). Этот инструмент прогнозирует вероятность того, что изображение было сгенерировано с помощью DALL·E 3 от OpenAI. Наша цель — дать возможность проводить независимые исследования, оценивающие эффективность классификатора, анализирующие его применение в реальных условиях, выявляющие важные нюансы такого использования и изучающие характеристики контента, созданного ИИ. Заявки на получение доступа можно подать здесь.
Понимание того, когда и где классификатор может работать недостаточно эффективно, имеет решающее значение для тех, кто принимает решения на основе его результатов. Внутреннее тестирование ранней версии нашего классификатора показало высокую точность в различении изображений, не созданных с помощью ИИ, и картинок, созданных продуктами DALL·E 3. Классификатор корректно идентифицирует изображения, созданные DALL·E 3, и не срабатывает на изображения, созданные без участия ИИ. Он правильно распознал около ~98% изображений DALL·E 3, при этом менее ~0,5% изображений, созданных без помощи ИИ, были ошибочно отмечены как созданные DALL·E 3. Классификатор справляется с распространенными модификациями, такими как сжатие, кадрирование и изменение насыщенности, с минимальным влиянием на производительность. Однако другие изменения могут снизить эффективность. Мы также обнаружили, что эффективность классификатора при различении изображений, созданных DALL·E 3, и изображений, созданных другими моделями ИИ, ниже: в настоящее время классификатор ошибочно маркирует около 5–10% изображений, созданных другими моделями ИИ на нашем внутреннем наборе данных.

Кроме того, мы внедрили водяные знаки для аудио в Voice Engine — нашу настраиваемую модель голоса, которая в настоящее время доступна в режиме ограниченного ознакомительного предварительного просмотра. Мы по-прежнему привержены продолжению исследований в этих областях, чтобы наши достижения в области аудиотехнологий оставались столь же прозрачными и безопасными.
Что дальше в сфере аутентификации контента
Хотя подобные технические решения предоставляют нам активные инструменты для защиты, практическое обеспечение подлинности контента потребует совместных действий. Например, платформам, создателям контента и промежуточным операторам необходимо содействовать сохранению метаданных, чтобы конечный потребитель контента имел прозрачную информацию о его источнике.
Наши усилия в области определения происхождения контента — это лишь часть более масштабной работы всей отрасли: многие из наших партнерских исследовательских лабораторий и компаний, занимающихся генеративным ИИ, также продвигают исследования в этой области. Мы приветствуем эти начинания — индустрия должна сотрудничать и делиться знаниями, чтобы улучшать наше понимание и продолжать способствовать прозрачности в интернете.
Авторы
Сноски
Полный текст статьи читайте на OpenAI
