OpenAI и журналистика

Мы поддерживаем журналистику, сотрудничаем с новостными организациями и считаем судебный иск The New York Times необоснованным.

OpenAI and Journalism

Иллюстрация: Джастин Джей Ван (Justin Jay Wang) × DALL·E

Наша цель — разрабатывать инструменты на базе ИИ, которые расширяют возможности людей в решении задач, ранее казавшихся недоступными. Люди по всему миру уже используют нашу технологию, чтобы улучшить свою повседневную жизнь. Сегодня на основе наших продуктов создают решения миллионы разработчиков и более 92% компаний из списка Fortune 500.

Хотя мы не согласны с претензиями, изложенными в иске The New York Times, мы рассматриваем его как возможность внести ясность в наш бизнес, наши намерения и принципы создания наших технологий. Нашу позицию можно свести к следующим четырем пунктам, которые мы подробно раскрываем ниже:

  1. Мы сотрудничаем с новостными организациями и создаем новые возможности
  2. Обучение моделей подпадает под концепцию добросовестного использования (fair use), но мы предоставляем возможность отказаться от него, так как это правильный шаг
  3. «Регургитация» (выдача заученного текста) — это редкая ошибка, над устранением которой мы активно работаем
  4. The New York Times представляет ситуацию не полностью

1. Мы сотрудничаем с новостными организациями и создаем новые возможности

Мы прилагаем большие усилия при проектировании наших технологий, чтобы оказывать поддержку новостным организациям. Мы провели встречи с десятками изданий, а также с ведущими отраслевыми организациями, такими как Альянс новостных средств массовой информации (News/Media Alliance), чтобы изучить возможности, обсудить их озабоченности и предложить решения. Наша цель — учиться, просвещать, прислушиваться к отзывам и адаптироваться.

Наши цели заключаются в поддержке здоровой новостной экосистемы, выстраивании партнерских отношений и создании взаимовыгодных возможностей. Учитывая это, мы заключили партнерства с новостными организациями для достижения следующих целей:

  1. Внедрение наших продуктов для помощи репортерам и редакторам в выполнении трудоемких задач, таких как анализ объемных публичных архивов и перевод материалов.
  2. Обучение наших моделей ИИ пониманию окружающего мира с использованием дополнительных исторических и не общедоступных материалов.
  3. Отображение актуального контента со ссылками на источники в ChatGPT, что открывает для новостных изданий новые пути взаимодействия с читателями.

Наши первые партнерские соглашения с Associated Press, Axel Springer, Американским проектом журналистики (American Journalism Project) и Нью-Йоркским университетом (NYU) дают представление о нашем подходе.

2. Обучение моделей подпадает под концепцию добросовестного использования (fair use), но мы предоставляем возможность отказаться от него, так как это правильный шаг

Обучение моделей ИИ с использованием общедоступных материалов из интернета является добросовестным использованием (fair use), что подтверждается давними и широко признанными прецедентами. Мы считаем этот принцип справедливым по отношению к создателям контента, необходимым для инноваторов и критически важным для конкурентоспособности США.

Принцип того, что обучение моделей ИИ разрешено в рамках добросовестного использования, поддерживается широким кругом ученых, библиотечных ассоциаций, организацийгражданскогообщества, стартапов, ведущихамериканскихкомпаний, авторов, писателей и других лиц, которые недавно направили свои комментарии в Ведомство по авторскому праву США. Другие регионы и страны, включая Европейский Союз, Японию-, Article%2047%2D5,-(1)%E3%80%80A%20person), Сингапур и Израиль, также имеют законы, разрешающие обучение моделей на защищенном авторским правом контенте — что дает преимущество для инноваций, развития и инвестиций в сфере ИИ.

При этом соблюдение юридических прав для нас менее важно, чем проявление социальной ответственности. Мы первыми в индустрии ИИ внедрили простой процесс отказа для издателей (который The New York Times внедрила в августе 2023 года), позволяющий заблокировать доступ наших инструментов к их сайтам.

3. «Регургитация» — это редкая ошибка, над устранением которой мы активно работаем

Наши модели спроектированы и обучены изучению концепций с целью их применения к новым задачам.

Запоминание наизусть (меморизация) — это редкий сбой в процессе обучения, над устранением которого мы постоянно работаем. Однако оно встречается чаще, когда определенный контент встречается в обучающих данных более одного раза — например, если его фрагменты размещены на множестве различных публичных сайтов. Поэтому у нас предусмотрены меры для ограничения непреднамеренного запоминания и предотвращения выдачи точных копий (регургитации) в результатах работы моделей. Мы также ожидаем от наших пользователей ответственного поведения: намеренное манипулирование нашими моделями с целью заставить их воспроизводить заученный текст не является надлежащим использованием нашей технологии и противоречит нашим условиям использования.

Подобно тому как люди получают широкое образование для решения новых задач, мы хотим, чтобы наши модели ИИ изучали весь спектр мировой информации на всех языках, во всех культурах и отраслях. Поскольку модели учатся на огромном массиве человеческих знаний, любой отдельный сектор — включая новости — составляет лишь крошечную долю общих обучающих данных, а любой единственный источник, включая The New York Times, не играет существенной роли для обучения модели.

4. The New York Times представляет ситуацию не полностью

Наши переговоры с The New York Times, судя по последнему общению 19 декабря, продвигались конструктивно. Переговоры были сосредоточены на ценном партнерстве в области отображения контента в реальном времени со ссылками на источники в ChatGPT, благодаря которому The New York Times получила бы новый способ связи со своей аудиторией (как существующей, так и новой), а наши пользователи — доступ к их материалам. Мы объяснили The New York Times, что, как и любой единичный источник, их контент не вносит существенного вклада в обучение наших существующих моделей и не будет иметь решающего значения для будущего обучения. Поданный ими 27 декабря иск — о котором мы узнали из новостей самой The New York Times — стал для нас неожиданностью и разочарованием.

В ходе общения они упоминали случаи выдачи моделью их текстов, но неоднократно отказывались предоставить какие-либо примеры, несмотря на нашу готовность расследовать и исправить любые проблемы. Мы неоднократно демонстрировали, насколько серьезно относимся к этому приоритету — например, в июле мы отключили функцию ChatGPT сразу же, как узнали, что она может воспроизводить контент в реальном времени нежелательным образом.

Интересно, что случаи регургитации, спровоцированные The New York Times, судя по всему, связаны со старыми статьями многолетней давности, которые распространились на множествестороннихвеб-сайтах. Похоже, они намеренно манипулировали промптами, часто включая в них длинные выдержки из статей, чтобы заставить нашу модель выдать заученный текст. Даже при использовании таких промптов наши модели обычно не ведут себя так, как это преподносит The New York Times, что намекает либо на прямое инструктирование модели воспроизвести текст, либо на целенаправленный отбор нужных примеров из множества попыток.

Несмотря на их заявления, подобное нецелевое использование не является типичным или разрешенным поведением пользователя и не может заменить материалы The New York Times. Тем не менее, мы постоянно делаем наши системы более устойчивыми к состязательным атакам, нацеленным на извлечение обучающих данных, и уже добились значительного прогресса в наших последних моделях.

Мы считаем иск The New York Times необоснованным. Тем не менее, мы надеемся на конструктивное партнерство с The New York Times и уважаем ее долгую историю, в том числе то, что более 60 лет назад издание сообщило о создании первой работающей нейросети, а также его борьбу за свободы, гарантированные Первой поправкой.

Мы с нетерпением ждем продолжения сотрудничества с новостными организациями, помогая им расширять возможности создания качественной журналистики за счет реализации преобразующего потенциала ИИ.

Автор

OpenAI

Полный текст статьи читайте на OpenAI