Наш подход к работе с данными и искусственным интеллектом

Искусственный интеллект должен расширять возможности каждого. Преобразуя информацию новыми способами, системы ИИ помогают нам решать задачи и выражать себя. Сегодня наши инструменты искусственного интеллекта, такие как ChatGPT, используются по всему миру, помогая фермерам в Кении и Индии увеличивать урожайность (Digital Green), исследователям — ускорять разработку лекарств (Moderna), правительствам — поддерживать своих сотрудников (Штат Пенсильвания), преподавателям — совершенствовать процесс обучения студентов, а людям с нарушениями зрения — ориентироваться в нашем мире (Be My Eyes). Такие инструменты ИИ, как DALL·E и Sora (в настоящее время в режиме ознакомительного исследования), расширяют возможности творческих людей — от начинающих художников до кинематографистов.
Наша миссия — приносить пользу всему человечеству. Это касается не только наших пользователей, но также создателей контента и издателей. Хотя мы убеждены, что юридические прецеденты и разумная государственная политика делают обучение моделей добросовестным использованием (fair use), мы также считаем важным внести свой вклад в разработку взаимовыгодного общественного договора для контента в эпоху искусственного интеллекта.
Мы уверены, что системы ИИ должны приносить пользу создателям и владельцам контента, а также уважать их выбор. Мы постоянно совершенствуем наши ведущие в отрасли системы, чтобы учитывать предпочтения владельцев контента, и стремимся создавать продукты и бизнес-модели, которые способствуют процветанию экосистем для авторов и издателей.
Мы не являемся профессиональными писателями, художниками или журналистами и не ведем такую деятельность. Мы сосредоточены на создании инструментов, которые помогают представителям этих профессий творить и достигать большего. Для этого мы прислушиваемся к членам этих сообществ, тесно сотрудничаем с ними и рассчитываем на продолжение диалога. Сегодня мы подробнее расскажем о том, где мы находимся и к чему стремимся.
Мы уважаем выбор создателей и владельцев контента в отношении ИИ
Десятилетия назад был представлен стандарт robots.txt, который был добровольно принят интернет-экосистемой. Он позволяет веб-издателям указывать, к каким частям сайтов веб-краулеры имеют доступ.
Прошлым летом OpenAI первой внедрила использование разрешений для веб-краулеров в сфере ИИ, позволив веб-издателям выражать свое отношение к использованию их контента в искусственном интеллекте. Мы учитываем эти сигналы каждый раз при обучении новой модели.
Тем не менее, мы понимаем, что эти решения не являются исчерпывающими, поскольку многие авторы не контролируют сайты, на которых может появляться их контент, а сам контент часто цитируют, рецензируют, ремикшируют, репостят и используют в качестве источника вдохновения в различных доменах. Нам необходимо эффективное, масштабируемое решение, которое позволит владельцам контента выражать свои предпочтения относительно использования их работ в системах ИИ.
Мы разрабатываем Media Manager, чтобы владельцы контента могли управлять использованием своих работ в ИИ
OpenAI разрабатывает Media Manager — инструмент, который позволит создателям и владельцам контента заявлять о своих правах и указывать, как именно их работы должны или не должны использоваться в исследованиях и обучении в области машинного обучения. Со временем мы планируем внедрить дополнительные функции и возможности выбора.
Для этого потребуется передовые исследования в области машинного обучения, чтобы создать первый в своем роде инструмент, способный идентифицировать защищенные авторским правом текст, изображения, аудио и видео из различных источников и учитывать предпочтения авторов.
В процессе разработки Media Manager мы сотрудничаем с авторами, владельцами контента и регулирующими органами. Наша цель — запустить этот инструмент к 2025 году, и мы надеемся, что он станет стандартом во всей индустрии ИИ.
Мы создаем продукты на благо пользователей, авторов и издателей в рамках процветающей экосистемы
Сегодня мы живем в экономике внимания, ориентированной на рекламодателей в ущерб пользователям, и на количество в ущерб качеству. Наша цель — использовать ИИ, чтобы изменить это: расширить возможности авторов и издателей и улучшить пользовательский опыт.
Мы постоянно делаем наши продукты более полезными поисковыми механизмами. Недавно мы улучшили ссылки на источники в ChatGPT, чтобы предоставить пользователям лучший контекст, а веб-издателям — новые возможности для связи с нашей аудиторией.
Мы также сотрудничаем с партнерами, чтобы отображать их контент в наших продуктах и укреплять их связь с читателями. Мы объявили о партнерстве с ведущими мировыми новостными изданиями, такими как Financial Times, Le Monde, Prisa Media, Axel Springer и другими, чтобы показывать их контент в ChatGPT и обогащать читательский опыт по новостным темам. Впереди нас ждет еще больше инноваций. Этот контент также может использоваться для обучения ChatGPT с целью более эффективного предоставления пользователям релевантных материалов издателей и совершенствования наших инструментов для редакций.
Наши партнерские отношения созданы для того, чтобы приносить пользу партнерам и их пользователям, делая наши модели более полезными для их сотрудников, клиентов и сообществ. Чтобы помочь в развитии образовательных ресурсов, мы объединили усилия с некоммерческими организациями Khan Academy и британской ExamSolutions, чтобы улучшить математические возможности нашей модели, что ускоряет их способность расширять доступ к персонализированному обучению с помощью ИИ на их платформе.
Понимание наших базовых моделей и принципов их создания
Мы проектируем наши модели ИИ как обучающиеся машины, а не как базы данных
Модели ИИ учатся на взаимосвязях в информации для создания чего-то нового; они не хранят данные подобно базам данных. Когда мы обучаем языковые модели, мы берем триллионы слов и просим компьютер составить уравнение, которое наилучшим образом описывает связь между словами и лежащий в их основе процесс. После завершения процесса обучения модель ИИ не сохраняет доступ к данным, проанализированным в ходе обучения. ChatGPT похож на преподавателя, который накопил знания в результате долгой учебы и может объяснять материал, потому что усвоил связи между концепциями, но не хранит сами учебники в своей голове.
Наши модели созданы для того, чтобы помогать нам генерировать новый контент и идеи, а не повторять или «воспроизводить» чужие материалы. Модели ИИ могут констатировать факты, находящиеся в общественном достоянии. Если в редких случаях модель непреднамеренно повторяет выразительный контент, это является сбоем в процессе машинного обучения. Такой сбой с большей вероятностью происходит с контентом, который часто встречается в обучающих наборах данных — например, с материалами, размещенными на множестве различных публичных сайтов из-за частого цитирования. Мы используем передовые методы на протяжении всего процесса обучения и при выводе (для нашего API или ChatGPT) для предотвращения повторов и постоянно вносим улучшения в ходе текущих исследований и разработок.
Мы используем широкие и разнообразные данные для создания лучшего ИИ для каждого
Мы хотим, чтобы наши модели ИИ учились на как можно большем количестве языков, культур, предметов и отраслей, чтобы приносить пользу как можно большему числу людей. Чем разнообразнее наборы данных, тем богаче знания, понимание и языки моделей (подобно человеку, столкнувшемуся с широким спектром культурных перспектив и опыта) и тем большему количеству людей и стран ИИ может безопасно служить.
Каждое новое поколение базовых моделей обучается с нуля на новом наборе данных. Мы постоянно совершенствуем нашу архитектуру и значительно увеличиваем масштабы и разнообразие наших датасетов по сравнению с предыдущими моделями. В отличие от более крупных компаний в сфере ИИ, мы не располагаем огромным массивом данных, собираемых десятилетиями. Мы в первую очередь опираемся на общедоступную информацию, чтобы научить наши модели быть полезными.
Мы обучаем наши модели, используя:
- Избранные общедоступные данные, в основном собранные из стандартных для отрасли датасетов машинного обучения и веб-сканирования, аналогично поисковым системам. Мы исключаем источники с платным доступом, агрегированную личную информацию, контент, нарушающий наши правила, а также те, владельцы которых выразили отказ от участия.
- Проприетарные данные, полученные в рамках партнерств по данным. Мы сотрудничаем для получения доступа к непубличному контенту, такому как архивы и метаданные. Наши партнеры варьируются от крупной частной видеотеки изображений и видео для обучения Sora до правительства Исландии, помогая сохранять их родной язык. Мы не заключаем платные партнерства ради исключительно общедоступной информации.
- Обратную связь от людей — тренеров ИИ, специалистов по тестированию на проникновение (red teamers), сотрудников и пользователей, чьи настройки контроля данных разрешают улучшение моделей.
Мы тщательно подходим к сокращению обработки персональной и конфиденциальной информации и обучаем наши модели не выдавать частные или деликатные данные о людях. Мы используем ряд методов для обработки сырых данных с целью их безопасного использования при обучении и все чаще задействуем модели ИИ для очистки, подготовки и генерации данных.
Мы не обучаем модели на бизнес-данных наших клиентов, включая данные из ChatGPT Team, ChatGPT Enterprise или нашей платформы API. Пользователи бесплатных и платных версий ChatGPT могут контролировать свое участие в улучшении будущих моделей через настройки.
Мы строим будущее в партнерстве
Искусственный интеллект развивается быстро, и мы понимаем, что наши цели не могут быть достигнуты в одиночку. Мы стремимся к сотрудничеству с создателями и издателями, построению взаимовыгодных партнерских отношений, поддержке здоровых экосистем и поиску новых экономических моделей. Мы благодарим наших пользователей и партнеров за совместную работу над этими важными темами.
Авторы
Полный текст статьи читайте на OpenAI
