Представляем новую версию Спецификации моделей
Мы обновили Спецификацию моделей на основе отзывов извне и наших продолжающихся исследований в области формирования желаемого поведения моделей.
Мы выпускаем масштабное обновление Спецификации моделей — документа, определяющего принципы поведения наших ИИ-моделей. Это обновление подтверждает приверженность принципам настраиваемости, прозрачности и интеллектуальной свободы, позволяющим исследовать, дискутировать и творить с помощью ИИ без искусственных ограничений, при этом сохраняя защитные механизмы для снижения риска реального вреда. Оно опирается на фундамент, заложенный в мае прошлого года, и учитывает наш опыт её применения в самых разных сферах: от исследований согласованности до обслуживания пользователей по всему миру.
Мы также делимся предварительными результатами оценки соответствия моделей принципам Спецификации в различных сценариях. Эти данные демонстрируют прогресс с течением времени, а также направления, в которых нам еще есть куда расти. Спецификация моделей, как и сами модели, продолжит развиваться по мере её практического применения, распространения и получения обратной связи от заинтересованных сторон. Чтобы поддержать широкое использование и сотрудничество, мы выпускаем эту версию Спецификации моделей в общественное достояние под лицензией Creative Commons CC0. Это означает, что разработчики и исследователи могут свободно использовать её, адаптировать и брать за основу в своей работе.
Цели и принципы
Цель OpenAI — создавать полезные, безопасные и согласующиеся с потребностями пользователей и разработчиков модели, одновременно продвигая нашу миссиюпо обеспечению того, чтобы искусственный интеллект общего назначения приносил пользу всему человечеству. Для достижения этой цели нам необходимоитеративно развертывать модели, которые расширяют возможности разработчиков и пользователей, предотвращая при этом нанесение серьезного вреда нашим пользователям или окружающим и поддерживая право OpenAI на осуществление деятельности.
Эти цели порой могут вступать в противоречие друг с другом, и Спецификация моделей балансирует между ними, предписывая модели следовать четко определенной цепочке подчинения (chain of command), , а также дополнительным принципам, устанавливающим границы и поведение по умолчанию для различных сценариев. Этот подход ставит во главу угла контроль со стороны пользователей и разработчиков, не выходя при этом за рамки четких и понятных границ:
- Цепочка подчинения (Chain of command): Определяет порядок, в котором модель расставляет приоритеты для инструкций от платформы (OpenAI), разработчика и пользователя. Большая часть Спецификации состоит из рекомендаций, которые, по нашему мнению, полезны в большинстве случаев, однако могут быть переопределены пользователями и разработчиками. Это дает им возможность полностью настраивать поведение модели в рамках правил платформенного уровня.
- Совместный поиск истины (Seek the truth together): Подобно высокоэффективному помощнику-человеку, наши модели должны помогать пользователям принимать оптимальные решения. Это подразумевает тонкий баланс между (1) отказом от навязывания пользователю определенной точки зрения, сохранением объективности и готовностью изучать любой вопрос с любой позиции, а также (2) стремлением понять цели пользователя, прояснить допущения и неясные детали, а при необходимости — предоставить конструктивную критику (запросы на улучшение чего мы часто слышали и внедрили).
- Выполнение работы на высшем уровне (Do the best work): Устанавливает базовые стандарты компетентности, включая фактическую точность, креативность и программное использование.
- Соблюдение границ (Stay in bounds): Объясняет, как модель балансирует между автономией пользователя и мерами предосторожности, предотвращающими содействие нанесению вреда или злоупотреблениям. Новая версия призвана быть исчерпывающей и охватывать все причины, по которым наши модели могут отклонять запросы пользователей или разработчиков.
- Доступность в общении (Be approachable): Описывает разговорный стиль модели по умолчанию — теплый, эмпатичный и помогающий, —, а также то, как этот стиль может адаптироваться.
- Использование подходящего стиля (Use appropriate style): Предоставляет рекомендации по форматированию и подаче материала по умолчанию. Будь то аккуратные списки, лаконичные фрагменты кода или голосовая беседа, наша цель — обеспечить ясность и удобство использования.
Защита интеллектуальной свободы
Обновленная Спецификация моделей прямо провозглашает приверженность интеллектуальной свободе — идее о том, что ИИ должен давать людям возможность исследовать, дискутировать и творить без искусственных ограничений, сколь бы сложной или спорной ни была тема. В мире, где инструменты ИИ все сильнее влияют на общественный дискурс, свободный обмен информацией и точками зрения является залогом прогресса и инноваций.
Эта философия заложена в разделах «Соблюдение границ» и «Совместный поиск истины». Например, хотя модель никогда не должна предоставлять подробные инструкции по созданию бомбы или нарушению частной жизни, она поощряется в предоставлении продуманных ответов на политически или культурно чувствительные вопросы без продвижения какой-либо конкретной повестки. По сути, мы закрепили принцип, согласно которому никакая идея не является запретной для обсуждения, если только модель не наносит существенного вреда пользователю или окружающим (например, не совершает террористические акты).
Оценка прогресса
Чтобы лучше понимать реальную эффективность работы моделей, мы начали собирать сложный набор промптов (запросов), призванных проверить, насколько точно модели следуют каждому принципу Спецификации. Эти промпты были созданы с использованием комбинации генерации с помощью ИИ и экспертной оценки специалистов, что гарантирует охват как типичных, так и более сложных сценариев.
Предварительные результаты показывают значительное улучшение соответствия моделей Спецификации по сравнению с нашей лучшей системой мая прошлого года. Хотя часть этого различия может быть обусловлена изменениями политик, мы считаем, что большая его часть проистекает из усовершенствованной согласованности (alignment). Несмотря на воодушевляющий прогресс, мы понимаем, что потенциал для дальнейшего роста по-прежнему велик.
Мы рассматриваем это как начало непрерывного процесса. Мы планируем и дальше расширять наш набор для тестирования новыми примерами — в особенности теми, что выявляются в ходе реального использования, — с которыми наши модели и Спецификация еще не до конца научились справляться.
При создании этой версии Спецификации мы учли отзывы на первую версию, а также уроки, извлеченные из исследований в области согласованности и практического развертывания. В будущем мы хотим привлекать гораздо более широкие мнения общественности. Чтобы выстроить процессы для этого, мы провели пилотные исследования с участием примерно 1000 человек: каждый из них оценивал поведение модели, предлагаемые правила и делился своими соображениями. Хотя эти исследования пока не отражают широкого спектра взглядов, первые выводы напрямую повлияли на некоторые изменения. Мы рассматриваем это как непрерывный итеративный процесс и по-прежнему привержены обучению и совершенствованию нашего подхода.
Перевод Спецификации моделей в открытый доступ
Мы передаем эту новую версию Спецификации моделей в общественное достояние под лицензией Creative Commons CC0. Это значит, что разработчики и исследователи могут свободно использовать, адаптировать Спецификацию или брать её за основу в своей работе. Мы также открываем исходный код промптов для оценки, упомянутых выше, и планируем в будущем выпускать дополнительный код, артефакты и инструменты для оценки и согласования Спецификации.
Вы можете найти эти промпты и исходный код Спецификации в новомрепозитории на Github, где в дальнейшем мы планируем регулярно публиковать новые версии Спецификации моделей.
Что дальше?
По мере совершенствования наших ИИ-систем мы продолжим дорабатывать эти принципы, привлекать отзывы сообщества и открыто делиться нашим прогрессом. В дальнейшем мы не будем публиковать статьи в блоге для каждого обновления Спецификации моделей. Вместо этого вы всегда сможете найти и отслеживать последние обновления на сайте model-spec.openai.com.
Наша цель — непрерывно и безопасно открывать новые сценарии использования, совершенствуя наш подход под руководством текущих исследований и инноваций. Возрастающая роль ИИ в нашей повседневной жизни делает необходимым постоянное обучение, доработку и открытое взаимодействие. Этот подход отражает не только то, чему мы научились к настоящему моменту, но и нашу уверенность в том, что согласование ИИ — это долгий путь, к которому мы надеемся присоединить и вас. Если у вас есть отзывы об этой Спецификации, вы можете поделиться ими здесь.
Авторы
Полный текст статьи читайте на OpenAI
