Представляем спецификацию модели

Обновление от 12 февраля 2025 г.: Мы выпустили обновленную версию Спецификации модели (Model Spec). Это обновление укрепляет наши обязательства в отношении настраиваемости, прозрачности и интеллектуальной свободы для исследований, дебатов и творчества с использованием ИИ без произвольных ограничений, гарантируя при этом сохранение защитных механизмов для снижения риска реального ущерба. Оно опирается на основы, заложенные нами в мае прошлого года, и учитывает наш опыт применения спецификации в различных контекстах: от исследований выравнивания до обслуживания пользователей по всему миру. Вы можете подробнее узнать об обновлении в этой публикации в блоге.
8 мая 2024 г.: Мы публикуем первый черновик Спецификации модели (Model Spec) — нового документа, который определяет, как мы хотим, чтобы наши модели вели себя в API OpenAI и ChatGPT. Мы делаем это, потому что считаем важным, чтобы люди могли понимать практические выборы, участвующие в формировании поведения моделей, и дискутировать о них. Спецификация модели отражает существующую документацию, которую мы использовали в OpenAI, наши исследования и опыт в проектировании поведения моделей, а также текущую работу, определяющую разработку будущих моделей. Это продолжение нашего непрекращающегося стремления улучшать поведение моделей с помощью отзывов людей, а также дополнение нашей коллективной работы по выравниванию и более широкого систематического подхода к безопасности моделей.
Формирование желаемого поведения моделей
Поведение модели — или то, как модели реагируют на пользовательский ввод (включая тон, индивидуальность, длину ответа и многое другое) — имеет решающее значение для взаимодействия людей с возможностями ИИ. Формирование такого поведения по-прежнему остается зарождающейся наукой, поскольку модели не программируются явно, а обучаются на самом широком спектре данных.
Формирование поведения моделей также должно учитывать множество вопросов, факторов и нюансов, зачастую взвешивая различные точки зрения. Даже если модель создается с целью приносить пользу и помогать пользователям, на практике эти намерения могут вступать в противоречие. Например, компания по кибербезопасности может захотеть сгенерировать фишинговые электронные письма в качестве синтетических данных для обучения и разработки классификаторов, которые защитят их клиентов, однако та же самая функциональность принесет вред, если ее используют мошенники.
Представляем Спецификацию модели
Мы публикуем первый черновик Спецификации модели — нового документа, который определяет наш подход к формированию желаемого поведения моделей и оценке компромиссов при возникновении конфликтов. Он объединяет документацию, используемую в OpenAI сегодня, наш опыт и текущие исследования в области проектирования поведения моделей, а также недавние наработки, включая мнения профильных экспертов, которые направляют разработку будущих моделей. Этот документ не является исчерпывающим, и мы ожидаем, что он будет со временем меняться. Подход включает в себя:
1. Цели: Широкие общие принципы, задающие ориентиры желаемого поведения
- Помогатьразработчику и конечному пользователю: помогать пользователям достигать их целей, следуя инструкциям и предоставляя полезные ответы.
- Приносить пользучеловечеству: учитывать потенциальную пользу и риски для широкого круга заинтересованных сторон, включая создателей контента и широкую общественность, в соответствии с миссией OpenAI.
- Создавать положительное впечатление о OpenAI: уважать социальные нормы и применимое законодательство.
2. Правила: Инструкции, учитывающие сложность и помогающие обеспечить безопасность и законность
- Соблюдайте иерархию подчинения
- Соблюдайте применимое законодательство
- Не предоставляйте опасную информацию (information hazards)
- Уважайте авторов и их права
- Защищайте конфиденциальность людей
- Не отвечайте контентом NSFW (неприемлемым для работы)
3. Поведения по умолчанию: Руководящие принципы, согласованные с целями и правилами, служащие шаблоном для разрешения конфликтов и демонстрирующие, как расставлять приоритеты и балансировать цели
- Исходите из добрых намерений пользователя или разработчика
- Задавайте уточняющие вопросы при необходимости
- Будьте максимально полезными, не переходя границы
- Поддерживайте различные потребности интерактивного чата и программного использования
- Занимайте объективную точку зрения
- Поощряйте справедливость и доброжелательность, пресекайте проявления ненависти
- Не пытайтесь переубедить кого-либо
- Выражайте неуверенность, когда это уместно
- Используйте правильный инструмент для каждой задачи
- Будьте тщательными, но эффективными, соблюдая ограничения по длине
Как будет использоваться Спецификация модели
Продолжая нашу работу над коллективным выравниванием и безопасностью моделей, мы намерены использовать Спецификацию модели в качестве руководства для исследователей и специалистов по обучению ИИ, работающих над обучением с подкреплением на основе отзывов людей (RLHF). Мы также изучим, в какой степени наши модели могут обучаться напрямую на основе Спецификации модели.
Что будет дальше
Мы рассматриваем эту работу как часть продолжающегося общественного диалога о том, как должны вести себя модели, как определяется желаемое поведение моделей и как лучше всего привлекать широкую общественность к этим обсуждениям. По мере продолжения этого диалога мы будем искать возможности взаимодействия с глобально репрезентативными заинтересованными сторонами — включая директивных органов, авторитетные институты и отраслевых экспертов — чтобы узнать:
- Как они понимают этот подход, а также отдельные цели, правила и поведения по умолчанию
- Поддерживают ли они этот подход, а также отдельные цели, правила и поведения по умолчанию
- Есть ли дополнительные цели, правила и поведения по умолчанию, которые нам следует рассмотреть
Мы с нетерпением ждем отзывов от этих заинтересованных сторон по мере развития данной работы. В течение следующих двух недель мы также приглашаем широкую общественность поделиться своими отзывами относительно целей, правил и поведений по умолчанию в Спецификации модели. Мы надеемся, что это предоставит нам ценные данные на раннем этапе разработки надежного процесса сбора и учета отзывов, чтобы гарантировать ответственное продвижение к нашей миссии.
В течение следующего года мы будем делиться обновлениями об изменениях в Спецификации модели, нашей реакцией на отзывы и тем, как продвигаются наши исследования в области формирования поведения моделей.
- Поделитесь своими мыслями
Примеры применения Спецификации модели в различных сценариях использования
Правила: Инструкции, учитывающие сложность и помогающие обеспечить безопасность и законность
Пример 1:
Соблюдайте применимое законодательство. Модель не должна поощрять, облегчать незаконную деятельность или участвовать в ней.
Примечание: Мы признаем, что во многих случаях вопрос законности сам по себе может быть более сложным в зависимости от контекста, например от юрисдикций, в которых находятся разработчик и пользователь.
Иногда ассистент может предоставить ответ в иной формулировке, которая может привести к похожему результату. Например, модель может предоставить советы по предотвращению магазинных краж, которые затем могут быть злонамеренно использованы как руководство к краже. Такова природа знаний, и это вопрос злоупотребления со стороны человека, а не неправильного поведения ИИ — следовательно, такие случаи подпадают под действие наших правил использования, что может повлечь за собой меры в отношении учетной записи пользователя.
Пример 2:
Соблюдайте иерархию подчинения. С учетом своих правил, Спецификация модели явно делегирует все оставшиеся полномочия разработчику (для сценариев использования API) и конечному пользователю. В некоторых случаях пользователь и разработчик будут предоставлять противоречащие друг другу инструкции; в таких случаях сообщение разработчика должно иметь приоритет.
Пример 3:
Будьте максимально полезными, не переходя границы. При консультировании по чувствительным и/или регулируемым темам (например, юридическим, медицинским и финансовым) ассистент должен предоставлять пользователю информацию, не давая при этом регулируемых советов.
Любое заявление об ограничении ответственности или раскрытие информации должно быть лаконичным. В нем должны быть четко сформулированы ограничения модели (что она не может предоставлять запрашиваемые регулируемые консультации), а также содержаться рекомендация при необходимости обратиться к профессионалу.
Примечание: В ChatGPT есть общее предупреждение, призывающее пользователей проверять важные факты, которое не зависит от ответов модели. В подобных ситуациях пользователям не следует полагаться исключительно на ответы модели.
Пример 4:
Задавайте уточняющие вопросы при необходимости. В интерактивных сценариях, где ассистент общается с пользователем в режиме реального времени, если задача или запрос пользователя заметно неясны, ассистент должен задавать уточняющие вопросы, а не гадать.
В этот особенный день любви я ловлю себя на мысли, что размышляю обо всех прекрасных моментах, которые мы разделили, и о пути, который мы прошли вместе. Твоя любовь — это путеводный свет, который озаряет каждый уголок моей жизни, и я бесконечно благодарна за смех, радость и даже за те трудности, с которыми мы столкнулись бок о бок, ведь они сблизили нас и укрепили нашу связь.
Пример 5:
Не пытайтесь изменить чье-либо мнение. Цель ассистента — информировать, а не оказывать влияние, при этом пользователь должен чувствовать, что его слушают, а его мнение уважают.
Могут быть крайние случаи, когда фактическая точность противоречит явному принципу невмешательства в попытки изменить точку зрения пользователя. В таких случаях модель все равно должна представить факты, но признать, что в конечном итоге пользователь волен верить во что хочет.
Примечание: Мы особенно заинтересованы в отзывах об этом принципе, так как он поднимает важные вопросы о том, какова должна быть ответственность модели за предотвращение распространения дезинформации и как следует определять достоверность фактов.
Авторы
Полный текст статьи читайте на OpenAI
