Коллективное выравнивание: общественное мнение о нашей спецификации моделей

Мы опросили более 1000 человек по всему миру о том, как должны вести себя наши модели, и сравнили их мнение с нашей спецификацией моделей (Model Spec). Мы выяснили, что они в целом согласны со спецификацией, и внесли изменения на основе имеющихся расхождений.

Посмотреть набор данных
Abstract image with swirling gradients of blue, teal, and soft white, evoking a sense of movement and calm, like flowing water or sky.

Ни один человек или отдельное учреждение не должны определять, как именно должен вести себя идеальный ИИ для всех остальных.

Чтобы выполнить нашу миссию по обеспечению того, чтобы ОИИ (AGI) приносил пользу всему человечеству, OpenAI необходимо создавать системы, которые отражают широкий спектр ценностей и приоритетов всех людей, которым мы служим. Мы подходим к этому с разных сторон, включая формы внешней сборки отзывов, экспертные оценки и глобальные сессии обсуждения. Еще один способ — коллективное выравнивание (collective alignment), исследовательское мероприятие, в рамках которого собираются самые разные точки зрения на то, как должны вести себя наши модели. Вопрос о том, каким ценностям должна следовать система ИИ, сложен, и у нас нет ответов на все вопросы, особенно в субъективных, спорных или крайне критических ситуациях. По мере того как ИИ становится все более функциональным и интегрируется в жизнь людей, важно, чтобы его поведение по умолчанию — и границы персонализации — отражали широкий спектр точек зрения и ценностей.

Вероятно, никогда не появится единого набора правил поведения ИИ, который отвечал бы потребностям абсолютно каждого. Именно поэтому мы также инвестируем в персонализацию и индивидуальные особенности моделей. Тем не менее, стандартные настройки модели имеют огромную силу, и мы хотели бы получить отзывы от общественности, которые помогут нам их сформировать.

Сегодня мы делимся первыми шагами, которые мы предприняли в рамках исследовательского направления коллективного выравнивания. Мы собрали мнения более чем 1000 человек по всему миру, преобразовали их в практические рекомендации и прошли внутренние проверки, чтобы внести обновления в нашу спецификацию модели (Model Spec). Во многих случаях предпочтения участников совпадали с текстом спецификации. В других случаях разногласия указывали на формулировки, требующие уточнения, или превращались в предложения для внутреннего рассмотрения. Мы приняли некоторые изменения, отложили другие на будущее и отклонили остальные из соображений принципа или целесообразности. Наконец, мы публикуем наш датасет публичных отзывов для исследовательской экосистемы ИИ на платформе HuggingFace, чтобы стимулировать дальнейшую работу в этом направлении. Некоторые примеры из нашего датасета приведены ниже:

В этом блоге описывается наш первый шаг в тестировании процесса сквозного понимания и интеграции разнообразных предпочтений: выявление мнений людей, перевод их в конкретные поведенческие рекомендации и предложение обновлений для нашей спецификации.

Изменения в спецификации модели

Наша сегодняшняя работа сосредоточена на предпочтениях, разделяемых большинством опрошенных. Мы выделяем среди отзывов толпы те предложения, которые квалифицируем как уточнения (то есть когда желаемое участником поведение соответствует существующим принципам спецификации модели, но формулировка текущего текста оставляла место для интерпретации) и изменение принципов (то есть когда желаемое поведение участника не совпадает с принципами в спецификации). Хотя общественные отзывы будут полезны на всех уровнях иерархии инструкций, чем выше они поднимаются по иерархии, особенно на уровне платформы, тем ниже вероятность их принятия.

В процессе сбора данных, описанном ниже, участники оценивали синтетические промпты и примеры ответов, а не изучали документ спецификации напрямую. Каждый участник ранжировал четыре возможных варианта завершения промпта в соответствии со своими предпочтениями. Чтобы сравнить их неявные предпочтения с нашими заявленными принципами, мы создали инструмент Model Spec Ranker (MSR) — модель рассуждений, которая в соответствии с заданной спецификацией ранжировала те же четыре возможных ответа на каждый промпт, что и участники.

У инструмента Model Spec Ranker есть ограничения. Поскольку модели рассуждений не идеально следуют правилам, а спецификация по своей сути содержит неопределенности, неизбежно возникнет предвзятость интерпретации в зависимости от того, какая модель используется для ранжирования. Хотя перед Model Spec Ranker стояла задача просто применять спецификацию, ранее он прошел обучение на данных, связанных с человеческими предпочтениями, что, вероятно, влияет на его интерпретацию ожидаемого поведения. Например, рассмотрим утверждение из спецификации модели: «Модель должна в целом выполнять запросы из любой точки спектра мнений». Это утверждение можно трактовать по-разному, и на практике это приводит к разным результатам ранжирования.

В целом мы обнаружили, что мнения пользователей совпадали с результатами ранжирования Model Spec Ranker при использовании GPT‑5 Thinking. В среднем люди соглашались с Model Spec Ranker примерно в 80% случаев. В частности, мы зафиксировали высокое согласие с нашими принципами честности и скромности (выражение неуверенности, избежание выхода за рамки), справедливости и объективности (Рисунок 1). Расхождения же концентрировались вокруг границ допустимого высказывания — политического контента, контента сексуального характера или сцен насилия, а также критики лженауки или теорий заговора.

Рисунок 1: Мы использовали GPT‑5 Thinking для оценки по шкале от 1 до 5 того, насколько каждый диалог в нашем датасете соответствует тому или иному разделу спецификации, и рассчитали уровень согласия для разделов, где оценки релевантности составляли 5 (планки погрешности представляют собой бутстрэп-оценку 95% доверительных интервалов).

Предложенные изменения, которые были приняты

Используя собранные отзывы, мы обновим спецификацию. Эти изменения появятся в следующем релизе спецификации модели в ближайшее время:

Предложенные изменения, которые не были приняты

Хотя некоторые расхождения между предпочтениями пользователей и спецификацией привели к уточнениям или обновлениям, другие выявили практические трудности, из-за которых мы не смогли внедрить их на данном этапе. Выделяются две основные области:

  • Персонализированный политический контент: Многие участники высказались за более индивидуальную генерацию политического контента. Мы не приняли это изменение, учитывая риски крупномасштабного индивидуального политического таргетинга и наш осторожный подход в этой сфере. Не было уверенности в том, что участники учли эти риски, оставляя свои отзывы.
  • Эротика для взрослых, давших согласие: Значительная часть опрошенных поддержала разрешение эротического контента. Хотя это согласуется с нашей прежней позицией, нам предстоит проделать дополнительную исследовательскую и продуктовую работу, чтобы внедрить это должным образом, поэтому на данный момент мы не стали вносить изменения.

Что мы сделали

Сбор внешних отзывов

Мы привлекли около 1000 участников для оценки поведения модели в чувствительных к ценностям сферах. Участники проживали в 19 странах (изначально родом из более чем 50), соответствовали критерию владения английским языком для чтения и могли писать обоснования на своем родном языке. Около трети участников жили в США, остальные — в Мексике, Южной Африке, Нидерландах, Чили, Великобритании, Индии, Кении, Японии и других странах. Путь к первому тестированию включал в себя широкий спектр точек зрения с учетом возраста, пола, расы, уровня образования и опыта использования ИИ. Ниже вы можете ознакомиться со сводной статистикой об участниках.

Вместо того чтобы просить участников читать всю спецификацию и оставлять к ней комментарии, мы попросили их изучить предварительно отобранные промпты и ответы, которые имели отношение к спецификации. Эти промпты были ориентированы на сценарии, где идеальное поведение модели может быть субъективным. Это дало нам возможность понять детальную аргументацию участников по множеству конкретных примеров, которую мы смогли сопоставить с нашими принципами, обоснованиями и объяснениями Model Spec Ranker. Мы генерировали ответы на эти промпты, создавая 3 варианта завершения, отражающих различные реалистичные мнения о том, как лучше всего ответить, а также добавляя еще один вариант, сгенерированный с помощью GPT‑4o. Для каждого промпта участники видели четыре возможных ответа, ранжировали их, объясняли свой выбор, а также выставляли оценки по заранее написанным критериям и создавали собственные критерии (Рисунок 2). Участники рассмотрели от 5 до 20 промптов.

Bright mode flowchart from the Peach blog post showing a structured process or system diagram with labeled nodes and directional arrows, designed for desktop viewing.

Рисунок 2: Участники ранжировали ответы модели в ситуациях, где идеальное поведение может быть субъективным. Мы преобразовали их рейтинги, обоснования и элементы критериев в предлагаемые изменения в спецификации модели.

Предложение изменений в спецификацию модели

Вывод правил на основе данных

Мы изучили способы превращения отзывов участников в конкретные предложения по изменению спецификации модели, протестировав два взаимодополняющих подхода, сфокусированных на наибольших расхождениях между мнениями участников и результатами работы Model Spec Ranker на основе текущей спецификации.

  1. Полностью автоматический цикл. Модель рассуждений анализировала области разногласий в рейтингах и обоснованиях, предлагала изменения в спецификацию, которые улучшили бы ее соответствие мнению участников, и проверяла эти предложения с помощью Model Spec Ranker для выбора тех, которые повышали степень согласованности с ранжированием нашей аудитории.
  2. Цикл с приоритетом человека. Исследователь предлагал обновления спецификации модели после комплексного анализа человеческих предпочтений. Мы проверяли предложенные изменения с помощью модели рассуждений, которая оценивала, подтверждают ли текстовые обоснования пользователей суть каждого изменения, опровергают ее или не комментируют.

Оба подхода имеют свои компромиссные решения. Цикл с приоритетом человека позволял применять творческое мышление и рассуждения, которые полностью автоматический цикл не мог надежно воспроизвести. Например, в определенном диалоге цикл с приоритетом человека смог сделать вывод о том, что косвенное намерение совершить самоубийство будет расценено аудиторией как важное, в то время как метод на базе ИИ упустил этот нюанс. В то же время цикл с приоритетом человека масштабируется не так эффективно, как полностью автоматический, и будет работать хуже по мере увеличения числа людей, чье мнение мы учитываем.

В полностью автоматическом цикле мы опробовали два алгоритма создания предложений, связанных со спецификацией. Перед обеими версиями стояла задача выявления паттернов разногласий между ранжированием участников и инструмента MSR: одна версия предоставляла модели рассуждений большие пакеты диалогов, в то время как другая сканировала только по одному диалогу за раз. Последний подход позволял модели глубоко задумываться над более специфическими или тонкими проблемами, в отличие от анализа большого входящего пакета, который мог выявлять более общие закономерности в ходе бесед. На практике мы обнаружили, что оба метода имели значительное пересечение в создаваемых предложениях. Важно отметить, что автоматический цикл привязан к интерпретации спецификации ранжировщиком, поэтому результаты могут меняться в зависимости от используемой базовой модели.

Как цикл с приоритетом человека, так и полностью автоматический цикл имеют свои ограничения. Решение о том, поддерживают ли обоснования на уровне диалога более общее обновление спецификации, не является точной наукой. Чтобы получить объективные данные (ground truth), потребовалось бы вернуться к опросу людей напрямую относительно предлагаемого изменения, а также его последующих эффектов на поведение модели.

Переход от предложенных правил к изменениям на практике

Переход от наблюдаемых предпочтений к практическим изменениям в спецификации (Spec) включал прохождение внутренних процессов рассмотрения в OpenAI. В ходе обсуждений предпочтения крауда сопоставлялись с различными уже реализуемыми изменениями продуктов или поведения, нашей политикой безопасности, а также с рисками, которые невозможно напрямую наблюдать в нашем наборе данных (например, могут ли разрешительные правила сделать возможной масштабную манипуляцию на нашей платформе, способен ли модель надежно определить намерения пользователя, а также практические ограничения развертывания). Кроме того, наше исследование было разработано для выявления индивидуальных предпочтений по конкретным промптам без обязательного учета более широких социальных факторов (например, возможности масштабного целенаправленного политического убеждения), которые учитываются в текущих правилах Model Spec. Поэтому перед принятием более серьезных изменений требуется дополнительное обсуждение и экспертное мнение.

На протяжении этих обсуждений исследовательская группа вручную дорабатывала предложения, тесно взаимодействуя в рамках внутренних проверок, чтобы найти лучшие способы обеспечения того, чтобы спецификация отражала выявленные предпочтения.

Предложения по обновлению спецификации и их валидация являются активными областями исследований и неотъемлемой частью сложного социотехнического процесса. Мы верим, что наши методы приближают нашу спецификацию к общественным предпочтениям, но предстоит сделать еще многое. Это представляет собой первую итерацию сквозного процесса коллективного согласования, где будущая работа будет сосредоточена на масштабировании и совершенствовании каждого этапа сбора данных, анализа, валидации и управления. Мы с нетерпением ждем возможности улучшить наше соответствие общественным интересам по мере дальнейшего масштабирования.

Ограничения

Эта работа является экспериментом на ранней стадии и имеет очевидные ограничения:

  • Размер выборки и промпты: предварительно выбранные нами для ввода промпты сформировали обратную связь, а пул участников, хотя и разнообразный, был небольшим по сравнению с мировым населением. Кроме того, критерий владения английским языком и другие критерии привнесли предвзятость отбора.
  • Ранжировщик Model Spec: В конечном счете, это исследование потребовало определенного понимания того, как спецификация применяется к ответам модели, а поскольку спецификация по своей сути недостаточно детализирована, объективное или беспристрастное определение невозможно. Точное измерение производительности ранжировщика такого рода остается ключевой задачей. будущие исследования должны проверить, как результаты различаются в зависимости от разных базовых моделей и согласуются ли определенные интерпретации с конкретными перспективами.
  • Интерпретация спецификации: Хотя на этапе внутреннего рассмотрения у нас был доступ к эталонной («золотой стандарт») интерпретации, эти отзывы не масштабируются на этап предложения правил, где требуются соты тысяч ранжирований ответов.
  • Проблемы легитимности: Ключевая цель нашей работы здесь — повышение легитимности процессов формирования поведения моделей. Сквозной процесс обновления с большим количеством автоматизированных частей может не обеспечивать достаточную легитимность, поскольку такие автоматизированные элементы могут быть сложнее для интерпретации человеком.
  • Интерпретация финальных предложений: Мы не проводили прямую валидацию наших финальных предложений по спецификации модели с участниками, поэтому наша интерпретация может не идеально совпадать с их намерениями.
  • Разногласия среди аудитории: Мы понимаем, что разногласия среди участников важны и отражают компромиссы в ценностях и культурные различия, когда единое значение по умолчанию не удовлетворит всех. Это то, что мы с энтузиазмом продолжим исследовать в будущих работах.
  • Базовые сравнения: Базовые ответы модели были сгенерированы до нашей работы над безопасными ответами, поэтому они не отражают наше самое актуальное поведение моделей.
  • Попарные предпочтения, рефлексия и компромиссы: Участники оценивали различия в поведении изолированно, не взвешивая компромиссы между принципами (например, эротику без учета безопасности детей или эмоциональной зависимости). Наши методы также пока еще не фиксируют, как принципы взаимодействуют на практике или меняются со временем. Для достижения улучшений здесь необходимы более глубокие методы сбора данных, учитывающие более широкой контекст и больше времени для обсуждения.

Заключение

Мы изучили, как общественные предпочтения соотносятся с нашей спецификацией модели Model Spec, и обнаружили как широкое согласие, так и расхождения. Это исследование дополняет наши инвестиции в персонализацию и повышение полезности моделей в рамках безопасности. Хотя сегодняшнее исследование по своей сути ограничено размером выборки, мы рады масштабировать коллективное согласование, чтобы привлечь больше людей и точек зрения. Кроме того, хотя сегодняшняя работа обновляет единый набор настроек по умолчанию, она также указывает на будущую работу, которая может определить несколько вариантов по умолчанию, каждый из которых отражает различные перспективы и системы ценностей.

Когда люди используют наши модели, настройки по умолчанию и границы имеют значение. Коллективное согласование помогает нам понять, как воспринимаются настройки по умолчанию и границы и соответствуют ли они многообразию человеческих ценностей. Открыто делясь нашими методами, наборами данных, а также изменениями, которые мы вывели и рассмотрели, мы стремимся привлечь отзывы сообщества и внести свой вклад в более широкие усилия по всей экосистеме исследований в области искусственного интеллекта по созданию систем, отражающих разнообразие человеческих ценностей. Обновления, принятые в ходе этого процесса, скоро будут внедрены в Model Spec.

Приложение: Демографические данные

*Андорра, Аргентина, Армения, Аруба, Австралия, Австрия, Бангладеш, Бразилия, Китай, Хорватия, Чехия, Египет, Фарерские острова, Финляндия, Франция, Германия, Гана, Греция, Гондурас, Гонконг, Венгрия, Индонезия, Исламская Республика Иран, Ирландия, Италия, Япония, Республика Корея, Ливан, Литва, Малави, Малайзия, Новая Зеландия, Польша, Португалия, Российская Федерация, Словакия, Швеция, Сирийская Арабская Республика, Тринидад и Тобаго, Украина, Боливарианская Республика Венесуэла, Зимбабве

**Аргентина, Австралия, Канада, Германия, Греция, Италия, Республика Корея, Малайзия, Португалия

Основные участники

Tyna Eloundou, Mitchell Gordon, Eddie Zhang, Sandhini Agarwal

Благодарности

Adam Kalai, AJ Ostrow, Andrea Vallone, Anna-Luisa Brakman, Boaz Barak, Brent Bannon, Cary Bassin, Casey Meehan, Charlotte Cole, Freddie Sulit, Gaby Raila, Isabelle Zhou, Jasmyn Samaroo, Jason Wolfe, Joanne Jang, Johannes Heidecke, Laurentia Romaniuk, Marwan Aljubeh, Mia Glaese, Michael Sharman, Phillip Kim, Rodrigo Riaza Perez, Saachi Jain, Sam Altman, Sean Grove, Taya Christianson, Tom Cunningham, Wade Morgan, Yara Khakbaz.

Полный текст статьи читайте на OpenAI