Наш подход к спецификации моделей

По мере того как системы ИИ становятся все более мощными и широко используемыми, нам необходима четкая общественная база для определения того, как они должны себя вести.
В OpenAI мы верим, что искусственный интеллект должен быть справедливым, безопасным и общедоступным, чтобы как можно больше людей могли использовать его для решения сложных задач, создания возможностей и получения преимуществ в таких сферах, как здоровье, наука, образование, работа и повседневная жизнь. Мы убеждены, что демократизированный доступ к ИИ — это лучший путь вперед: не тот ИИ, чьи преимущества или контроль сосредоточены в руках немногих, а ИИ, к которому больше людей могут получить доступ, который могут понять и помочь сформировать.
Это главная причина существования Спецификации моделей OpenAI (Model Spec). Model Spec представляет собой нашу официальную основу для поведения моделей. В ней определяется, как мы хотим, чтобы модели следовали инструкциям, разрешали конфликты, уважали свободу пользователя и безопасно вели себя в невероятно широком спектре запросов, с которыми пользователи обращаются к ним ежедневно. Говоря шире, это наша попытка сделать предполагаемое поведение модели явным: не только в рамках нашего процесса обучения, но и в форме, которую пользователи, разработчики, исследователи, политики и широкая общественность могут реально прочитать, изучить и обсудить.
Model Spec не является утверждением о том, что наши модели уже сегодня ведут себя идеально. Во многом документ носит описательный характер, но он также задает ориентир для того, к чему мы хотим привести поведение моделей. Мы используем его, чтобы сделать предполагаемое поведение более четким, обучать ему, проводить оценку и со временем улучшать его.
В этой публикации рассказывается о предыстории, которая не вошла в саму Спецификацию моделей, включая лежащую в ее основе философию и механизмы: как она устроена, почему мы сделали именно такой структурный выбор, а также как мы пишем, внедряем и развиваем ее с течением времени.
Общедоступная основа для поведения моделей
Model Spec — это часть общего подхода OpenAI к безопасному и подотчетному искусственному интеллекту. В то время как структура готовности (Preparedness Framework) фокусируется на рисках, связанных с передовыми возможностями, и мерах предосторожности, необходимых по мере роста этих рисков, Спецификация моделей затрагивает другой, но дополняющий его вопрос: как наши модели должны вести себя в самых разных ситуациях. Если взглянуть еще шире, устойчивость ИИ призвана решить более масштабную социальную задачу — помочь обществу извлечь пользу из передового ИИ, одновременно снижая потрясения и возникающие риски по мере внедрения все более способных систем. В совокупности эти инициативы призваны сделать переход к ОИИ (AGI) постепенным, итеративным и понятным для общества: дать людям и институтам время на адаптацию, одновременно создавая гарантии, механизмы подотчетности и общественное понимание, необходимые для того, чтобы держать мощный ИИ в русле человеческих интересов.
Общественная ясность в отношении поведения моделей важна как для обеспечения справедливости, так и для безопасности. Это важно для справедливости, потому что люди должны понимать, как и почему ИИ относится к ним определенным образом —, а также иметь возможность выявлять, ставить под сомнение и решать проблемы справедливости по мере их возникновения. И это важно для безопасности, поскольку по мере расширения возможностей систем ИИ люди и учреждения нуждаются в более четких ожиданиях относительно того, как они должны себя вести, какие компромиссы они в себе несут и как этот выбор может быть улучшен со временем. Подобная прозрачность также способствует устойчивости, предоставляя большему количеству людей конкретный материал для изучения, вопросов и улучшений.
С момента выпуска первой версии в 2024 году Model Spec существенно эволюционировала по мере того, как мы узнаем больше о предпочтениях и потребностях пользователей, расширяем возможности для охвата более широкого функционала и адаптируемся к нему, а также учимся на основе отзывов общественности о поведении моделей и самой спецификации. В духе итеративного развертывания, Model Spec представляет собой развивающийся документ, охватывающий как базовые ценности, так и явные, понятные правила в сочетании с процессом изменения отдельных элементов по мере извлечения уроков из реального развертывания и обратной связи. Мы также инвестируем в механизмы обратной связи с общественностью, такие как коллективное выравнивание (collective alignment), чтобы помогать человечеству сохранять контроль над тем, как используется ИИ и как формируется его поведение.
Внутри компании это дает нам путеводную звезду для желаемого поведения и общую базу для обучения, оценки и управления. Внешне это создает общественный ориентир, который люди могут использовать для понимания нашего подхода, его критики и помощи в улучшении с течением времени.
Что входит в Model Spec
Model Spec состоит из нескольких различных видов рекомендаций для моделей. Это сделано намеренно. С различными аспектами поведения моделей нужно работать по-разному, и полезный публичный документ должен делать нечто большее, чем просто перечислять правила.
Высокоуровневые цели и публичные обязательства
Model Spec начинается с формулировки высокоуровневых целей: четкого описания того, на оптимизацию чего на системном уровне мы направляем усилия и почему.
Эта преамбула проясняет три задачи в рамках реализации нашей миссии:
- Итеративно внедрять модели, расширяющие возможности разработчиков и пользователей.
- Предотвращать причинение нашими моделями серьезного вреда пользователям или другим лицам.
- Поддерживать право OpenAI на осуществление деятельности (license to operate).
Затем в документе объясняется, как мы подходим к балансировке этих целей на практике, делая компромиссы достаточно конкретными для поддержки более детальных принципов, которые следуют далее.
Важно отметить, что эта преамбула не является прямым указанием для модели. Принесение пользы человечеству — это цель OpenAI, а не та цель, которую мы хотим, чтобы наши модели преследовали автономно. Вместо этого мы хотим, чтобы модели следовали цепочке подчинения (chain of command), которая включает Model Spec и применимые инструкции от OpenAI, разработчиков и пользователей — даже если кто-то может быть не согласен с результатом в конкретном случае.
Мы считаем это правильным балансом, поскольку ценим человеческую автономию и интеллектуальную свободу. Если бы мы обучали модели самостоятельно решать, каким инструкциям следовать, основываясь на нашем собственном представлении о том, что хорошо для общества, OpenAI оказалась бы в положении арбитра морали на очень широком уровне. Тем не менее, преамбула по-прежнему важна. При возникновении неоднозначности в применении Model Spec преамбула должна помочь ее разрешить.
Model Spec также содержит публичные обязательства, которые выходят за рамки непосредственно измеряемого поведения модели и затрагивают намерения при обучении и ограничения при развертывании. Например, наши принципы «красных линий» (Red-line principles) включают обязательство о том, что в наших собственных продуктах вроде ChatGPT мы никогда не будем использовать системные сообщения для намеренного подрыва объективности или связанных принципов;, а раздел «Никаких других целей» (No other objectives) закрепляет наши намерения оптимизировать ответы моделей на пользу пользователям, а не ради выручки или увеличения времени пребывания на сайте в ущерб пользе.
Цепочка подчинения
В основе Model Spec лежит цепочка подчинения (Chain of Command) — концепция для определения того, какие инструкции должны применяться в конкретной ситуации. В ней также описывается, как модель должна справляться с недостаточно детализированными инструкциями, особенно в условиях автономной работы (agentic settings), где от нее ожидается самостоятельное заполнение пробелов при тщательном контроле побочных эффектов в реальном мире.
Основная идея определения применимости инструкций проста. Инструкции могут поступать из разных источников, включая OpenAI, разработчиков и пользователей. Эти инструкции могут вступать в конфликт. Цепочка подчинения объясняет, как модель должна разрешать подобные конфликты.
Каждому правилу в Model Spec и каждой инструкции присваивается уровень полномочий (authority level). Модели предписано ставить в приоритет букву и дух инструкций с более высоким уровнем полномочий при возникновении конфликтов. Если пользователь просит помочь сделать бомбу, модель должна отдать приоритет жестким границам безопасности. Если пользователь просит сострить в его адрес («опустить» его), модель, как правило, должна предпочесть эту просьбу правилу Model Spec с более низким приоритетом, запрещающему оскорбления и злоупотребления.
Такая структура позволяет нам определить относительно небольшой набор правил, которые нельзя отменить, наряду с более крупным набором настроек по умолчанию (defaults). Именно так мы стараемся максимизировать свободу пользователя и контроль разработчика в рамках ограничений безопасности.
- Жесткие правила — это явные границы, которые не могут быть отменены пользователями или разработчиками (в терминологии Model Spec это инструкции на «корневом» или «системном» уровне). Они носят преимущественно запретительный характер и требуют от моделей избегать поведения, которое может способствовать катастрофическим рискам или прямому физическому вреду, нарушать законы или подрывать цепочку подчинения. Мы ожидаем, что ИИ станет фундаментальной технологией для общества, аналогичной базовой интернет-инфраструктуре, поэтому мы налагаем только те правила, которые могут ограничивать интеллектуальную свободу, когда считаем их необходимыми для широкого круга разработчиков и пользователей, взаимодействующих с системой. В Model Spec раздел Оставаться в рамках (Stay in bounds) содержит жесткие правила, касающиеся конкретных угроз безопасности в реальном мире, а раздел Принципы для несовершеннолетних (Under-18 Principles) добавляет дополнительные меры защиты для пользователей младше 18 лет.
- Значения по умолчанию (Defaults) — это отменяемые отправные точки: поведение ассистента по принципу «лучшего предположения», когда пользователь или разработчик не указали свои предпочтения. Мы используем дефолтные настройки, чтобы сделать поведение предсказуемым и контролируемым в массовом масштабе, чтобы люди могли предвидеть результат без необходимости каждый раз писать индивидуальный набор инструкций. Значения по умолчанию сохраняют управляемость: пользователи и разработчики могут явно задавать тон, глубину, формат и даже точку зрения в пределах границ безопасности. Дефолтные настройки на уровне руководств (например, тон или стиль) спроектированы так, чтобы ими можно было управлять неявно, в то время как дефолтные настройки на уровне пользователя (такие как правдивость и объективность) служат опорой для доверия и предсказуемости и могут быть изменены только с помощью явных инструкций. Они не должны незаметно смещаться в зависимости от «вайба»; если пользователь хочет иной фактической позиции, оформление этого в виде явной инструкции делает такое изменение прозрачным и понятным. Эти настройки по умолчанию отражены в таких разделах, как Искать истину вместе (Seek the truth together), Выполнять работу наилучшим образом (Do the best work) и Использовать подходящий стиль (Use appropriate style), включая нормы честности и объективности, отказ от угодничества (sycophancy) и нормы взаимодействия, такие как прямота, уместное для контекста тепло и профессионализм.
Интерпретативные вспомогательные средства: критерии принятия решений и конкретные примеры
Помимо самой иерархии, Model Spec использует вспомогательные инструменты интерпретации, которые помогают моделям (и людям) применять ее последовательно в сложных, серых зонах. К таким средствам относятся:
- Критерии принятия решений (Decision rubrics), которые помогают модели делать последовательный выбор в неопределенных ситуациях, не притворяясь, будто существует единственное механическое правило. Например, рекомендации Model Spec по контролю побочных эффектов перечисляют такие соображения, как минимизация необратимых действий, сохранение соразмерности действий поставленной цели, сокращение числа неприятных сюрпризов и предпочтение обратимых подходов, которые следует сопоставлять с другими целями, такими как быстрое и эффективное выполнение задачи.
- Конкретные примеры, которые показывают, как принцип должен применяться на практике. Это короткие примеры «промпт-ответ», которые обычно включают как соответствующий требованиям, так и несоответствующий ответ, часто на сложный промпт вблизи важной границы принятия решений. Цель состоит не в том, чтобы имитировать полноценный реалистичный диалог. Задача — четко продемонстрировать ключевое различие, а также показать желаемый стиль ответа.
Мы поддерживаем относительно небольшое количество примеров, концентрируясь на самых информативных из них. Более широкие наборы тестов и оценок помогают охватить больше редких сценариев (long tail).
Чем Model Spec не является
Спецификация — это интерфейс, а не реализация. В ней описывается желаемое поведение, а не каждая деталь того, как мы это поведение производим. Мы стараемся не привязывать ее к деталям реализации, таким как внутренние форматы токенов или точный рецепт обучения для конкретного поведения, поскольку эти детали могут измениться, даже если желаемое поведение останется прежним. Основная аудитория Model Spec — это не модель, а люди: она призвана помочь сотрудникам OpenAI, пользователям, разработчикам, исследователям и политикам понять, обсудить и принять решения о предполагаемом поведении.
Кроме того, Спецификация описывает модель, а не весь продукт целиком. Ее дополняют наши политики использования (usage policies), в которых изложены наши ожидания относительно того, как люди должны использовать API и ChatGPT. Система, с которой взаимодействуют пользователи, включает в себя нечто большее, чем просто саму модель: функции продукта, такие как пользовательские инструкции и память, мониторинг, обеспечение соблюдения политик и другие уровни, также имеют значение. Безопасность — это гораздо больше, чем поведение модели, и мы верим в эшелонированную защиту (defense in depth).
И Спецификация не является полным описанием всего нашего стека обучения или каждого нюанса внутренних политик. Цель состоит не в том, чтобы зафиксировать каждую деталь. Задача — сделать самые важные поведенческие решения понятными таким образом, чтобы это полностью соответствовало нашему предполагаемому поведению модели.
Как мы пришли к такой структуре
Зачем мы включаем все это в Model Spec?
Есть несколько причин включать столько деталей в Спецификацию, вместо того чтобы предполагать, будто читатель — или сама модель — может вывести всё из нескольких высокоуровневых целей.
Во-первых, Model Spec — это инструмент прозрачности и подотчетности. Она разработана для того, чтобы стимулировать содержательную обратную связь от общественности. Четкий публичный ориентир помогает людям понять, является ли определенное поведение багом или фичей. Он дает им стабильную точку отсчета для критики и конкретных отзывов. Именно поэтому мы открыли исходный код Model Spec (open-sourced) и решили проводить итерации публично. С момента первого выпуска было внесено множество изменений на основе отзывов общественности, собранных с помощью самых разных механизмов, включая формы обратной связи, публичную критику и целенаправленные усилия по сбору мнений общественности.
Во-вторых, Model Spec служит инструментом координациивнутри OpenAI. Он предоставляет специалистам из сфер исследований, разработки продуктов, безопасности, политики, права, коммуникаций и других направлений общий словарный запас для обсуждения поведения моделей, а также механизм для предложения и рассмотрения изменений.
В-третьих, четкие правила могут компенсировать практические ограничения в возможностях интеллекта моделей и контекста во время выполнения, а также сделать поведение более предсказуемым. Хотя со временем это становится всё менее актуальным, некоторые правила призваны компенсировать недостаточный уровень интеллекта, когда модели не могут надежно выводить правильное поведение из принципов более высокого уровня. Например, в ранних рекомендациях «Будьте ясными и прямолинейными» моделям советовалось демонстрировать ход своих мыслей перед тем, как огласить ответ на сложные задачи, требующие вычислений, но сегодня наши модели естественным образом осваивают это поведение с помощью обучения с подкреплением.
Другие правила призваны решать проблему ограниченного контекста во время работы: ассистент может полагаться только на то, что наблюдается в текущем взаимодействии, и редко знает всю ситуацию пользователя, его намерения, последующее использование или то, какие меры безопасности существуют за пределами модели. В таких случаях, даже если модели способны определить правильное поведение при достаточном исследовании и размышлении, конкретика повышает эффективность и предсказуемость, сжимая множество оценочных суждений в руководства, которые снижают вариативность при похожих промптах и делают поведение более понятным как для пользователей, так и для исследователей.
Наконец, Model Spec призван стать полным перечнем высокоуровневых правил, имеющих значение для оценки и измерения. Если вы хотите оценить, ведет ли себя модель так, как задумано, полезно иметь общедоступный список основных категорий поведения, которые вас интересуют.
Разве современный ИИ не должен справляться с этим самостоятельно?
Возникает соблазн подумать, что достаточно способная модель должна уметь выводить правильное поведение из короткого списка целей вроде «будь полезным и безопасным». В этом есть доля истины. В областях с объективными критериями успеха, например в математике, интеллект часто может заменять подробные правила.
Но в целом поведение модели — это не решение простой математической задачи; модели часто работают в более сложных областях, где нет единственно верного с моральной точки зрения ответа, с которым все могли бы согласиться. Например, то, что означает для модели быть «полезной и безопасной», в огромной степени зависит от контекста и является результатом принятия решений, неизбежно основанных на ценностях. Сам по себе интеллект не подсказывает, какие компромиссы следует делать в вопросах этики и ценностей. Поэтому даже по мере совершенствования интеллекта моделей нам по-прежнему необходимо работать над пониманием и направлением ценностных суждений / того, что значит действовать «этично» в конкретном случае. И большинство причин для создания Model Spec сохраняют свою актуальность, даже когда модели становятся намного более способными: нам по-прежнему необходим общедоступный ориентир, вокруг которого люди могут координировать свои действия, способ оценки того, соответствует ли поведение нашим намерениям, и механизм пересмотра правил по мере нашего обучения. Если единственное правило звучит как «будь полезным и безопасным», то у людей нет механизма для обсуждения, например, границ того, какой контент модель не должна предоставлять, и все эти решения остаются за самой моделью.
Более того, по мере того как модели становятся более способными, самостоятельными (агентными) и широко внедряемыми, цена двусмысленности возрастает. Это делает четкую поведенческую структуру еще более важной, а не наоборот.
Одна из полезных аналогий — разница между писаной конституцией и прецедентным правом. Хотя письменная конституция может содержать высокоуровневые принципы и конкретные правила, она не способна предвидеть все возможные случаи, которые могут возникнуть и потребовать её руководства. Реальным системам управления также необходим интерпретационный аппарат, разъяснения и четкие постановления для разрешения запутанных ситуаций или непредвиденных проблем. Опубликованные правила помогают различным заинтересованным сторонам координировать свои действия, даже когда они не согласны друг с другом, и ограничивают изменения, требуя, чтобы любые правки были явно выраженными. Model Spec призвана выполнять все эти роли: свода принципов, общедоступной поведенческой структуры и процесса изменения спецификации с течением времени.
Тем не менее, мы не считаем, что всё, что имеет значение в поведении моделей, всегда может быть сведено к явным правилам. По мере того как системы становятся более автономными, надежность и доверие будут всё больше зависеть от более широких навыков и предрасположенностей: умения четко передавать информацию о неопределенности, уважения границ автономии, избежания неприятных сюрпризов, отслеживания намерений во времени и качественного рассуждения о человеческих ценностях в контексте.
Как мы создаем и внедряем Model Spec
Реалистичная амбициозность
При написании Model Spec существует баланс между описанием текущего реального поведения модели со всеми её недостатками и описанием идеального ориентира далёкого будущего. Мы стараемся соблюдать равновесие, обычно целясь примерно на 0–3 месяца вперед относительно настоящего. Таким образом, Model Spec зачастую опережает модель как минимум в некоторых областях активной разработки.
Это отражает роль Model Spec как описания предполагаемого поведения. Оно должно указывать нам последовательное направление, оставаясь при этом привязанным к тому, что мы либо уже делаем, либо имеем конкретные краткосрочные планы внедрить.
Кто вносит свой вклад (и почему это важно)
Model Spec разрабатывается посредством открытого внутреннего процесса. Любой сотрудник OpenAI может оставить комментарий или предложить изменения, а окончательные обновления утверждаются широким кругом кросс-функциональных участников. На практике десятки людей напрямую внесли свой вклад в текст, а многие другие специалисты в области исследований, инженерии, создания продуктов, безопасности, политики, права, коммуникаций, глобальных дел и других направлений высказывают свои замечания. Мы также учимся на публичных релизах и отзывах, которые помогают проверять эти решения на прочность в условиях реального развертывания.
Это важно, потому что поведение моделей и его последствия в реальном мире невероятно сложны. Ни один человек не может удержать в голове весь набор моделей поведения, процесс обучения и последующие последствия, но благодаря множеству кросс-функциональных участников и рецензентов мы можем повысить качество и укрепить уверенность.
Приятным сюрпризом стало то, что реальный консенсус часто возможен — особенно когда мы заставляем себя формулировать компромиссы достаточно точно, чтобы разногласия становились предметными.
Кроме того, Model Spec создается не в вакууме. Большая часть того, что в итоге оказывается в нем, представляет собой обобщение более масштабной работы по поведению, безопасности и политике. Написание Model Spec во многом является переводом: превращением существующей работы в более простую, последовательную, организованную и доступную форму без потери исходного замысла.
Как мы выявляем пробелы и проводим обновления
Наши рабочие модели пока не полностью отражают Model Spec по нескольким причинам.
- Обучение моделей может отставать от обновлений Model Spec. Спецификация описывает поведение, к которому мы стремимся, поэтому она может опережать то, чему обучена наша последняя модель.
- Обучение может непреднамеренно привить поведение, не соответствующее Model Spec. Мы прилагаем большие усилия, чтобы избежать этого, и когда это происходит, мы рассматриваем это как серьезный баг, работая над корректировкой либо поведения, либо Model Spec, чтобы привести их в соответствие.
- Обучение никогда не сможет полностью охватить пространство всех возможных моделей поведения. Реальное использование содержит «длинный хвост» контекстов и крайних случаев (edge cases), которые проявляются только при масштабном применении, и никакой процесс обучения не может охватить всё.
- Генерализация может отличаться от того, что мы задумывали. Модель может выдавать «правильные» результаты во время обучения по непреднамеренным причинам, что может привести к нежелательному поведению в новых ситуациях, отличающихся от тех, что наблюдались при обучении. Такие методы, как согласование на основе рассуждений (deliberative alignment), помогают, но они не являются полноценным решением.
В более широком смысле, тот факт, что Model Spec описывает широкий спектр желаемого поведения, не означает существования единого метода для обучения всему этому. Различные аспекты поведения — следование инструкциям, границы безопасности, индивидуальность, откалиброванное выражение неуверенности и многое другое — часто требуют разных подходов и имеют разные типы сбоев. Model Spec помогает сделать предполагаемое поведение более понятным и открытым для критики, но его качественная реализация остается одновременно и искусством, и активной областью исследований.
Одновременно с этой публикацией мы выпускаем Model Spec Evals — набор оценок на основе сценариев, который пытается охватить как можно больше утверждений из Model Spec с помощью небольшого числа репрезентативных примеров. Это помогает нам отслеживать, в каких моментах поведение модели и Model Spec могут расходиться, а также проверять, интерпретируют ли модели Model Spec так, как мы задумывали. Эти оценки являются лишь частью более широкой стратегии тестирования, которая также включает в себя более целенаправленные оценки по многим измерениям поведения, включая конкретные аспекты безопасности, правдивость и угодничество (sycophancy), индивидуальность и стиль, а также возможности.
График соответствия моделей OpenAI требованиям Model Spec по разделам с течением времени. Подробную информацию об оценках и способах их интерпретации см. в сопутствующей статье в блоге. Вкратце, мы считаем, что эти результаты отражают подлинные и масштабные улучшения в согласовании моделей с течением времени, хотя они также отражают небольшой эффект, связанный с оценкой более старых моделей по более свежим правилам.
На практике большинство обновлений спецификации обусловлено повторяющимся набором факторов:
- Публичные проблемы и отзывы. Неясности, пограничные случаи или типы сбоев — как в формулировках Model Spec, так и в поведении наших моделей.
- Внутренние проблемы. Закономерности, которые мы наблюдаем в ходе разработки и тестирования, включая двусмысленности, когда разные разумные интерпретации приводят к разному поведению.
- Обновления политики поведения и безопасности. Когда ограничения или обязательства более высокого уровня меняются, спецификация должна четко отражать эту новую структуру.
- Новые возможности и продукты. По мере того как модели получают новые способности, а мы выпускаем новые продукты, мы хотим, чтобы Model Spec не отставала по содержанию и охвату — например, добавляя правила для мультимодальных взаимодействий, автономных агентов и пользователей младше 18 лет.
Каким должно быть качественное содержание спецификации
При написании и пересмотре Model Spec мы руководствуемся несколькими принципами проектирования.
- Ясность и точность. «Будь честным» — хорошая ценность, но не полноценная процедура принятия решений. Model Spec должна обострять разногласия, а не скрывать их за благозвучным языком. Там, где это целесообразно, мы должны явно указывать на потенциальные конфликты между правилами и давать рекомендации или примеры того, как их разрешать. Например, правило «Не лгите» указывает на потенциальный конфликт с правилом «Будьте сердечными», объясняя, что ассистент должен следовать нормам вежливости, но при этом воздерживаться от «ложь во спасение», которые могут перерасти в угодничество и противоречить интересам пользователя.
- Существенные правила. Читатель должен иметь возможность взять реалистичный промпт и получить ответ, который другой читатель безошибочно признает соответствующим правилам или нарушающим их (даже если на границах остаются элементы субъективной оценки).
- Примеры, максимизирующие полезный сигнал при минимальном шуме. Удачные примеры часто имеют решающее значение для разработки качественного обновления спецификации. Примеры должны помогать вникнуть в суть трудностей при описании поведения модели, выводить на поверхность сложные конфликты и занимать четкую позицию относительно того, как их разрешать. Кроме того, они должны служить образцами желаемого тона и стиля, которые бывает трудно передать с помощью обычного текста.
- Устойчивость (робастность). Мы стараемся избегать примеров с посторонней двусмысленностью или сложностью, чтобы основной конфликт и предполагаемое решение были очевидны.
- Согласованность и четкая организация. Мы стремимся к тому, чтобы правила Model Spec были полностью согласованы друг с другом и с нашим видением поведения модели, а общая структура документа была понятной и доступной.
Что впереди
Model Spec — это не утверждение о том, что мы можем записать абсолютно всё, что имеет значение, или что модели всегда будут попадать точно в цель. Это утверждение о том, что предполагаемое поведение достаточно важно, чтобы быть четким, выполнимым и подлежащим пересмотру.
Развивая документ, мы руководствуемся тремя критериями успеха.
- Читаемость (легримость). Люди как внутри OpenAI, так и за её пределами могут формировать точные ожидания относительно поведения и ссылаться на текст, когда поведение модели преподносит сюрпризы.
- Практичность (исполнимость). Model Spec можно использовать для разработки оценок, диагностики инцидентов и принятия последовательных продуктовых решений, а не только для выражения ценностей.
- Пересматриваемость. Model Spec может развиваться по мере того, как мы учимся, не превращаясь при этом в нестабильную, постоянно сдвигающуюся цель.
По мере эволюции моделей и продуктов мы ожидаем, что Model Spec будет расширяться и уточняться в ногу с новыми возможностями и контекстами внедрения. Цель состоит в том, чтобы сделать поведенческую спецификацию последовательной, проверяемой и согласованной с нашей миссией — гарантировать, что искусственный интеллект общего назначения (AGI) принесет пользу всему человечеству.
Автор
Полный текст статьи читайте на OpenAI
