Разработка моделей в эпоху киберкритических возможностей

index-pacing-model-development-cyber-cap

За последние несколько недель два события подчеркнули возрастающие риски, связанные со всё более мощными системами ИИ: инцидент с участием OpenAI и Hugging Face, а также предварительные данные о том, что одна из наших будущих моделей, Astra, может достичь порога критических возможностей в сфере кибербезопасности в соответствии с нашим Фреймворком готовности (Preparedness Framework). В совокупности эти события в сочетании с быстрым прогрессом в наших внутренних исследованиях придали дополнительную срочность нашей работе по усилению средств мониторинга, выравнивания (alignment) и защиты на всех этапах процесса обучения.

По мере того как модели становятся более способными, риски, связанные с их разработкой и внутренним тестированием, также растут. Наши стандарты мониторинга, выравнивания и безопасности должны опережать эти риски. Мы хотели уделить столько времени, сколько необходимо для соблюдения этих стандартов, поэтому мы временно замедлили темпы масштабирования. Это включало двухнедельную паузу в обучении с подкреплением (RL) наших новейших моделей, предназначенных для развертывания, пока мы дополнительно укрепляли и тестировали на проникновение (red-teaming) наши исследовательские среды, а также расширяли охват наших систем мониторинга. Наш крупнейший запланированный передовой запуск RL остается на паузе, пока мы проводим мелкомасштабное обучение и оценку для анализа поведения модели, проверки средств защиты и сбора дополнительных подтверждений выравнивания перед продолжением работ.

Выравнивание (alignment) — работа по обеспечению того, чтобы системы ИИ вели себя так, как задумано, и реагировали на контроль со стороны человека — уже давно находится в центре нашей исследовательской программы. Теперь мы требуем более весомых доказательств выровненного поведения на протяжении всего процесса обучения, опираясь на уже проводимые исследования и оценки. Поддержание выравнивания всё более мощных систем — это вызов, с которым придется столкнуться всей отрасли. Сигналы, которые мы получаем от прогресса в разработке будущих моделей, ясно показывают, что нам нужен более широкий подход, который опирается на текущий Фреймворк готовности и выходит за его рамки.

Мы считаем важным быть прозрачными в отношении того, как меняется наш подход. Ниже мы описываем изменения, которые мы уже внесли в наши исследовательские процессы и инфраструктуру, а также работу, которая всё еще продолжается.

Укрепление средств защиты для более мощных моделей

Наш подход к разработке более мощных моделей опирается на три взаимодополняющих средства защиты:

  1. Мониторинг, который обнаруживает вызывающее опасения поведение и позволяет нам реагировать на него.
  2. Выравнивание, которое снижает вероятность вредных или несанкционированных действий.
  3. Меры безопасности, которые ограничивают то, к чему системы ИИ могут получить доступ или на что могут повлиять.

Мы ожидаем, что в скором времени модели будут управлять большей частью работ по обеспечению безопасности, включая защиту от других моделей. Это позволит всем трем средствам защиты масштабироваться вместе с возможностями моделей, что мы считаем критически важным.

Мы применяем эти средства защиты как в исследованиях, так и при развертывании, адаптируя их к возможностям каждой модели, операционной среде и уровню риска.

Обеспечение безопасности наших исследовательских сред

По мере того как передовые модели обретают более мощные кибернетические возможности, мы повышаем стандарты безопасности для сред, в которых мы их обучаем и оцениваем. Соответствие этим стандартам потребовало значительной инженерной работы и привело к большим затратам и задержкам в передовых исследованиях. Сразу после инцидента с OpenAI и Hugging Face* мы приостановили вывод (inference) передовых моделей в исследовательских кластерах для задач, которые могли выполнять код или использовать инструменты с доступом в интернет. Мы достаточно быстро восстановили более ограниченный и безопасный путь для выполнения кода, а затем проработали каждую рабочую нагрузку индивидуально, чтобы определить, можно ли ее безопасно возобновить. Некоторые исследовательские задачи возобновились под управлением этих новых средств контроля, в то время как другие потребовали дополнительных изменений.

В течение последующих недель мы определили и начали внедрять более строгие требования безопасности для передовых исследовательских задач. Например:

  • Изоляция рабочих нагрузок: Теперь мы требуем более надежной изоляции («песочниц») для задач, которые выполняют сгенерированный моделью или иной ненадежный код. Это также относится к программному обеспечению, которое может быть скомпрометировано при обработке результатов работы модели.
  • Сетевая изоляция: Мы внедрили дополнительные средства контроля для изоляции более рискованных и ненадежных рабочих нагрузок от интернета. Мы разработали эти средства контроля таким образом, чтобы единичный взлом рабочей нагрузки или вспомогательной службы сам по себе не позволял получить несанкционированный доступ к интернету или другим внутренним сетям.
  • Непрерывное тестирование безопасности: Мы переконфигурировали нашу среду, чтобы удалить потенциально уязвимые общие службы, сократить постоянные привилегии и улучшить границы безопасности и доверия. Мы также улучшаем наши возможности по сбору и мониторингу журналов безопасности. Наконец, мы инвестируем в автоматизацию с использованием наших моделей для непрерывного тестирования этих границ на устойчивость к смоделированным атакам.

В совокупности эти средства контроля обеспечивают эшелонированную защиту и помогают оградить нашу исследовательскую среду от атак. Сегодня мы требуем соблюдения самого строгого уровня мер безопасности для задач с участием Astra или кибермоделей, поскольку мы установили, что модели Astra могут обладать критическим уровнем кибервозможностей. Эти средства защиты также распространяются на все остальные задачи, связанные с кибербезопасностью.

Хотя обучение и оценка некоторых версий Astra соответствуют этим требованиям, значительное число рабочих нагрузок остается на паузе до тех пор, пока они не будут полностью мигрированы и усовершенствованы в соответствии с новой планкой безопасности. В первую очередь мы отдаем приоритет миграции задач по обеспечению безопасности и выравнивания в эти новые среды.

Расширение мониторинга цепочки рассуждений (chain-of-thought)

Мониторинг уже давно является важной частью процесса разработки наших моделей, включая мониторинг внутренних агентов написания кода и сеансов большой длительности. Наши усилия по мониторингу были особенно сосредоточены на внутреннем развертывании передовых моделей и передовых обучающих запусках RL, которые мы считали наиболее рискованными задачами, поскольку они могут сочетать продвинутые возможности моделей с доступом к инструментам, конфиденциальным системам и внутренним или внешним сетям. Они не применялись ко всем запускам вывода и обучения с использованием инструментов. Мы пересмотрели и расширили наш подход в рамках новой системы мониторинга.

Эта новая система мониторинга является многоэтапной и начинается с классификаторов активации (детекторов, которые проверяют внутреннюю активность модели), запускаемых для каждого выбранного токена и передающих потенциальные проблемы на рассмотрение всё более сложным автоматизированным системам расследования, требующим больших вычислительных ресурсов. Эти системы проверяют действия инструментов, доступные рассуждения и всю последовательность активности на предмет несанкционированного доступа, кражи данных, деструктивного поведения и попыток обойти средства защиты. Наша цель — выпустить оповещение в течение 30 минут после того, как наша система мониторинга зафиксирует вызывающую опасения активность. Если система мониторинга выявляет вероятное нарушение критической границы безопасности, она генерирует приоритетное оповещение. В нашей текущей реализации группы безопасности и исследований получают пейджерные уведомления. Если они не могут в течение 30 минут однозначно определить, что срабатывание является ложноположительным, от этих команд ожидается приостановка активности.

Этот мониторинг обязателен для всех этапов обучения RL и оценок с использованием инструментов для моделей с возможностями Sol или выше. Как только 7 августа мы определили, что Astra может обладать критическими кибервозможностями, мы добавили дополнительное требование мониторинга для всех задач вывода Astra с использованием инструментов (а не только для обучения RL и оценок).

Эти средства защиты требуют значительных вычислительных мощностей. Согласно нашим текущим оценкам, накладные расходы на мониторинг составляют примерно 20% от объема вычислений, затрачиваемых на мониторинг вывода, хотя стоимость существенно различается в зависимости от задач обучения и оценки. Мы поделимся более подробной информацией об этой системе в предстоящей публикации в блоге.

Развитие исследований в области выравнивания

Исследования в области выравнивания имеют центральное значение для нашей миссии. Наша миссия заключается в том, чтобы искусственный общий интеллект приносил пользу всему человечеству. По мере того как модели приобретают продвинутые возможности (например, способность совершать кибератаки) и работают в более сложных средах, невыровненное поведение, такое как хакерство наград (reward hacking — поиск способов получить высокие награды во время обучения без фактического достижения предполагаемого результата), обман или несанкционированный доступ, будет создавать всё более серьезные риски.

Для запусков RL на наиболее мощных моделях мы теперь применяем наши основные методы выравнивания на большем количестве этапов процесса обучения. Это включает в себя улучшение моделей вознаграждения для более эффективного обнаружения и предотвращения небезопасного поведения в различных задачах и средах; обучение моделей большей честности в отношении своих действий, возможностей и ограничений;, а также сокращение поведения, которое эксплуатирует слабости в наградах, оценщиках, инструментах или надзоре. Мы также увеличиваем охват обучения для поведения, которое может нанести вред при взаимодействии моделей с внешними системами или ресурсами.

Мы продолжаем активно инвестировать в исследования по выравниванию, расширять охват оценок и использовать полученные знания для оптимизации обучения и средств защиты. Мы планируем рассказать значительно больше о наших исследованиях в области выравнивания в ближайшем будущем, в том числе о том, что мы узнаем о поведении моделей и о любых новых проблемах, с которыми мы сталкиваемся.

Что дальше

Мы будем развивать наш Фреймворк готовности, чтобы объединить эти средства защиты в процессах обучения и развертывания, а также чтобы лучше отражать возможности будущих моделей и среды, в которых они функционируют. Разработка методов, способных масштабироваться вместе с этими возможностями, потребует устойчивых инвестиций в безопасность на базе моделей, более эффективного мониторинга и постоянного прогресса в исследованиях по выравниванию. Мы намерены привлекать внешние организации и делиться бóльшим объемом получаемых знаний по мере развития нашего подхода.

Возможности передовых моделей стремительно растут. Наша способность понимать их, выравнивать и обеспечивать их безопасность должна опережать этот рост.

*Мы опубликуем технический отчет о наших наработках в ближайшие недели.

Автор

OpenAI

Полный текст статьи читайте на OpenAI