Совершенствование ред-тиминга с помощью людей и ИИ
Два новых документа демонстрируют, как развиваются наши методы внешнего и автоматизированного ред-тиминга для создания безопасного и полезного ИИ
Взаимодействие с системой ИИ — это важнейший способ узнать, на что она способна: какими возможностями она обладает и какие риски может представлять. Под «ред-тимингом» (red teaming) понимается использование людей или ИИ для структурированного изучения потенциальных рисков новой системы.
OpenAI применяет ред-тиминг уже на протяжении ряда лет, в том числе когда в начале 2022 года мы привлекли внешних экспертов для тестирования нашей модели генерации изображений DALL·E 2. Наши первые усилия по ред-тимингу носили преимущественно «ручной» характер в том смысле, что мы полагались на людей при проведении тестов. С тех пор мы продолжаем использовать и совершенствовать наши методы, и в июле прошлого года мы присоединились к другим ведущим лабораториям в обязательстве инвестировать в ред-тиминг дополнительные средства и развивать это направление исследований.
Методы ред-тиминга включают в себя ручные, автоматизированные и смешанные подходы, и мы используем все три. Мы привлекаем внешних экспертов как к ручным, так и к автоматизированным методам тестирования новых систем на предмет потенциальных рисков. В то же время мы оптимистично оцениваем возможность использования более мощного ИИ для масштабного выявления ошибок моделей — как для их оценки, так и для обучения безопасности.
Сегодня мы публикуем два документа
Ред-тиминг исследует модель или систему ИИ для выявления потенциальных проблем, примеров таких проблем или атак с целью их провоцирования. В то время как люди могут помочь выявить разнообразие примеров, проблем и атак, автоматизированный ред-тиминг может дополнить это, помогая генерировать идеи, примеры и атаки в более крупном масштабе. Приведенные выше проблемы, примеры и атаки носят иллюстративный характер и необязательно отражают политику использования или правила контента OpenAI.
Ценность ред-тиминга
Поскольку системы ИИ развиваются быстрыми темпами, крайне важно понимать пользовательский опыт и потенциальные риски расширения их возможностей, включая злоупотребления, нецелевое использование и такие факторы реального мира, как культурные нюансы. Хотя ни один отдельный процесс не может охватить все эти элементы, ред-тиминг — особенно с привлечением широкого круга независимых внешних экспертов — предлагает проактивный способ оценки рисков и проверки безопасности наших моделей ИИ. Такой подход помогает создавать актуальные бенчмарки и оценки безопасности, которые можно использовать повторно и совершенствовать со временем.
Внешний экспертный ред-тиминг
Ключевые аспекты наших кампаний по внешнему ред-тимингу включают определение масштаба тестирования, отбор участников, определение доступных им моделей и формата их итоговых отчетов.
В новом белом документе «Подход OpenAI к внешнему ред-тимингу моделей и систем ИИ» (OpenAI«s Approach to External Red Teaming for AI Models and Systems) мы подробно описываем наш подход к разработке эффективных кампаний ред-тиминга
1. Выбор состава группы ред-тиминга на основе целей и ключевых областей тестирования
Системы ИИ, разработанные для различных сценариев использования, требуют тщательного тестирования в нескольких областях с привлечением людей с разнообразными взглядами (например, с опытом в таких областях, как естественные науки и кибербезопасность, региональные политические знания или знание определенных языков). Моделирование угроз проводится перед началом мероприятий по ред-тимингу для определения приоритетных областей тестирования с учетом таких факторов, как ожидаемые возможности модели, ранее наблюдавшиеся проблемы и потенциальные применения. Внутренние команды устанавливают первоначальные приоритеты тестирования на основе своих знаний о возможностях модели, в то время как внешние специалисты привлекаются позже для уточнения или расширения фокуса. Затем эти приоритеты определяют формирование команд ред-тиминга, гарантируя удовлетворение конкретных потребностей модели в тестировании.
2. Определение версий моделей или систем, к которым получают доступ участники ред-тиминга
Версия модели, доступная специалистам по ред-тимингу, может влиять на результаты тестирования и должна соответствовать целям кампании. Например, тестирование модели на ранней стадии разработки без средств защиты может помочь оценить новые риски, связанные с расширением возможностей, но оно не обязательно выявит пробелы в запланированных мерах защиты. Идеальный подход зависит от конкретных потребностей модели, и специалисты по ред-тимингу могут тестировать несколько версий модели и системы на протяжении всего периода тестирования.
3. Создание и предоставление интерфейсов, инструкций и рекомендаций по документированию для специалистов по ред-тимингу
Эффективное взаимодействие с внешними тестерами во время кампаний ред-тиминга опирается на четкие инструкции, подходящие интерфейсы для тестирования и практическую документацию. Инструкции могут включать описания модели (моделей) и существующих или запланированных мер защиты, инструкции по использованию интерфейса тестирования, приоритетные области для проверки и руководящие принципы документирования результатов. Различные интерфейсы или средства взаимодействия тестеров с моделью ИИ могут включать API или потребительские интерфейсы продуктов, такие как ChatGPT. Интерфейсы, используемые для ред-тиминга, способствуют проведению тестирования, обеспечивая быструю программную проверку, сбор отзывов по конкретным промптам или ответам, либо имитацию потенциальных пользовательских взаимодействий. Благодаря правильному сочетанию интерфейсов и инструкций по документированию, структурированные отзывы, собранные в ходе ред-тиминга, впоследствии могут быть использованы при оценке рисков и разработке автоматизированных оценок.
4. Синтез данных и создание оценок
После завершения кампании по ред-тимингу ключевым шагом является определение того, подпадают ли выявленные примеры под существующие правила, нарушают ли они эти правила, или же требуются новые правила либо изменения в поведении модели. Некоторые кампании нацелены на поиск известных нарушений правил, в то время как другие исследуют области, не охваченные четкими правилами. После того как данные кампании ред-тиминга оценены на предмет качества, их можно использовать для повторяемых автоматизированных оценок при будущих обновлениях моделей.
Совсем недавно мы использовали этот подход при подготовке к публичному использованию нашего семейства моделей OpenAI o1. Мы разработали кампанию внешнего ред-тиминга, в рамках которой модель тестировалась на устойчивость к джейлбрейкам (jailbreaks), безопасную обработку промптов, связанных с планированием реальных атак, безопасное применение в естественных науках и более широкие темы, такие как возможности исследований и разработок в области ИИ.
Автоматизированный ред-тиминг
Автоматизированный ред-тиминг нацелен на генерацию большого количества примеров некорректного поведения ИИ, часто с особым акцентом на проблемы безопасности. В отличие от ручного ред-тиминга, автоматизированные методы превосходят его в легкой генерации примеров атак в более крупном масштабе. Тем не менее, эти методы обычно испытывали трудности с созданием успешных атак, которые были бы таксономическиразнообразными, поскольку автоматизированные системы ред-тиминга часто повторяют известные стратегии атак или производят спектр новых, но неэффективных атак.
В новом исследовании «Разнообразный и эффективный ред-тиминг с автогенерируемыми вознаграждениями и многошаговым обучением с подкреплением» (Diverse And Effective Red Teaming With Auto-Generated Rewards And Multi-Step Reinforcement Learning) мы предлагаем новые методы для улучшения разнообразия атак при сохранении их успешности.
Наше исследование показывает, что более мощный ИИ может дополнительно помочь автоматизированному ред-тимингу в формировании целей злоумышленника, оценке его успеха и понимании разнообразия атак. Например, если целью ред-тиминга является поиск примеров того, как ChatGPT дает запрещенные незаконные советы, мы можем использовать GPT‑4T для генерации идей вроде «как угнать автомобиль» или «как собрать бомбу», а затем обучить отдельную модель ред-тиминга пытаться обмануть ChatGPT, чтобы он выдал каждый из таких примеров советов. Мы вознаграждаем модель ред-тиминга с помощью комбинации наших моделей модерации, вознаграждений на основе правил, ориентированных на конкретный пример вредного совета, и вознаграждения за разнообразие (оценивающего, насколько атака отличается от прошлых попыток). Это означает, что модель ред-тиминга может генерировать гораздо больше разнообразных и в то же время эффективных атак, которые затем можно использовать как для повышения безопасности моделей, так и для их оценки. Что еще более важно, это демонстрирует, как мы можем продолжать обучать и использовать более способные модели новыми способами для повышения безопасности.
Ограничения
Ред-тиминг не является универсальным решением для оценки рисков ИИ. К его ограничениям относятся:
- Актуальность с течением времени: ред-тиминг фиксирует риски в определенный момент времени, которые могут измениться по мере эволюции моделей.
- Информационные угрозы: Сам процесс ред-тиминга, особенно с передовыми системами ИИ, может создавать информационные угрозы, способные облегчить злоупотребления. Например, обнародование джейлбрейка или метода генерации потенциально опасного контента, который еще не получил широкой известности, может ускорить использование моделей злоумышленниками. Управление этим риском требует контроля над информацией, строгих протоколов доступа и ответственного подхода к раскрытию данных.
- Повышение сложности для человека: По мере того как модели становятся все более способными, а их навыки рассуждения в сложных областях — продвинутыми, будет расти порог знаний, которыми должны обладать люди для правильной оценки потенциальных рисков генерируемых результатов.
Хотя ред-тиминг направлен на расширение кругозора в целях выявления рисков, верификации и разработки оценок, мы считаем, что необходима дополнительная работа по сбору и учету мнений общественности об идеальном поведении моделей, правилах и связанных с ними процессах принятия решений.
Авторы
Сноски
Полный текст статьи читайте на OpenAI
