Иерархия инструкций: обучение больших языковых моделей (LLM) приоритезации привилегированных инструкций

Читать статью
An abstract image with soft, flowing brushstrokes in warm beige, light brown, and pale blue. The smooth blending of colors creates a calming, fluid composition, evoking a sense of movement and serenity.

Аннотация

Современные LLM подвержены инъекциям промптов, взломам (джейлбрейкам) и другим атакам, которые позволяют злоумышленникам перезаписывать исходные инструкции модели собственными вредоносными запросами. В данной работе мы утверждаем, что одна из основных уязвимостей, лежащих в основе этих атак, заключается в том, что LLM часто придают системным промптам (например, тексту от разработчика приложения) тот же приоритет, что и тексту от ненадежных пользователей и третьих лиц. Для решения этой проблемы мы предлагаем иерархию инструкций, которая явно определяет, как модели должны вести себя при конфликте инструкций с разным приоритетом. Затем мы предлагаем метод генерации данных для демонстрации такого поведения следования иерархическим инструкциям, который учит LLM выборочно игнорировать инструкции с более низким уровнем привилегий. Мы применяем этот метод к GPT-3.5, показывая, что он радикально повышает надежность — даже для типов атак, не встречавшихся во время обучения — при минимальном ухудшении стандартных возможностей.

Авторы

Эрик Уоллес (Eric Wallace)

Кай Сяо (Kai Xiao)

Реймар Лейке (Reimar Leike)

Лильян Венг (Lilian Weng)

Йоханнес Хайдеке (Johannes Heidecke)

Алекс Бойтель (Alex Beutel)

Полный текст статьи читайте на OpenAI