Методология анализа рисков для больших языковых моделей синтеза кода

Читать статью
A Hazard Analysis Framework For Code Synthesis Large Language Models

Аннотация

Codex, большая языковая модель (LLM), обученная на различных кодовых базах, превосходит предыдущие современные аналоги по своей способности синтезировать и генерировать код. Несмотря на то что Codex предоставляет множество преимуществ, модели, способные генерировать код в таком масштабе, имеют существенные ограничения, проблемы соответствия принципам безопасности (alignment), потенциал для злонамеренного использования, а также способны ускорять прогресс в технических областях, которые сами по себе могут оказывать дестабилизирующее воздействие или нести риски нецелевого применения. Тем не менее, подобные последствия для безопасности пока до конца не изучены. В этой статье мы описываем методологию анализа рисков, разработанную в OpenAI для выявления опасностей и угроз безопасности, которые внедрение таких моделей, как Codex, может представлять в техническом, социальном, политическом и экономическом аспектах. В основе анализа лежит принципиально новый подход к оценке, который определяет возможности передовых методов генерации кода по сравнению со сложностью и выразительностью промптов-спецификаций, а также их способность понимать и выполнять их по сравнению с человеческими возможностями.

Авторы

Хейди Хлааф, Памела Мишкин, Джошуа Ахиам, Гретхен Крюгер, Майлз Брундаж

Полный текст статьи читайте на OpenAI