Оценка наихудших пограничных рисков языковых моделей с открытыми весами

Open_Model_ResearchPaper_1x1.png?w=1600&
Читать документ

Аннотация

В этой работе мы исследуем наихудшие пограничные риски выпуска gpt-oss. Мы представляем метод злонамеренной донастройки (MFT — malicious fine-tuning), в рамках которого мы пытаемся выявить максимальные возможности путем донастройки gpt-oss для достижения максимальной эффективности в двух областях: биологии и кибербезопасности. Для максимизации биологического риска (биориска) мы отбираем задачи, связанные с созданием угроз, и обучаем gpt-oss в среде обучения с подкреплением (RL), использующей веб-браузинг. Для максимизации рисков кибербезопасности мы обучаем gpt-oss в среде агентного кодинга для решения задач CTF (Capture the Flag). Мы сравниваем эти модели MFT с языковыми моделями с открытыми и закрытыми весами в рамках оценки пограничных рисков. По сравнению с пограничными моделями с закрытыми весами, MFT gpt-oss уступает OpenAI o3 — модели, чей уровень возможностей ниже порогового значения High в рамках программы Preparedness для биорисков и кибербезопасности. По сравнению с моделями с открытыми весами, gpt-oss может незначительно увеличивать биологические возможности, но существенно не раздвигает границы возможностей. В совокупности эти результаты повлияли на наше решение выпустить модель, и мы надеемся, что наш подход MFT сможет послужить полезным руководством для оценки вреда от будущих релизов с открытыми весами.

Автор

Эрик Уоллес (Eric Wallace), Оливия Уоткинс (Olivia Watkins), Майлз Ван (Miles Wang), Кай Чен (Kai Chen), Крис Кох (Chris Koch)

Полный текст статьи читайте на OpenAI