Оценка наихудших пограничных рисков языковых моделей с открытыми весами

Аннотация
В этой работе мы исследуем наихудшие пограничные риски выпуска gpt-oss. Мы представляем метод злонамеренной донастройки (MFT — malicious fine-tuning), в рамках которого мы пытаемся выявить максимальные возможности путем донастройки gpt-oss для достижения максимальной эффективности в двух областях: биологии и кибербезопасности. Для максимизации биологического риска (биориска) мы отбираем задачи, связанные с созданием угроз, и обучаем gpt-oss в среде обучения с подкреплением (RL), использующей веб-браузинг. Для максимизации рисков кибербезопасности мы обучаем gpt-oss в среде агентного кодинга для решения задач CTF (Capture the Flag). Мы сравниваем эти модели MFT с языковыми моделями с открытыми и закрытыми весами в рамках оценки пограничных рисков. По сравнению с пограничными моделями с закрытыми весами, MFT gpt-oss уступает OpenAI o3 — модели, чей уровень возможностей ниже порогового значения High в рамках программы Preparedness для биорисков и кибербезопасности. По сравнению с моделями с открытыми весами, gpt-oss может незначительно увеличивать биологические возможности, но существенно не раздвигает границы возможностей. В совокупности эти результаты повлияли на наше решение выпустить модель, и мы надеемся, что наш подход MFT сможет послужить полезным руководством для оценки вреда от будущих релизов с открытыми весами.
Автор
Полный текст статьи читайте на OpenAI
