Разработка ядерных защитных мер для ИИ на основе государственно-частного партнерства

Developing nuclear safeguards for AI through public-private partnership

Ядерные технологии по своей сути имеют двойное назначение: те же физические принципы, которые питают ядерные реакторы, могут быть использованы не по назначению для создания оружия. По мере того как модели ИИ становятся все более мощными, нам необходимо внимательно следить за тем, не смогут ли они предоставить пользователям опасные технические знания способом, который может угрожать национальной безопасности.

Информация, касающаяся ядерного оружия, особенно чувствительна, что затрудняет оценку этих рисков для частной компании, действующей в одиночку. Вот почему в апреле прошлого года мы начали партнерство с Национальным управлением по ядерной безопасности (NNSA) Министерства энергетики США (DOE) для оценки наших моделей на предмет рисков распространения ядерного оружия и продолжаем работать с ними над этими оценками.

Теперь мы выходим за рамки оценки рисков и создаем инструменты, необходимые для их мониторинга. Совместно с NNSA и национальными лабораториями DOE мы разработали классификатор — систему ИИ, которая автоматически классифицирует контент, — способную с точностью 96% в ходе предварительного тестирования отличать ядерные разговоры, вызывающие опасения, от безобидных.

Мы уже внедрили этот классификатор для трафика Claude в рамках нашей более масштабной системы выявления случаев ненадлежащего использования наших моделей. Данные раннего развертывания показывают, что классификатор отлично работает с реальными разговорами в Claude.

Мы поделимся нашим подходом с Frontier Model Forum, отраслевой организацией для компаний, занимающихся передовыми разработками в области ИИ, в надежде, что это партнерство сможет послужить образцом, который любой разработчик ИИ сможет использовать для внедрения аналогичных защитных мер в сотрудничестве с NNSA.

Наряду с конкретной важностью защиты передовых моделей ИИ от нецелевого ядерного использования, это первое в своем роде начинание демонстрирует силу государственно-частного партнерства. Эти партнерства объединяют взаимодополняющие сильные стороны промышленности и государства для непосредственного противодействия рискам, делая модели ИИ более надежными и заслуживающими доверия для всех их пользователей.

Подробную информацию о нашем партнерстве с NNSA и разработке защитных мер можно найти в нашем блоге red.anthropic.com, посвященном исследованиям команды Anthropic Frontier Red Team (а также иногда других команд Anthropic) о том, что передовые модели ИИ означают для национальной безопасности. Нажмите здесь, чтобы прочитать подробнее.

Подпишитесь на рассылку Frontier Red Team

Получайте обновления о наших последних исследованиях и выводах в области тестирования на проникновение и безопасность.

Полный текст статьи читайте на Anthropic