Доводы в пользу адресного регулирования

Всё более мощные системы искусственного интеллекта способны ускорить научный прогресс, открыть новые методы лечения и способствовать экономическому росту. Однако наряду с поразительными новыми возможностями эти системы несут в себе и значительные риски. Правительствам необходимо срочно принять меры в сфере политики ИИ в ближайшие восемь месяцев. Окно возможностей для проактивного предотвращения рисков стремительно закрывается.
Разумное и узконаправленное регулирование позволит нам получить лучшее из обоих миров: извлечь выгоду из ИИ и одновременно снизить риски. Промедление же может привести к худшему сценарию: плохо продуманному, импульсивному регулированию, которое тормозит прогресс и при этом неэффективно предотвращает риски.
В этой статье мы предлагаем принципы того, как государства могут существенно снизить катастрофические риски, поддерживая при этом инновации в процветающих научных и коммерческих секторах сферы ИИ.
Срочность
За последний год системы ИИ добились впечатляющих успехов в математике, рассуждениях на уровне выпускников вузов, написании компьютерного кода и во многих других областях. Внутри ИИ-компаний мы видим непрерывный прогресс в отношении пока еще не анонсированных систем и результатов. Эти достижения открывают множество полезных возможностей. Но прогресс в тех же базовых областях несет в себе потенциал для разрушительного применения — будь то злонамеренное использование ИИ в таких сферах, как кибербезопасность или биология, или случайное либо автономное поведение самой системы ИИ.
В области кибервозможностей модели быстро продвинулись в решении широкого спектра задач по написанию кода и оценке кибератак. В задаче программной инженерии SWE-bench модели улучшили свои показатели: если раньше они могли решить 1,96% тестового набора реальных проблем программирования (Claude 2, октябрь 2023 г.), то теперь — 13,5% (Devin, март 2024 г.) и 49% (Claude 3.5 Sonnet, октябрь 2024 г.). Наша внутренняя команда передового тестирования (Frontier Red Team) обнаружила, что текущие модели уже могут помогать в решении широкого круга задач, связанных с кибератаками, и мы ожидаем, что следующее поколение моделей, способных планировать долгосрочные многоэтапные задачи, окажется еще эффективнее.
Что касается потенциала ИИ в усугублении рисков, связанных с ОМП (химическим, биологическим, радиологическим и ядерным оружием), Институт безопасности ИИ Великобритании протестировал ряд моделей от представителей индустрии (включая Anthropic) и пришел к выводу, что:
…модели могут использоваться для получения экспертных знаний в области биологии и химии. В ряде случаев ответы на научные вопросы не уступали ответам экспертов с докторской степенью (PhD).
За последний год системы ИИ добились колоссального прогресса в понимании точных наук. Широко используемый бенчмарк GPQA продемонстрировал рост результатов в своем самом сложном разделе: с 38,8% на момент его выпуска в ноябре 2023 года до 59,4% в июне 2024 года (Claude 3.5 Sonnet) и 77,3% в сентябре (OpenAI o1; результаты экспертов-людей составляют 81,2%). Наша команда Frontier Red Team также зафиксировала постоянный прогресс в возможностях, связанных с ОМП. На данный момент прирост эффективности от использования передовой модели по сравнению с существующим программным обеспечением и интернет-инструментами все еще относительно мал, однако он стремительно растет. По мере совершенствования возможностей моделей потенциал их неправомерного использования, вероятнее всего, продолжит развиваться по аналогичной траектории.
Около года назад мы предупреждали, что передовые модели могут представлять реальные угрозы в сферах кибербезопасности и ОМП в течение 2–3 лет. Основываясь на описанном выше прогрессе, мы считаем, что теперь мы подошли к таким рискам значительно ближе. В скором времени потребуется точечное и аккуратное регулирование.
Год действия Политики ответственного масштабирования Anthropic
Борьба с катастрофическими рисками систем ИИ сопряжена с огромной неопределенностью. Мы видим первые признаки угроз, которые могут стать серьезными в ближайшем будущем, но мы не знаем точно, когда именно возникнут реальные опасности. Мы хотим провести необходимую подготовку заблаговременно.
В Anthropic мы стараемся справляться с этой задачей с помощью нашей Политики ответственного масштабирования (RSP) — адаптивной структуры для выявления, оценки и смягчения катастрофических рисков. Первый принцип RSP заключается в ее соразмерности: строгость наших мер безопасности и защиты возрастает пропорционально достижению ИИ-системами определенных «порогов возможностей». Структура «если-то» требует применения мер безопасности, но только тогда, когдамодели становятся достаточно развитыми, чтобы этого требовать.
Вторая ключевая идея заключается в том, что RSP должна быть итеративной: мы регулярно измеряем возможности наших моделей и переосмысливаем наши подходы к безопасности в зависимости от того, как развиваются технологии.
Компания Anthropic внедрила официальную RSP еще в сентябре 2023 года (и недавно выпустила обновленную версию), а другие лаборатории передовых моделей в разной степени приняли аналогичные планы.
RSP выполняет множество полезных функций:
- Она увеличивает инвестиции разработчика в компьютерную безопасность и оценку безопасности. И безопасность, и оценочные тесты обычно создаются уже после возникновения проблем, но RSP публично обязывает разработчика развивать и обеспечивать ресурсами эти направления заблаговременно. В Anthropic такие команды, как «Безопасность», «Доверие и безопасность» (Trust & Safety), «Интерпретируемость» (Interpretability) и Frontier Red Team, были вынуждены наращивать темпы найма, чтобы иметь реальные шансы выполнить требования безопасности, установленные нашей RSP. При правильном внедрении RSP формируют организационную структуру и приоритеты. Они становятся ключевой частью дорожной карты продуктов, а не просто политикой на бумаге;
- RSP служит инструментом, который заставляет разработчиков детально прорабатывать риски и модели угроз. Такие модели обычно довольно абстрактны, но RSP заставляет их напрямую пересекаться с повседневной деятельностью компании, вынуждая разработчиков делать их максимально конкретными, обоснованными и регулярно переоценивать их со временем;
- Наличие RSP побуждает разработчиков быть прозрачными в отношении своей компьютерной безопасности и методов предотвращения злоупотреблений. Наша RSP обязывает нас документировать изнутри наши выводы и рекомендации относительно внедренных нами средств защиты. Мы также заметили, что наша RSP естественным образом породила большую часть той содержательной работы, которая была необходима нам для выполнения добровольных обязательств, таких как Добровольные обязательства Белого дома по ИИ и обязательства, принятые на Саммите по безопасности ИИ в Блетчли-Парке.
Наша Политика ответственного масштабирования не идеальна, но по мере того, как мы неоднократно развертывали модели на ее основе, у нас получается все лучше обеспечивать ее бесперебойную работу и одновременно тестировать риски. Несмотря на необходимость итераций и корректировки курса, мы глубоко убеждены, что RSP — это жизнеспособная политика, которой ИИ-компании могут успешно следовать, оставаясь при этом конкурентоспособными на рынке.
Механизмы, подобные RSP, представляют собой эффективный и практичный способ борьбы с серьезными рисками систем ИИ, и они должны быть добровольно приняты всей отраслью. Тем не менее, подлежащее исполнению регулирование также важно, поскольку общество потребует гарантий того, что компании, занимающиеся искусственным интеллектом, выполняют свои обещания.
Политики ответственного масштабирования и регулирование ИИ
RSP не предназначены в качестве замены регулирования, скорее они служат его прототипом. Основываясь на нашем опыте работы с RSP, мы считаем, что для эффективного регулирования ИИ ключевыми являются три элемента:
- Прозрачность. В настоящее время у общественности и законодателей нет возможности проверить соблюдение какой-либо ИИ-компанией своей RSP (или аналогичного плана), равно как и результаты тестов, проводимых в ее рамках. Простым и разумным шагом является требование к компаниям иметь и публиковать политики, подобные RSP, с общим описанием порогов их возможностей и связанных с ними защитных мер, которые срабатывают при достижении моделью этих порогов. Компании также должны быть обязаны публиковать набор оценок рисков для каждого нового поколения систем ИИ, чтобы создать общедоступный архив рисков систем ИИ и передового опыта по их смягчению. Наконец, должен существовать некий механизм проверки достоверности этих заявлений.
- Стимулирование лучших практик безопасности и защищенности. Сама по себе прозрачность не гарантирует надежности политик: компании могли бы просто декларировать крайне слабые стандарты безопасности и защиты. Регулирование ИИ должно также стимулировать компании разрабатывать RSP, которые действительно эффективны в предотвращении катастроф. Существует ряд возможных механизмов для этого, каждый из которых имеет свои плюсы и минусы. Например, регуляторы могли бы определять модели угроз, которым должны соответствовать RSP (исходя из некоторых стандартов разумности), оставляя детали на усмотрение компаний. Или они могли бы просто указать стандарты, которым должна отвечать RSP. Правительство также может поощрять «гонку за лидерство» в области RSP, запрашивая и сравнивая их, перенимая возникающие лучшие практики и привлекая компании к ответственности, если их RSP явно не дотягивают до планки, установленной этими практиками. Наконец, существует множество возможных механизмов косвенного стимулирования безопасных практик. Мы не уверены в отношении точного механизма, но мы твердо убеждены, что любой такой механизм должен быть гибким: технология развивается стремительно, поэтому регуляторным процессам важно учиться на лучших практиках по мере их эволюции, а не оставаться статичными.
- Простота и целенаправленность. Какое бы регулирование мы ни приняли, оно должно быть максимально точечным. Оно не должно налагать ненужные обременения или правила, не имеющие отношения к делу. Одно из худших событий, которые могут произойти с идеей предотвращения катастрофических рисков, — это появление связи между регулированием, необходимым для предотвращения угроз, и обременительными или нелогичными правилами. Любой законопроект или закон также должен быть простым для понимания и реализации: сложность порождает путаницу и затрудняет прогнозирование того, что произойдет на практике.
Существует множество различных подходов, которые могут соответствовать этим трем критериям; мы не привязаны к какому-то одному конкретному. Вместо этого мы прагматично заинтересованы в поиске разумного предложения, которое сможет поддержать критическая масса заинтересованных сторон.
Важность сделать всё правильно — и как можно скорее
Крайне важно, чтобы в следующем году политические деятели, индустрия ИИ, защитники безопасности, гражданское общество и законодатели работали совместно над созданием эффективной нормативно-правовой базы, которая отвечает вышеуказанным условиям и устраивает широкий круг заинтересованных сторон. В США это в идеале должно произойти на федеральном уровне, хотя срочность может потребовать разработки таких норм отдельными штатами. То же самое относится и к другим правительствам по всему миру, которые одновременно рассматривают вопросы регулирования ИИ.
Эта нормативно-правовая база не будет идеальной, и мы осознаем, что эффективные правила разработать очень сложно. Но сделать это правильно необходимо для реализации преимуществ ИИ и минимизации его рисков.
Часто задаваемые вопросы (FAQ):
Ниже мы отвечаем на некоторые вопросы, которые мы слышали от тех, кто скептически относится к любому регулированию ИИ или считает, что оно должно принимать другую форму. Некоторые из них развивают мысли, высказанные нами выше.
В: Должно ли регулирование в США осуществляться на уровне штатов, федеральном уровне или представлять собой их комбинацию?
О: Калифорния уже предпринимала одну попытку принять закон на эту тему и добилась значительного прогресса посредством законопроекта SB 1047 (Закон о безопасных и надежных инновациях в сфере передовых моделей искусственного интеллекта) — хотя в целом мы оценивали его положительно, он был несовершенен и не смог заручиться поддержкой критической массы стейкхолдеров. Мы считаем, что федеральное законодательство стало бы идеальным инструментом для регулирования катастрофических рисков ИИ, поскольку оно было бы единообразным по всей стране и могло бы задействовать опыт федерального правительства в таких рисках, как биотерроризм или кибербезопасность. Это также укрепило бы позиции федерального правительства на переговорах с другими странами. К сожалению, мы опасаемся, что процесс принятия федерального законодательства окажется недостаточно быстрым для реагирования на угрозы в те временные рамки, которые нас беспокоят. Поэтому мы считаем правильной стратегией одновременное движение по нескольким направлениям: федеральное законодательство выступает в роли идеального приоритетного варианта, а регулирование на уровне штатов служит подстраховкой в случае необходимости. Федеральное регулирование также может послужить средством опережения (превентивного запрета) законов штатов.
В: Как насчет регулирования в других странах?
Многие страны (или объединения стран, как в случае с Европейским Союзом) начинают серьезно задумываться о том, как регулировать ИИ. Мы считаем, что сформулированные нами принципы и подход достаточно просты и прагматичны, чтобы быть полезными как за пределами США, так и внутри страны. Мы также рассчитываем, что при наличии у таких политических подходов механизма стандартизации и взаимного признания, обязательное введение определенных общих стандартов безопасности и защиты для компаний, создающих передовой ИИ, в конечном итоге снизит общие издержки ведения бизнеса в различных регионах мира.
В: Почему бы не регулировать ИИ по сценариям использования (use cases), вместо того чтобы пытаться регулировать общие модели?
О: «Регулирование по сценариям использования» не имеет смысла для той формы и формата, в которых предлагаются современные приложения ИИ. На стороне потребителей такие ИИ-продукты, как Claude.ai или ChatGPT, предлагаются пользователям как универсальные продукты, способные писать код, суммировать документы или, в принципе, быть использованными для реализации катастрофических рисков. Из-за такой универсальности имеет больше смысла регулировать фундаментальные свойства базовой модели (например, какие меры безопасности она включает), а не пытаться предвидеть и регулировать каждый вариант использования. В корпоративном сегменте — например, когда разработчики нижнего уровня интегрируют API моделей в свои собственные продукты — различия по сценариям использования могут иметь больше смысла. Тем не менее, во многих, если не в большинстве, корпоративных приложений конечным пользователям все равно предоставляется определенная степень взаимодействия с моделью, что означает, что модель в принципе может быть использована для любой задачи. Наконец, именно базовая модель требует больших объемов финансирования и дефицитных ресурсов (например, графических процессоров на сотни миллионов долларов), поэтому с практической точки зрения ее проще всего отслеживать и регулировать.
В: В этой статье много говорится о злоупотреблениях ОМП и киберрисках. Почему не упоминаются другие, более близкие по времени риски, такие как дипфэйки и защита детей?
Эта статья не претендует на решение каждой возможной проблемы безопасности, порождаемой генеративными системами ИИ. Вместо этого ее цель — сформулировать принципы борьбы с некоторыми типами рисков, которые плохо охватываются действующим регулированием и которые проявляются в ресурсоемких передовых моделях. Мы продолжаем бороться с краткосрочными рисками посредством таких инициатив, как наша работа по защите честности выборов, а также партнерство с такими организациями, как Thorn, в рамках их инициативы «Обеспечение безопасности путем проектирования для генеративного ИИ» (Safety by Design for Generative AI), направленной на защиту детей.
В: Не замедлит ли регулирование инновации и не снизит ли нашу способность конкурировать с геополитическими противниками?
О: Крайне важно, чтобы бремя регулирования ИИ было соразмерным и адаптированным к рискам. Структура RSP призвана делать именно это: она предлагает тесты, которые быстро выявляют модели, не способные нести катастрофические риски, и не подвергают их дальнейшим задержкам. Более того, даже в рамках структуры RSP мы выступаем за высокую гибкость при разработке таких тестов: наука оценки рисков ИИ находится в зачаточном состоянии, и мы не хотим создавать ненужные обременения с помощью негибких правил. Тем не менее, нереалистично ожидать, что регулирование не повлечет за собой буквально никакого бремени. Наша цель должна заключаться в достижении масштабного снижения катастрофических рисков при небольших и управляемых затратах на соблюдение требований (комплаенс). Один из оптимистичных моментов заключается в том, что требования безопасности могут даже ускорить прогресс, если их внедрять аккуратно: наш неоднократный опыт в Anthropic показывает, что усилия в области исследований безопасности приносили неожиданные побочные выгоды для науки об ИИ в целом. Кроме того, компонент безопасности в RSP призван усложнить для внутренних и внешних злоумышленников задачу по взлому компании и краже ее интеллектуальной собственности, что способствует как национальной безопасности, так и инновациям в частном секторе.
В: Не навредит ли регулирование экосистеме открытого исходного кода (open source)?
О: Наша точка зрения заключается в том, что регулирование передовых моделей должно быть сосредоточено на эмпирически измеренных рисках, а не на том, является ли система открытой или закрытой (веса открытые или закрытые). Таким образом, регулирование по своей сути не должно ни отдавать предпочтение, ни ущемлять модели с открытыми весами — за исключением тех случаев, когда единые, эмпирически строгие тесты показывают, что они представляют большую или меньшую степень риска. Если с моделями на базе открытых весов связаны уникальные риски — например, их способность подвергаться произвольной донастройке (fine-tuning) на новых наборах данных, — то регулирование должно быть спроектировано так, чтобы стимулировать разработчиков устранять эти риски, точно так же, как и в случае с моделями с закрытыми весами.
Полный текст статьи читайте на Anthropic
