Безопасность передовых моделей

Поскольку возможности передовых моделей искусственного интеллекта продолжают стремительно расти, обеспечение безопасности этих систем становится критически важным приоритетом. В наших предыдущих публикациях мы уделяли внимание подходу Anthropic к безопасности, а также возможностям и сферам применения Claude. В этой статье мы рассказываем о некоторых шагах, которые мы предпринимаем для обеспечения безопасности разработки наших моделей. Мы надеемся стимулировать общественную дискуссию о том, как все лаборатории могут безопасно развертывать передовые модели, а также поделиться рекомендациями для государственных регуляторов по внедрению надежных практик кибербезопасности. Ниже мы обсуждаем некоторые из наших рекомендаций по передовому опыту в области кибербезопасности, которые компания Anthropic в настоящее время внедряет.
Резюме
Будущие передовые модели ИИ способны перевернуть экономическую и национальную безопасность как внутри отдельных государств, так и на международной арене. Учитывая стратегический характер этой технологии, исследования и модели передового ИИ должны быть защищены на уровне, значительно превосходящем стандартные практики для других коммерческих технологий, чтобы предотвратить их кражу или неправомироное использование.
В ближайшей перспективе правительства и лаборатории передового ИИ должны быть готовы защищать продвинутые модели, веса моделей и лежащие в их основе исследования. Это должно включать такие меры, как разработка надежных передовых практик, широко распространенных в индустрии, а также отношение к сектору передового ИИ как к чему-то сродни «критической инфраструктуре» с точки зрения уровня государственно-частного партнерства в деле защиты этих моделей и разрабатывающих их компаний.
Многие из этих мер могут начинаться как добровольные договоренности, однако со временем может возникнуть необходимость задействовать государственные закупки или регуляторные полномочия для обязательного соблюдения требований.
Передовой опыт в области кибербезопасности
Мы убеждены, что для защиты передовых систем ИИ необходим «принцип двух лиц». Контроль с участием двух сторон уже применяется в самых разных сферах; например, для открытия самых надежных хранилищ требуются два человека с двумя ключами, а схемы многостороннего контроля используются в производстве (GMP, ISO 9001), пищевой промышленности (FSMA PCQI, ISO 22000), медицине (ISO 13485) и финансовых технологиях (SOX).
- Этот подход должен применяться ко всем системам, участвующим в разработке, обучении, хостинге и развертывании передовых моделей ИИ.
- Данный подход уже широко используется в крупных технологических компаниях для защиты от самых изощренных угроз и минимизации внутренних рисков.
- Он реализован в виде архитектуры системы, при которой ни у одного сотрудника нет постоянного доступа к критически важным для производства средам, и для получения временного доступа необходимо запросить его у коллеги, обосновав такую необходимость с точки зрения бизнеса.
- Даже начинающие лаборатории ИИ, не обладающие ресурсами крупного бизнеса, могут внедрить эти средства контроля.
Мы называем это авторизацией нескольких лиц при проектировании инфраструктуры, критически важной для ИИ. Это передовое требование безопасности, реализация которого в полной мере зависит от комплекса лучших практик кибербезопасности.
Кроме того, практики безопасной разработки программного обеспечения должны пронизывать всю среду создания передовых моделей ИИ. Золотым стандартом для таких практик являются Фреймворк безопасной разработки программного обеспечения (SSDF) NIST и стандарт Уровни цепочки поставок программных артефактов (SLSA). Указы президента США успешно использовались для стимулирования крупных технологических компаний к внедрению более высоких стандартов разработки: так, в 2021 году в указе EO 14028 Административно-бюджетному управлению (OMB) было поручено установить руководящие принципы федеральных закупок. Это побудило к действиям: индустрия программного обеспечения инвестировала значительные средства в соответствие требованиям SSDF для сохранения федеральных контрактов.
Хотя исследования в области передового ИИ уже извлекают выгоду из внедрения некоторых из этих стандартов за счет облачных провайдеров, размещающих их модели, применение существующих стандартов способно качественно изменить уровень безопасности таких систем ИИ:
SSDF и SLSA в значительной степени применимы к разработке моделей и сопутствующего программного обеспечения; создание модели с последующим ее развертыванием практически идентично созданию программного обеспечения и его развертыванию.
Связка SSDF и SLSA означает, что любая развернутая система ИИ имеет цепочку поставок. Под этим мы подразумеваем, что при правильном применении эти практики позволяют связать развернутую модель с компанией, которая ее разработала, что помогает обеспечить прослеживаемость.
Мы называем это фреймворком безопасной разработки моделей. Мы призываем расширить SSDF, включив в него разработку моделей в рамках процесса стандартизации NIST.
В ближайшей перспективе эти две лучшие практики могут быть установлены в качестве требований к закупкам для ИИ-компаний и облачных провайдеров, заключающих контракты с правительством, — наряду со стандартными правилами кибербезопасности, которые также применимы к этим компаниям. Поскольку американские облачные провайдеры предоставляют инфраструктуру, которую используют многие современные компании, создающие передовые модели, требования к закупкам окажут эффект, аналогичный широкому регулированию рынка, и могут начать работать до появления официальных нормативных требований.
Anthropic внедряет средства контроля с участием двух сторон, стандарты SSDF, SLSA и другие лучшие практики кибербезопасности. По мере роста возможностей моделей нам потребуется дальнейшее усиление мер защиты, выходящее за рамки вышеуказанных рекомендаций. Этот процесс неизбежно будет носить итеративный характер и осуществляться в консультациях с правительством и отраслью.
Государственно-частное сотрудничество
Лаборатории передовых исследований в области ИИ должны участвовать в государственно-частном сотрудничестве так же, как компании из секторов критической инфраструктуры, например финансовых услуг. Этот сектор мог бы быть определен, например, как особый подсектор существующего IT-сектора. Такой статус стал бы инструментом для расширения сотрудничества и обмена информацией между отраслевыми лабораториями и государственными ведомствами, помогая всем лабораториям эффективнее защищаться от обладающих большими ресурсами злоумышленников в киберпространстве.
Заключение
Может возникнуть соблазн снизить приоритет безопасности: когда все идет хорошо, кажется, что она не нужна или противоречит другим целям компании. Однако эта технология становится все более мощной и потребует повышенных мер предосторожности. Мы также убеждены, что хотя безопасность иногда может мешать продуктивности, существуют творческие способы гарантировать ее минимальное влияние на процесс, позволяя исследованиям и другой работе продвигаться эффективно.
Развитие искусственного интеллекта обладает невероятным потенциалом на благо человечества, но оно также сопряжено с рисками, если подходить к нему бездумно. Будучи ИИ-компанией, работающей на переднем крае этой технологии, мы со всей серьезностью относимся к своей ответственности за создание и развертывание Claude безопасным, надежным образом и в соответствии с общечеловеческими ценностями. Мы продолжим делиться своими взглядами на ответственное развитие искусственного интеллекта.
Полный текст статьи читайте на Anthropic
