Определяя путь к подотчетности в сфере ИИ

На этой неделе компания Anthropic направила ответ на запрос Национального управления по телекоммуникациям и информации (NTIA) о предоставлении комментариев по вопросам подотчетности ИИ. Сегодня мы хотим поделиться нашими рекомендациями, так как они отражают ключевые предложения Anthropic в области политики в отношении искусственного интеллекта.
В настоящее время не существует надежного и комплексного процесса оценки современных передовых систем искусственного интеллекта (ИИ), не говоря уже о более мощных системах будущего. В нашем представлении изложены наши взгляды на процессы и инфраструктуру, необходимые для обеспечения подотчетности ИИ. Наши рекомендации учитывают потенциальную роль NTIA в качестве координирующего органа, устанавливающего стандарты в сотрудничестве с другими правительственными ведомствами, такими как Национальный институт стандартов и технологий (NIST).
В наших рекомендациях мы делаем акцент на механизмы подотчетности, применимые к высокопроизводительным моделям ИИ общего назначения. В частности, мы рекомендуем:
- Финансировать исследования для создания более качественных методов оценки
- Увеличить финансирование исследований в области оценки моделей ИИ. Разработка строгих стандартизированных оценок — это сложная и трудоемкая работа, требующая значительных ресурсов. Увеличение финансирования, особенно со стороны правительственных ведомств, могло бы способствовать прогрессу в этой критически важной сфере.
- Обязать компании в краткосрочной перспективе раскрывать методы и результаты оценки. Компании, внедряющие системы ИИ, должны быть обязаны выполнять определенные требования по раскрытию информации об оценках, хотя эти требования не обязательно делать публичными, если это может поставить под угрозу интеллектуальную собственность или конфиденциальную информацию. Такая прозрачность могла бы помочь исследователям и политикам лучше понять, где существующие оценки могут быть несовершенны.
- В долгосрочной перспективе разработать набор отраслевых стандартов оценки и передового опыта. Правительственные ведомства, такие как NIST, могли бы заняться установлением стандартов и ориентиров для оценки возможностей, ограничений и рисков моделей ИИ, которым компании будут следовать.
- Создать динамические оценки рисков, основанные на возможностях моделей
- Разработать стандартные оценки возможностей для систем ИИ. Правительства должны финансировать и участвовать в разработке строгих оценок возможностей и безопасности, нацеленных на критические риски передового ИИ, такие как склонность к дезинформации и автономия. Эти оценки могут стать научно обоснованным фундаментом для соразмерного и гибкого регулирования рисков.
- Установить порог риска посредством дополнительных исследований и финансирования оценок безопасности. Как только порог риска будет установлен, мы сможем обязать проводить оценку всех моделей на соответствие этому порогу.
- Если модель находится ниже этого порога риска, существующие стандарты безопасности, скорее всего, достаточны. Подтвердите соответствие и внедряйте систему.
- Если модель превышает порог риска, а оценки безопасности и меры по их снижению недостаточчны, приостановите развертывание, значительно усильте надзор и уведомите регуляторов. Определите надлежащие средства защиты до разрешения развертывания.
- Ввести предварительную регистрацию масштабных запусков обучения ИИ
- Создать процесс отчетности для разработчиков ИИ о масштабных запусках обучения, гарантирующий, что регуляторы осведомлены о потенциальных рисках. Это предполагает определение подходящего адресата, необходимой информации, а также соответствующих мер кибербезопасности, защиты конфиденциальности, интеллектуальной собственности и персональных данных.
- Создать конфиденциальный реестр для разработчиков ИИ, проводящих крупномасштабное обучение моделей, для предварительной регистрации сведений о модели в национальном правительстве своей страны (например, спецификации модели, тип модели, вычислительная инфраструктура, предполагаемая дата завершения обучения и планы безопасности) до начала обучения. Совокупные данные реестра должны быть защищены в соответствии с самыми высокими доступными стандартами и спецификациями.
- Обладают технической грамоткой — по крайней мере, некоторые аудиторы должны иметь глубокий опыт работы с машинным обучением;
- Ориентированы на безопасность — способны защитить ценную интеллектуальную собственность, кража которой может создать угрозу национальной безопасности; и
- Гибки — способны проводить надежные, но не громоздкие оценки, выявляющие угрозы без ущерба для конкурентоспособности США.
- Сделать обязательным проведение внешнего независимого тестирования систем ИИ на уязвимости (red teaming) либо через централизованную третью сторону (например, NIST), либо децентрализованным образом (например, через доступ исследователей к API) для стандартизации состязательного тестирования систем ИИ. Это должно стать предварительным условием для разработчиков, выпускающих передовые системы ИИ.
- Сформировать качественные возможности для проведения внешнего тестирования на уязвимости до того, как это станет обязательным условием для выпуска моделей. Это критически важно, поскольку специалисты по такому тестированию в настоящее время сосредоточены практически исключительно в частных лабораториях ИИ.
- Увеличить финансирование исследований интерпретируемости. Предоставлять государственные гранты и стимулы для работы над интерпретируемостью в университетах, некоммерческих организациях и компаниях. Это позволит проводить значимую работу с меньшими моделями, обеспечивая прогресс за пределами передовых лабораторий.
- Признать, что нормативы, требующие использования интерпретируемых моделей, в настоящее время невыполнимы, но могут стать возможными в будущем по мере продвижения исследований.
- Регуляторы должны выпустить руководства по допустимому взаимодействию участников индустрии в сфере безопасности с учетом действующего антимонопольного законодательства. Разъяснение того, как частные компании могут сотрудничать в общественным интересах без нарушения антимонопольных законов, снизит юридическую неопределенность и будет способствовать достижению общих целей.
Мы верим, что этот набор рекомендаций значительно приблизит нас к созданию эффективной структуры подотчетности ИИ. Для этого потребуется сотрудничество между исследователями, лабораториями ИИ, регуляторами, аудиторами и другими заинтересованными сторонами. Anthropic стремится поддерживать усилия по обеспечению безопасной разработки и развертывания систем ИИ. Оценки, независимое тестирование на уязвимости (red teaming), стандарты, исследования в области интерпретируемости и другие исследования безопасности, аудит и надежные методы кибербезопасности — все это перспективные пути минимизации рисков ИИ при одновременном извлечении его пользы.
Мы верим, что ИИ может оказать трансформационное воздействие в течение нашей жизни, и хотим убедиться, что это воздействие будет позитивным. Создание надежных механизмов подотчетности и аудита ИИ будет иметь жизненно важное значение для реализации этой цели. Мы благодарны за возможность ответить на этот запрос о предоставлении комментариев.
С полным текстом нашего обращения можно ознакомиться здесь.
Полный текст статьи читайте на Anthropic
