Независимое тестирование как ключевой элемент политики в сфере ИИ

Мы убеждены, что сектор искусственного интеллекта нуждается в эффективном стороннем (независимом) тестировании передовых систем ИИ. Разработка режима тестирования и сопутствующих мер политики, опирающаяся на экспертные знания представителей индустрии, государства и академического сообщества, — это лучший способ предотвратить общественный вред (намеренный или случайный) со стороны систем ИИ.

Наш опыт развертывания крупномасштабных генеративных систем ИИ, таких как Claude, показал, что необходимо работать над созданием политической среды, способной адекватно реагировать на возможности как самых мощных моделей ИИ сегодняшнего дня, так и тех, которые, вероятнее всего, будут созданы в будущем. В этой статье мы рассказываем о том, как выглядит независимое тестирование, почему оно необходимо, а также описываем некоторые исследования, которые мы провели, чтобы прийти к данной позиции в области регулирования. Мы также обсуждаем, как идеи, связанные с тестированием, соотносятся с другими темами политики в сфере ИИ, такими как модели с открытым доступом и проблемы захвата регулятора.

Обзор политики

Современные передовые системы ИИ требуют внедрения режима независимого надзора и тестирования для подтверждения их безопасности. В частности, такой надзор необходим для понимания и анализа поведения моделей в таких областях, как целостность выборов, вредная дискриминация и потенциальное использование в корыстных целях, угрожающих национальной безопасности. Мы также ожидаем, что в будущем более мощные системы потребуют еще более глубокого контроля. Как отмечается в нашей статье «Основные взгляды на безопасность ИИ», существует вероятность, что современные подходы к разработке ИИ могут породить системы с огромными возможностями, и мы полагаем, что для все более мощных систем понадобятся более масштабные процедуру тестирования. Надежный режим независимого тестирования представляется хорошим дополнением к отраслевому регулированию, а также позволяет наработать практику для более универсальных подходов к государственной политике.

Разработка режима независимого тестирования для современных систем ИИ дает нам один из лучших инструментов для решения текущих проблем искусственного интеллекта, одновременно формируя инфраструктуру, которую мы сможем использовать для будущих систем. Мы рассчитываем, что в конечном итоге та или иная форма независимого тестирования станет юридическим требованием для широкомасштабного развертывания моделей ИИ, однако проектирование этого режима и определение точных стандартов, по которым должны оцениваться системы ИИ, — это процесс, который потребует доработки в ближайшие годы. Сегодня не очевидно, что именно будет уместным и эффективным, и лучший способ узнать это — запустить пилотный проект такого режима и собрать эмпирические данные.

Эффективный режим независимого тестирования будет:

  • Повышать доверие людей и институтов к системам ИИ
  • Иметь четкие рамки, чтобы прохождение тестов не создавало чрезмерной нагрузки, ставящей небольшие компании в невыгодное положение
  • Применяться только к узкому кругу наиболее ресурсоемких и крупномасштабных систем; при правильной реализации подавляющее большинство систем ИИ останется вне сферы действия такого режима тестирования
  • Предоставлять странам и группам стран возможность координировать свои действия путем разработки общих стандартов и экспериментов с соглашениями о взаимном признании

Такой режим будет включать следующие ключевые элементы [1]:

  • Эффективные и пользующиеся широким доверием тесты для измерения поведения и потенциальных рисков неправильного использования конкретной системы ИИ
  • Заслуживающие доверия и легитимные независимые стороны, которые могут администрировать эти тесты и проверять процедуры тестирования компаний

Почему нам необходим эффективный режим тестирования

Этот режим необходим потому, что передовые системы ИИ — в частности, крупномасштабные генеративные модели, потребляющие значительные вычислительные ресурсы, — не укладываются аккуратно в рамки существующих концепций, ориентированных на конкретные сценарии использования или отрасли. Эти системы созданы как универсальные машины: Gemini, ChatGPT и Claude могут быть адаптированы под огромное число прикладных задач, а поведение дочерних систем всегда наследует часть возможностей и слабостей той передовой системы, на которой они основаны.

Эти системы чрезвычайно функциональны и полезны, но они также несут риски серьезного злоупотребления или аварий по вине ИИ. Мы хотим помочь создать систему, которая значительно снизит вероятность крупных злоупотреблений или инцидентов, вызванных технологиями ИИ, при этом позволяя широко внедрять их полезные свойства. Помимо очевидного желания предотвратить крупные аварии или злоупотребления сами по себе, масштабные инциденты могут привести к экстремальным, поспешным регуляторным мерам, порождая худший из возможных сценариев, при котором регулирование оказывается одновременно удушающим и неэффективным. Мы считаем, что по ряду причин лучше заранее разработать эффективное и тщательно продуманное регулирование.

Системы также способны проявлять эмерджентные (внезапно возникающие) автономные модели поведения, которые могут привести к серьезным авариям: например, системы могут внедрять уязвимости в создаваемый ими код или при выполнении сложной многошаговой задачи совершать действия, противоречащие намерениям человека. Хотя такие виды поведения по своей природе трудно измерить, инструменты для их оценки стоит разрабатывать уже сегодня в качестве страховки от их проявления в широко развернутых системах.

В Anthropic мы внедрили системы внутреннего управления, которые, как мы верим, должны существенно снизить риск злоупотреблений или аварий со стороны разработанных нами технологий. Наш главный подход — это Политика ответственного масштабирования (Responsible Scaling Policy, RSP), которая обязывает нас тестировать наши передовые системы, такие как Claude, на предмет рисков злоупотребления и аварий, и развертывать только те модели, которые прошли наши тесты на безопасность. Впоследствии ряд других разработчиков ИИ приняли или принимают концепции, очень похожие на RSP компании Anthropic.

Тем не менее, хотя Anthropic инвестирует в собственную RSP (и другие организации поступают так же), мы считаем, что такого тестирования недостаточно, поскольку оно опирается на решения по самоуправлению, принимаемые отдельными игроками частного сектора. В конечном счете тестирование должно проводиться способом, пользующимся широким доверием, и применяться ко всем, кто разрабатывает передовые системы. Такой подход к тестированию в масштабах всей отрасли не нов: большинство важнейших секторов экономики регулируются с помощью стандартов безопасности продукции и режимов тестирования, включая пищевую промышленность, медицину, автомобилестроение и аэрокосмическую отрасль.

Как выглядел бы надежный режим тестирования?

Надежный режим независимого тестирования может помочь выявить и предотвратить потенциальные риски систем ИИ. Он потребует:

  • Общего понимания в индустрии, правительстве и академических кругах того, как выглядит структура тестирования безопасности ИИ — что она должна и не должна включать
  • Начального периода, в течение которого компании проводят практические испытания по внедрению такого тестирования, иногда под сторонним надзором, чтобы убедиться, что тесты работают, их выполнение осуществимо и они могут быть подтверждены третьей стороной
  • Двухэтапного режима тестирования: первый этап должен представлять собой очень быстрое автоматизированное тестирование, применяемое компаниями к своим системам. Этот этап должен охватывать широкий спектр областей и быть ориентирован на предотвращение ложноотрицательных результатов. Если на этом этапе обнаруживаются потенциальные проблемы, должен следовать более тщательный вторичный тест, вероятно, с использованием экспертного анализа под руководством человека
  • Увеличения ресурсов для тех ведомств правительства, которые будут осуществлять надзор и валидацию тестов: создание и анализ тестов — это детальная, дорогая, техническая работа, поэтому правительствам потребуется найти способ финансировать организации, которые этим занимаются
  • Тщательно ограниченного набора обязательных тестов — нам потребуются конкретные, юридически обязательные тесты в тех областях, где очевидно отсутствие стимулов для отраслевого самоуправления, а выгода для общественной безопасности от государственного надзора перевешивает регуляторное бремя. Мы должны убедиться, что это четко очерченный, небольшой набор тестов, иначе мы создадим регуляторные барьеры и увеличим вероятность захвата регулятора
  • Эффективного баланса между обеспечением безопасности и простотой администрирования этих тестов

Что касается самих тестов, мы уже можем выделить одну область, где независимое тестирование представляется полезным и опирается на естественные сильные стороны государств: риски национальной безопасности. Нам следует определить набор возможностей ИИ, которые в случае злоупотребления могут поставить под угрозу национальную безопасность, а затем протестировать наши системы на наличие этих возможностей. Такие возможности могут включать способность существенно ускорить создание биологического оружия или проведение сложных кибератак. (Если системы способны на это, то это заставит нас изменить подход к развертыванию модели — например, удалить определенные возможности из широко распространенных моделей и/или ограничить доступ к определенным функциям моделей с помощью режимов «знай своего клиента» (KYC), а также убедиться, что соответствующие правительственные ведомства осведомлены о наличии у нас систем с такими возможностями). Мы ожидаем появления ряда других областей, где общество в конечном итоге потребует законных подходов к независимому тестированию, и национальная безопасность — лишь одна из них.

Что касается третьих сторон, проводящих тестирование, их будет множество, и тесты будут выполняться по разным причинам, которые мы обрисовываем здесь:

  • Частные компании: Компании могут привлекать субподрядчиков для создания тестов и оценок своих систем, как мы это сделали с такими фирмами, как Gryphon Scientific. Мы также можем представить себе ситуации, когда компании проводят тестирование для других компаний по требованию закона, но не силами государственных ведомств, подобно тому, как аудиторские фирмы проверяют отчетность частных компаний.
  • Университеты: Сегодня многие исследователи во многих академических учреждениях имеют бесплатный или субсидируемый доступ к моделям, разработанным лабораториями ИИ; в будущем мы можем представить, что некоторые из этих исследовательских институтов будут администрировать собственные инициативы по тестированию, часть из которых может контролироваться или поддерживаться государственными органами.
  • Правительства: Некоторые тесты (полагаем, относительно небольшое число) могут быть обязательными по закону и проводиться государственными структурами — например, при проверке на предмет использования систем ИИ в целях, угрожающих национальной безопасности. В этом случае правительственные ведомства могут проводить тесты напрямую.

В конечном счете мы ожидаем, что независимое тестирование будет осуществляться разнообразной экосистемой различных организаций, подобно тому, как безопасность продукции достигается в других секторах современной экономики. Поскольку широко коммерциализированный универсальный ИИ — относительно новая технология, мы считаем, что структура этой экосистемы пока не до конца ясна, и она прояснится по мере того, как все вышеперечисленные участники будут проводить различные эксперименты по тестированию. Нам нужно начать работу над этим режимом тестирования уже сегодня, так как на его создание уйдет много времени.

Мы уверены, что нам — и другим участникам разработки ИИ — потребуется провести множество тестовых экспериментов, чтобы все сделать правильно высоки: если мы остановимся на подходе, который неточно измеряет безопасность, но прост в администрировании, мы рискуем не сделать ничего существенного или полезного. Если мы выберем подход, который точно измеряет безопасность, но сложен в администрировании, мы рискуем создать экосистему тестирования, которая благоприятствует компаниям с большими ресурсами и тем самым снижает возможности участия для более мелких игроков.

Как Anthropic будет содействовать созданию справедливых и эффективных режимов тестирования

В будущем Anthropic будет осуществлять следующие мероприятия в поддержку усилий правительств по разработке эффективных режимов независимого тестирования:

  • Создание прототипа режима тестирования путем реализации нашей политики RSP и обмена накопленным опытом
  • Тестирование сторонней оценки наших систем силами подрядчиков и правительственных партнеров
  • Углубление нашей работы по тестированию на проникновение для оценки передовых угроз (red teaming), чтобы дать нам и всему сектору более четкое представление о рисках систем ИИ и методах их минимизации
  • Лоббирование выделения правительствами финансирования для агентств и организаций, способных помочь в разработке эффективного режима независимого тестирования (например, в США — NIST, Института безопасности ИИ США, Национального ресурса исследований в области ИИ, использования суперкомпьютеров Министерства энергетики для тестирования ИИ и т. д.)
  • Побуждение правительств к созданию собственных «национальных исследовательских облачных сред» (по аналогии с Национальным ресурсом исследований в области ИИ в США), чтобы они могли: а) развивать независимый потенциал в академических кругах и правительстве для создания, изучения и тестирования передовых систем ИИ; и б) работать над научными основами оценки систем ИИ, в том числе разработанных частными компаниями, такими как Anthropic

Разработка режима тестирования и сопутствующих мер политики на основе идей индустрии, государства и академического сообщества — это лучший способ избежать общественного вреда — будь то намеренного или случайного — от систем ИИ.

Как тестирование связано с нашими более широкими приоритетами в области политики

Наша главная политическая цель — обеспечить надлежащий надзор за сектором искусственного интеллекта. Мы верим, что этого в основном удастся достичь за счет создания эффективной экосистемы для независимого тестирования и оценки систем ИИ. Вот некоторые идеи в сфере политики ИИ, в поддержку которых мы намерены выступать:

Увеличение государственного финансирования тестирования и оценки ИИ

  • Эффективные процедуры тестирования и оценки — необходимая предпосылка любой действенной политики в области ИИ. Мы считаем, что государства должны создавать и поддерживать институты, разрабатывающие методы оценки ИИ, а также объединять представителей индустрии, академических кругов и других заинтересованных сторон для согласования стандартов безопасности систем ИИ. В США мы выступаем конкретно за увеличение финансирования NIST.

Поддержка расширенной оценки систем ИИ с помощью инфраструктуры государственного сектора для проведения исследований в области ИИ

  • Нам срочно необходимо увеличить количество и разнообразие специалистов, работающих над тестированием и оценкой систем ИИ в контексте текущих и будущих рисков. Поэтому крайне важно, чтобы правительства создавали экспериментальную инфраструктуру, помогающую академическим исследователям тестировать и оценивать передовые системы ИИ, а также разрабатывать собственные передовые системы в благотворных целях. Подробнее см. нашу поддержку создания национальной исследовательской облачной среды в США посредством закона CREATE AI и наши письменные показания для Сената.

Разработка тестов для конкретных возможностей, имеющих значение для национальной безопасности

  • Мы должны знать, могут ли системы ИИ использоваться способами, которые укрепляют национальную безопасность или (если они находятся в руках другой структуры) подрывают ее. В то время как частный сектор и академические круги могут разработать подавляющее большинство тестов, некоторые вопросы тестирования и оценки касаются возможностей обеспечения национальной безопасности, которые засекречены, поэтому только определенные правительства способны эффективно их оценивать. Следовательно, мы хотим поддержать усилия правительства США по разработке способов тестирования систем ИИ на предмет возможностей, связанных с национальной собственностью. Мы также продолжим нашу собственную работу по лучшему пониманию возможностей наших собственных систем.

Сценарное планирование и разработка тестов для все более совершенных систем

  • Наша Политика ответственного масштабирования разработана с расчетом на опережение работы по оценке и тестированию будущих, гипотетических возможностей систем ИИ. Это делается для того, чтобы у нас были соответствующие тесты для более точной оценки и минимизации рисков аварий и злоупотреблений со стороны все более мощных систем ИИ. При этом мы не утверждаем, что наша RSP описывает все тесты, которые необходимо проводить для все более мощных моделей. По мере продвижения вперед под воздействием растущих вычислительных мощностей более широка группа участников должна работать над прогнозированием будущих возможностей систем ИИ и разработкой тестов для них.

Аспекты политики в сфере ИИ, которые, по нашему мнению, важно обсудить

Разрабатывая наш подход к политике, мы вновь и вновь возвращаемся к некоторым конкретным вопросам, таким как модели с открытым доступом и захват регулятора. Ниже мы изложили наше текущее видение этих проблем, понимая при этом, что они сложны и часто вызывают разногласия.

Модели с открытым распространением и/или открытым исходным кодом:

Наука движется вперед во многом благодаря культуре открытости и прозрачности исследований. Это особенно верно в отношении ИИ, где большая часть разворачивающейся сегодня революции построена на открытой публикации исследований и таких моделей, как Transformer, BERT, Vision Transformers и так далее. Существует также давняя история открытого исходного кода и систем с открытым доступом, повышающих надежность среды безопасности за счет того, что большее число людей может экспериментировать с технологиями и выявлять их потенциальные уязвимости.

Мы считаем, что подавляющее большинство современных систем ИИ (возможно, даже все они) безопасно для открытого распространения и будет безопасным для широкого распространения в будущем. Тем не менее, мы полагаем, что в будущем может оказаться сложно совместить культуру полного открытого распространения передовых систем ИИ с культурой общественной безопасности.

Если — и «если» здесь является ключевым и нерешенным моментом — все более мощные модели ИИ могут приводить к неблагоприятным последствиям или нести в себе вероятность катастрофических аварий, нам придется скорректировать нормы того, что находится в свободном доступе на передовой.

В частности, нам потребуется убедиться, что разработчики ИИ выпускают свои системы таким образом, который обеспечивает надежные гарантии безопасности — например, если бы мы обнаружили серьезный случай злоупотребления нашей моделью, мы могли бы внедрить классификаторы для обнаружения и блокирования попыток вызвать такое злоупотребление, либо мы могли бы ограничить возможность дообучения системы правилом «знай своего клиента» наряду с контрактными обязательствами не дообучать ее под конкретное злоупотребление. Для сравнения, если бы кто-то захотел в открытом доступе выпустить веса модели, способной к такому же злоупотреблению, им потребовалось бы как укрепить модель против этого злоупотребления (например, с помощью обучения RLHF или RLAIF), так и найти способ сделать эту модель устойчивой к попыткам дообучить ее на датасете, который делает возможным данное злоупотребление. Нам также придется поэкспериментировать с процессами раскрытия информации, подобно тому как сообщество специалистов по безопасности выработало нормы предварительного уведомления о раскрытии уязвимостей нулевого дня.

Хотя описанное нами по своей природе очень затратно, мы также считаем это необходимым — мы должны сделать все возможное, чтобы не допустить использования систем ИИ для масштабных злоупотреблений или крупных аварий. Однако любые ограничения на открытое распространение систем ИИ зависят от наличия широкого согласия относительно того, что представляют собой неприемлемые злоупотребления или деструктивное поведение систем ИИ.

Anthropic не является здесь беспристрастным игроком — мы компания, которая в основном разрабатывает проприетарные системы, и у нас нет легитимности делать заявления о том, что должно или не должно быть приемлемым в системах с открытым распространением. Поэтому для решения вопросов, связанных с моделями с открытым исходным кодом, нам необходимы легитимные независимые стороны для разработки подходов к тестированию и оценке, которые получили бы широкое признание; нам нужно, чтобы эти третьи стороны (или другие доверенные структуры) определили узкий и серьезный набор злоупотреблений системами ИИ, а также нежелательных вариантов поведения систем ИИ, и нам потребуется применять эти тесты к моделям, которые как контролируются (например, через API), так и распространяются открыто (например, путем публикации весов).

Независимое тестирование систем с открытым распространением и закрытых проприетарных моделей может генерировать важнейшую информацию, необходимую нам для понимания характеристик безопасности ландшафта ИИ [2]. Если мы не сделаем этого, можно оказаться в ситуации, когда либо проприетарная модель, либо общедоступная модель напрямую приведет к серьезному злоупотреблению или крупной аварии ИИ — и если это произойдет, это может нанести значительный вред людям, а также вызвать появление неблагоприятных регуляторных мер, применяемых к сектору ИИ.

Захват регулятора: Любая форма политики может подвергнуться захвату регулятора со стороны достаточно мотивированного и хорошо обеспеченного ресурсами игрока: например, хорошо капитализированной компании, занимающейся ИИ. Некоторые из обсуждаемых нами выше идей о моделях с открытым доступом сами по себе склонны к захвату регулятора. Важно, чтобы экосистема ИИ оставалась надежной и конкурентной — ИИ является сложной сферой, и лучший шанс человечества сделать все правильно, вероятно, заключается в наличии разнообразного и широкого круга участников, вовлеченных в его разработку и надзор.

Мы в целом выступаем за инициативы по независимому тестированию и оценке, поскольку они представляют собой ту политическую инфраструктуру, которая помогает нам выявлять и предотвращать конкретные вредные последствия, а также наращивать потенциал, существующий независимо от крупных компаний. Следовательно, мы считаем, что сосредоточение внимания на развитии потенциала независимого тестирования может снизить риск захвата регулятора и создать равные условия для разработчиков. И наоборот, отраслевые консорциумы могут иметь склонность отдавать предпочтение подходам, которые предполагают высокие издержки на соблюдение требований со стороны компаний независимо от их масштаба — подход, который изначально дает преимущества более крупным бизнесам, способным тратить больше денег на соответствие нормативам.

Почему мы подходим с осторожностью к тому, за что выступаем в политике в сфере ИИ

Формулируя нашу политическую позицию, мы исходим из того, что регуляторные меры обычно создают административную нагрузку как для стороны, обеспечивающей соблюдение регулирования (например, государства), так и для стороны, на которую оно направлено (например, разработчиков ИИ). Поэтому мы должны выступать за политику, которая является одновременно практичной для принудительного исполнения и осуществимой с точки зрения соблюдения требований. Мы также отмечаем, что регулирование имеет тенденцию к расширению — однажды принятые правила трудно отменить. Следовательно, мы выступаем за то, что считаем «минимально жизнеспособной политикой» для создания здоровой экосистемы ИИ, и остаемся открытыми для отзывов и критики.

Почему политика в сфере ИИ важна

Современные системы ИИ и системы будущего невероятно мощны и способны принести огромную пользу обществу. Мы также убеждены, что эти системы потенциально способны к серьезным злоупотреблениям или могут вызвать аварии при некачественной реализации. Хотя подавляющая часть нашей работы имеет технический характер, мы пришли к убеждению, что тестирование фундаментально для безопасности наших систем: оно не только позволяет лучше понимать возможности и свойства безопасности наших собственных моделей, но и дает возможность третьим сторонам проверять заявления, которые мы делаем о системах ИИ.

Мы верим, что создание экосистемы независимого тестирования — это один из лучших способов вовлечь бо́льшую часть общества в разработку и надзор за системами ИИ. Мы надеемся, что публикация этой статьи помогла нам четче сформулировать преимущества независимого тестирования, а также обрисовать нашу собственную позицию для критики и доработки другими.

Сноски

[1] Некоторые страны могут также экспериментировать с «рынками регулирования», где разработчики ИИ могут покупать и продавать услуги по тестированию ИИ и конкурировать друг с другом, пытаясь создавать и развертывать все более безопасные и полезные системы.

[2] Например, если вы открыто выпускаете модель ИИ, сторонней организации относительно легко дообучить эту модель на наборе данных по своему выбору. Такой датасет может быть спроектирован с целью оптимизации под определенное злоупотребление (например, фишинг или хакерские атаки). Если бы вы смогли разработать технологию, которая сильно затрудняет дообучение модели ИИ с уводом ее от первоначального распределения возможностей, тогда было бы проще уверенно выпускать модели без потенциального ущерба для безопасности на последующих этапах.

Полный текст статьи читайте на Anthropic