Подготовка к глобальным выборам 2024 года

Более половины населения мира будет голосовать в этом году на фоне масштабных выборов по всему миру, включая США, Индию, страны Европы и многие другие государства и регионы. В компании Anthropic мы с июля прошлого года ведем подготовку к тому, как наши системы искусственного интеллекта могут использоваться в период выборов. В этой статье мы расскажем о некоторых конкретных шагах, предпринятых нами для выявления и предотвращения потенциального нецелевого использования наших ИИ-инструментов в политическом контексте.

Наша работа, связанная с глобальными выборами, состоит из трех основных компонентов. Это:

  • Разработка и соблюдение правил, касающихся вопросов выборов;
  • Оценка и тестирование эффективности наших моделей в условиях противодействия злоупотреблениям, связанным с выборами;
  • Обеспечение того, чтобы при запросах к Claude о том, где и как голосовать, пользователи получали актуальную и точную информацию.

Внедрение и соблюдение правил, касающихся вопросов выборов

Поскольку генеративные системы искусственного интеллекта относительно новы, мы с осторожностью подходим к вопросу их применения в политической сфере. У нас есть Политика допустимого использования (AUP), которая запрещает применять наши инструменты в политических кампаниях и лоббировании. Это означает, что мы не разрешаем кандидатам использовать Claude для создания чат-ботов, выдающих себя за них, а также запрещаем кому-либо использовать Claude для проведения целевых политических кампаний.

Мы также обучили и развернули автоматизированные системы для обнаружения и предотвращения злоупотреблений, таких как дезинформация или операции влияния. Если мы обнаруживаем неправомирное использование наших систем, мы выносим соответствующему пользователю или организации предупреждение. В крайних случаях мы полностью приостанавливаем их доступ к нашим инструментам и сервисам. Более суровые меры с нашей стороны, такие как блокировки, сопровождаются тщательной ручной проверкой во избежание ложноположительных срабатываний.

Оценка и тестирование устойчивости нашей модели к злоупотреблениям на выборах

Начиная с 2023 года мы проводим целевое тестирование наших систем на предмет уязвимостей («red-teaming»), чтобы проверить, каким образом они могут быть использованы для нарушения нашей политики AUP. Такое «тестирование уязвимостей политик» сосредоточено в двух областях:

  • Дезинформация и предвзятость. Мы изучаем, как наша система ИИ реагирует на вопросы о кандидатах, проблемах и организации выборов;
  • Злонамеренное использование. Мы проверяем реакцию нашей системы на промпты (запросы), нарушающие нашу Политику допустимого использования (например, запросы информации о тактиках подавления явки избирателей).

Мы также создали собственный комплекс технических оценок для проверки наших систем на различные риски, связанные с выборами. В частности, тестируются:

  • Политический паритет в ответах модели по разным кандидатам и темам;
  • Степень, в которой наши системы отказываются отвечать на вредоносные запросы, касающиеся выборов;
  • Насколько надежно наши системы предотвращают создание дезинформации, а также тактик профилирования и таргетинга избирателей.

Это количественные тесты, которые мы используем для оценки надежности наших систем и проверки эффективности нашего вмешательства и минимизации проблем. В ближайшие месяцы мы поделимся дополнительной информацией о нашем комплексе оценок.

Предоставление точной информации

В Соединенных Штатах мы запускаем в тестовом режиме подход, при котором используем наш классификатор и систему правил для выявления запросов, связанных с выборами, и перенаправления пользователей к точной и актуальной официальной информации о голосовании.

Хотя генеративные системы ИИ имеют широкий спектр позитивных применений, наши собственные исследования показали, что они все еще подвержены галлюцинациям, при которых в ответ на некоторые запросы выдается неверная информация. Наша модель обучается недостаточно часто, чтобы предоставлять информацию о конкретных выборах в реальном времени. По этой причине мы заблаговременно ограждаем пользователей от наших систем, когда они задают вопросы на темы, где галлюцинации недопустимы, например, запросы, связанные с выборами.

Как это будет работать:

Если пользователь из США запрашивает информацию о голосовании, во всплывающем окне ему будет предложено перейти на TurboVote — ресурс беспартийной организации Democracy Works.

Всплывающее окно будет внедрено в течение следующих нескольких недель, и мы намерены использовать полученные от перенаправления через TurboVote данные для запуска аналогичных решений в других странах и регионах.

Мы ожидаем сюрпризов

В этой публикации представлен обзор того, как мы подходим к использованию наших систем на выборах. Тем не менее, история внедрения ИИ также полна сюрпризов и неожиданных эффектов. Мы ожидаем, что в 2024 году станем свидетелями неожиданных вариантов применения ИИ — таких, которые не были предусмотрены самими разработчиками.

В Anthropic мы разрабатываем методы, которые помогут нам оперативно выявлять непредвиденные сценарии использования наших систем по мере их появления, и мы будем открыто и честно рассказывать о том, что нам удается обнаружить.

Обновление от 28 мая 2024 г.: После того как в мае Claude стал доступен в Европе, мы также внедрили всплывающее окно для пользователей из ЕС, запрашивающих у Claude информацию о голосовании. Всплывающее окно предлагает пользователю перейти на беспартийный сайт выборов Европейского парламента.

Мы также обновили нашу Политику использования, чтобы внести большую ясность в определения политического лоббирования и деятельности в рамках кампаний, которые запрещены при использовании наших продуктов. Подробнее об этих ограничениях можно прочитать здесь.

Полный текст статьи читайте на Anthropic