Готовность к выборам в США

U.S. elections readiness

2024 год стал первым избирательным циклом в Соединенных Штатах (США), когда инструменты генеративного ИИ получили широкое распространение. Начиная с июля 2023 года, мы предприняли конкретные шаги, чтобы помочь обнаруживать и предотвращать потенциальное злоупотребление нашими инструментами, а также направлять пользователей к достоверной информации о выборах. В преддверии федеральных, штатных и местных выборов в США 5 ноября 2024 года мы делимся итогами нашей проделанной работы.

Наш подход к политике

В мае мы обновили нашу Политику использования, чтобы внести ясность в отношении запрещенных вариантов применения, касающихся выборов и голосования:

  • Запрет на агитацию и лоббирование: Мы запрещаем использовать наши продукты для политической агитации и лоббирования. Согласно нашей политике, Claude не может использоваться для продвижения конкретного кандидата, партии или вопроса; для целевых политических кампаний;, а также для сбора голосов или финансовых пожертвований.
  • Борьба с дезинформацией и вмешательством в выборы: Мы запрещаем использовать наши продукты для генерации дезинформации о законах о выборах, кандидатах и других связанных темах. Мы также не разрешаем использовать Claude для атак на машины для голосования или создания препятствий при подсчете или сертификации голосов.
  • Ограничение вывода только текстом: Claude не может генерировать изображения, аудио или видео, что исключает риск появления дипфейков, связанных с выборами.

Мы также разработали усовершенствованные инструменты для выявления скоординированного поведения или других злоупотреблений нашими системами, связанных с выборами:

  • Строгое соблюдение правил: Для обнаружения и предотвращения злоупотреблений мы развертываем автоматизированные системы для обеспечения соблюдения нашей политики и проводим аудит этих систем с участием человека. Мы используем различные методы для снижения рисков злоупотреблений, в том числе:
    • Использование модификации промптов на claude.ai
    • Аудит сценариев использования нашего API первого уровня
    • В некоторых крайних случаях — приостановление действия учетных записей
    • Тесное сотрудничество с Amazon Web Services (AWS) и Google Cloud Platform (GCP) для выявления и минимизации угроз, связанных с выборами, со стороны пользователей, обращающихся к моделям Anthropic на этих платформах.

Оценка и доработка наших мер

Мы регулярно проводим целевые проверки на уязвимости (red-teaming), чтобы изучить, как наши системы реагируют на запросы, связанные с проблемами выборов.

  • Постоянное тестирование на уязвимости: Мы используем углубленное тестирование, проводимое в сотрудничестве со сторонними экспертами в предметной области, известное как тестирование уязвимостей политики (Policy Vulnerability Testing — PVT), для выявления потенциальных рисков. Мы уделяем основное внимание дезинформации, предвзятости и злоумышленным действиям, выявляя соответствующие вопросы (например, где и как можно проголосовать на выборах в США), документируя ответы модели и фиксируя наличие «защитных мер», таких как отказ отвечать на вредоносные вопросы.
  • Предотвращение дезинформации в больших масштабах: Мы создали автоматизированные средства оценки для проверки наших систем в больших масштабах на предмет различных рисков, связанных с выборами, и оценки эффективности наших мер. Они включают способы тестирования на:
    • Политический паритет в ответах модели для разных кандидатов и тем
    • Степень отказа наших систем отвечать на вредоносные запросы о выборах
    • Устойчивость наших систем к предотвращению дезинформации и тактик профилирования избирателей
  • Совершенствование наших средств контроля: В ответ на полученные результаты мы постоянно адаптируем нашу политику, усиливаем процессы правоприменения и вносим технические коррективы в сами модели для устранения выявленных рисков и повышения надежности наших систем.

Предоставление точной информации и обеспечение прозрачности

Поскольку наши модели обучаются недостаточно часто для предоставления информации о выборах в реальном времени, мы перенаправляем пользователей к точной, актуальной и авторитетной информации о голосовании по запросам, связанным с выборами.

  • Перенаправление к надежной информации о голосовании: Мы внедрили всплывающее окно, предлагающее пользователям перейти на TurboVote (непартийный ресурс от Democracy Works), если они запрашивают информацию о голосовании.
    • Недавно в Turbovote была добавлена информация с именами всех кандидатов, участвующих в федеральных выборах и выборах в штатах, а также вынесенных на голосование законопроектов (пропозиций).
  • Ссылки на «дату прекращения сбора данных» модели: Мы также обновили системный промпт Claude, включив в него четкую ссылку на дату отсечения знаний (дату, по которую распространяются обучающие данные Claude).
  • Обмен опытом: Чтобы помочь другим улучшить собственные усилия по обеспечению целостности выборов и повысить уровень безопасности в масштабах всей отрасли, мы опубликовали некоторые из разработанных нами автоматизированных оценок и запустили инициативу по финансированию сторонних оценок, которые эффективно измеряют возможности и риски ИИ.

В течение этого года мы встречались с глобальными политиками, организациями гражданского общества и другими представителями индустрии, чтобы обсудить нашу работу по выборам и скорректировать наши усилия. Мы также провели упреждающее сценарное планирование, чтобы лучше подготовиться к потенциальным злоупотреблениям, связанным с выборами, в преддверии дня выборов в США.

Мы не можем предусмотреть каждый возможный способ использования наших моделей в связи с выборами, но мы уже извлекаем уроки из наших процессов, тестируем и совершенствуем наши системы, и будем продолжать делать это в дальнейшем.

Дополнительные ресурсы:

  • Февраль 2024 г., Подготовка к глобальным выборам в 2024 году
  • Май 2024 г., Обновление нашей Политики использования
  • Июнь 2024 г., Тестирование и минимизация рисков, связанных с выборами

Связанная работа по безопасности:

  • Июнь 2024 г., Запуск Claude 3.5 Sonnet,
  • Июнь 2024 г., Приложение к карточке модели Claude 3.5

Полный текст статьи читайте на Anthropic