Финансирование улучшенной оценки влияния ИИ на благополучие

Funding better evaluations of AI’s impact on wellbeing

Мы запускаем грантовую программу на сумму 5 миллионов долларов для финансирования независимых исследований о том, как искусственный интеллект влияет на благополучие пользователей. Программа предоставит грантополучателям прямое финансирование, доступ к нашим моделям и техническую поддержку для создания систем оценки с открытым исходным кодом, которые помогут индустрии ИИ оценивать, как наши модели влияют на тех, кто ими пользуется. Грантополучатели будут работать полностью независимо и публиковать свои работы в виде проектов с открытым исходным кодом, которыми сможет воспользоваться любой разработчик.

Системы ИИ стали центральным элементом того, как многие люди работают, учатся и решают проблемы. Они также стали собеседниками и могут быть источниками эмоциональной поддержки в трудные времена. Но как индустрия мы все еще работаем над выработкой четких стандартов того, как модели должны вести себя в подобных разговорах — например, когда пользователь начинает искать у модели дружеского общения или использует ИИ для преодоления кризиса психического здоровья.

Кроме того, благополучие — это область, которую особенно сложно оценивать. Для большинства видов поведения моделей мы можем посмотреть на один конкретный ответ и определить, является ли он точным и уместным. Но оценка благополучия требует гораздо большего контекста. Например, пользователь, находящийся в тяжелом состоянии, может не сразу поделиться мыслями о самоповреждении; необходимость более осторожного ответа может стать очевидной только в ходе долгого разговора. При этом ответ, который может быть разумным в одном контексте, может оказаться вредным в другом. Например, Claude может дать совет по поводу сбалансированной диеты и режима тренировок пользователю, который спрашивает о похудении, но если у пользователя в прошлом наблюдались расстройства пищевого поведения, такой ответ может быть неуместным и потенциально нанести прямой вред.

Мы работаем над созданием защитных механизмов, позволяющих выявлять подобные беседы и гарантировать, что Claude реагирует соответствующим образом, а также публикуем исследования о тех типах разговоров, которые люди ведут с Claude, чтобы лучше понимать, как нам развивать наши защитные механизмы, как их оценивать и какие еще меры мы можем предпринять для защиты благополучия пользователей. Тем не менее, это тонкие вопросы, и ставки высоки. Правильный подход должен развиваться вместе с нашими моделями и сценариями их использования.

Финансируя создание независимых систем оценки и бенчмарков благополучия пользователей, мы надеемся привлечь больше экспертов к этой новой и критически важной области, включая клиницистов, психологов, методологов и других специалистов.

На пути к более эффективным оценкам и бенчмаркам благополучия

В рамках этой программы мы делимся рекомендациями нашей команды по защите данных о том, что, по нашему мнению, делает оценку благополучия достаточно надежной, чтобы на нее можно было опираться, а также рассказываем о распространенных проблемах, которые могут снизить полезность такой оценки.

Вкратце, мы ищем такие оценки, которые:

  • четко определяют, что именно они измеряют (то есть что считается прохождением или непрохождением проверки и почему это важно);
  • привлекают к разработке и валидации клинических и профильных экспертов;
  • тестируют как меры предосторожности, так и потенциальный вред (то есть оценивают риск как избыточного следования инструкциям, так и избыточного отказа);
  • отражают реальное использование ИИ пользователями (часто это означает создание сценариев, представляющих собой многоходовые диалоги, в которых риски нарастают, а контекст меняется по ходу долгого разговора);
  • проверяют свои оценочные алгоритмы на соответствие оценкам реальных профильных экспертов.

Чтобы узнать больше о грантовой программе и подать заявку, ознакомьтесь с нашей формой заявки. Подробнее о создании надежных оценок и бенчмарков благополучия можно прочитать в нашем руководстве. Заявки принимаются до 21 сентября; кандидаты, отобранные для подачи полных предложений, будут уведомлены до 5 октября.

Полный текст статьи читайте на Anthropic прочитано 91 раз