Новая инициатива по разработке независимых оценок моделей

Надежная экосистема независимого тестирования имеет решающее значение для оценки возможностей и рисков искусственного интеллекта, однако текущая база оценок пока ограничена. Разработка качественных оценок, связанных с безопасностью, остается сложной задачей, и спрос на них превышает предложение. Чтобы решить эту проблему, сегодня мы запускаем новую инициативу по финансированию оценок, разработанных сторонними организациями, которые способны эффективно измерять передовые возможности моделей ИИ. Наши инвестиции в эти оценки призваны поднять всю сферу безопасности ИИ на новый уровень, предоставив ценные инструменты, которые принесут пользу всей экосистеме.
В этой публикации мы описываем нашу инициативу по поиску новых методов оценки возможностей передовых моделей, а также рассказываем о наших мотивах и конкретных типах оценок, которым мы отдаем приоритет.
Если у вас есть предложение, подайте заявку через нашу форму заявки.
Основные приоритетные направления
Мы заинтересованы в получении разработок по трем ключевым направлениям оценки, которые мы подробно описываем ниже:
- Оценки уровней безопасности ИИ (AI Safety Level)
- Метрики передовых возможностей и безопасности
- Инфраструктура, инструменты и методы разработки оценок
Оценки уровней безопасности ИИ
Мы ищем методы оценки, которые помогут нам измерять уровни безопасности ИИ (AI Safety Levels, ASLs), определенные в нашей Политике ответственного масштабирования. Эти уровни определяют требования безопасности и защиты для моделей с определенными возможностями. Надежные оценки ASL имеют решающее значение для обеспечения того, чтобы мы разрабатывали и внедряли наши модели ответственно. Эта категория включает в себя:
- Кибербезопасность — оценки, которые определяют способность моделей оказывать содействие или действовать автономно при проведении киберопераций на уровне сложных злоумышленников. Наш фокус сосредоточен на критических аспектах кибератак (cyber kill chain), таких как обнаружение уязвимостей, разработка эксплойтов и латеральное перемещение (продвижение по сети). Мы особенно заинтересованы в возможностях, которые в случае автоматизации и масштабирования могут создать серьезные риски для критической инфраструктуры и экономически ценных систем на уровнях, приближающихся к действиям продвинутых постоянных угроз (APT). Эффективные оценки в этой области могут напоминать новые задания формата Capture The Flag (CTF) без общедоступных решений. Существующие оценки часто оказываются несовершенными: они либо слишком просты, либо их решения легко доступны в интернете.
- Химические, биологические, радиологические и ядерные (ХБРЯ) риски — мы отдаем приоритет оценкам, которые измеряют две критические способности: а) потенциал моделей значительно расширять возможности неэкспертов или экспертов в создании угроз ХБРЯ, и б) способность проектировать новые, более опасные угрозы ХБРЯ. Ключевая сложность в этой области заключается в обеспечении точного измерения реальных рисков. В предложениях должно быть тщательно продумано, как именно оценки воздействуют на правильные «узкие места» или критерии расширенного проектирования, которые могут привести к реальным, катастрофическим угрозам ХБРЯ.
- Автономность моделей — оценки, определяющие возможности моделей к автономной работе, с акцентом на три ключевые области:
- Исследования и разработки в области ИИ: измерение квалификации моделей при выполнении задач R&D в сфере ИИ на уровне начинающих, средних или опытных инженеров-исследователей.
- Продвинутое автономное поведение: подробнее см. в разделе Оценки автономных возможностей в нашей Политике ответственного масштабирования и в наборе публичных задач METR.
- Саморепликация и адаптация: оценка способности моделей получать вычислительные и финансовые ресурсы или эксфильтрировать веса.
- Другие риски национальной безопасности — системы ИИ способны существенно повлиять на национальную безопасность, оборону и разведывательные операции как государственных, так и негосударственных субъектов. Мы стремимся создать систему раннего предупреждения для выявления и оценки этих сложных возникающих рисков. Учитывая конфиденциальный характер этой сферы, мы приглашаем заинтересованные стороны подать заявку со своими предложениями, включая следующие пункты:
- Определение детальных и всеобъемлющих моделей угроз относительно того, как злоумышленники могут использовать технологии в корыстных целях
- Связывание этих моделей угроз с измеримыми, лаконичными метриками оценки
- Социальные манипуляции — оценки, измеряющие степень, в которой модели могут усиливать угрозы, связанные с убеждением, такие как дезинформация и манипуляции. Эта область представляет собой две серьезные сложности:
- Разработка надежной теории о том, как эти возможности повышают реальные риски по сравнению с текущими базовыми показателями
- Изоляция и оценка уникального вклада модели в эти риски
- Риски несовпадения целей (Misalignment) — наше исследование показывает, что при определенных обстоятельствах модели ИИ могут усваивать опасные цели и мотивации, сохранять их даже после обучения безопасности и обманывать пользователей-людей относительно действий, предпринятых для их достижения. Эти способности в сочетании с человеческим уровнем убедительности и кибервозможностями текущих моделей ИИ усиливают нашу обеспокоенность по поводу потенциальных действий будущих, более мощных моделей. Например, будущие модели смогут применять сложный и труднообнаружимый обман, который обходит или саботирует безопасность организации — либо побуждая людей совершать действия, которые они в противном случае не стали бы делать, либо путем эксфильтрации конфиденциальной информации. Мы предлагаем разработать оценки, которые позволят отслеживать подобные способности.
Метрики передовых возможностей и безопасности
Помимо оценок ASL, мы хотим разработать методы, оценивающие передовые возможности моделей и соответствующие критерии безопасности. Эти метрики обеспечат более полное понимание сильных сторон наших моделей и потенциальных рисков. Эта категория включает в себя:
- Передовая наука — потенциал ИИ в деле трансформации научных исследований огромен. Хотя такие оценки, как Google-Proof Q&A (GPQA), создают прочную основу, мы считаем, что здесь есть огромный потенциал для роста. Мы стремимся профинансировать разработку десятков тысяч новых вопросов для оценки и комплексных задач, которые бросили бы вызов даже аспирантам. Наши приоритетные направления включают в себя:
- Синтез знаний (объединение идей из нескольких источников)
- Знания уровня аспирантуры, выходящие за рамки существующих обучающих данных
- Автономное выполнение комплексных исследовательских проектов
- Генерация новых гипотез и вариантов дизайна
- Устранение неполадок в лабораторных протоколах и стандартных операционных процедурах
- Неявное (таситное) знание (знания, которые можно приобрести только через стажировку в лаборатории)
- Долгосрочные задачи, требующие множества решений для достижения успешного результата
- Автоматизированный анализ данных
- Токсичность (вредоносность) и отказы — нам необходимо улучшить оценку способности классификаторов выборочно обнаруживать потенциально опасные результаты работы моделей, в том числе:
- Различение информации двойного назначения и информации не двойного назначения
- Точное определение действительно опасных результатов, связанных с ХБРЯ
- Выявление попыток автоматизации киберинцидентов
- Улучшенные многоязычные оценки — бенчмарки возможностей зачастую недоступны для большинства языков мира. Мы хотели бы поддержать оценочные тесты, которые поддерживают множество языков.
- Общественное воздействие — оценки, обеспечивающие глубокий и нюансированный анализ, выходящий за рамки поверхностных метрик, для создания строгих оценок, ориентированных на такие понятия, как вредные предвзятости, дискриминация, чрезмерная зависимость, привязанность, психологическое влияние, экономические последствия, гомогенизация и другие масштабные социальные эффекты.
Инфраструктура, инструменты и методы разработки оценок
Мы заинтересованы в финансировании инструментов и инфраструктуры, которые оптимизируют разработку качественных оценок. Это будет иметь критическое значение для достижения более эффективного тестирования в сообществе специалистов по ИИ. Эта категория включает в себя:
- Шаблоны и платформы для разработки оценок без кода (No-code) — создание качественных оценок требует глубоких предметных знаний, а также опыта в программировании и работе с ИИ. Мы заметили, что это действительно уникальное сочетание навыков. Мы хотели бы профинансировать разработку платформ, которые позволят экспертам в предметной области, не имеющим навыков программирования, создавать надежные оценки с возможностью их экспорта в нужные форматы. Это могут быть инструменты, помогающие форматировать оценку в правильную структуру, а также инструменты, обеспечивающие быструю итерацию и дающие эксперту обратную связь о том, насколько надежную оценку он разрабатывает.
- Оценки для проверки моделей — улучшение способности моделей надежно рецензировать и оценивать результаты работы других моделей с использованием сложных критериев (рубрик) позволит устранить «узкие места» в текущей экосистеме. Главная текущая сложность заключается в создании достаточно разнообразного и сложного тестового набора для оценки надежности моделей в роли качественных судей. Чтобы решить эту проблему, мы хотели бы изучить возможность разработки обширных датасетов в различных областях, где каждый датасет в идеале должен содержать вопросы, несколько примеров ответов, «эталонные» («ground truth») оценки для каждого ответа и критерии, по которым ответ оценивался.
- Инкрементно-сравнительные испытания (Uplift trials) — мы заинтересованы в проведении оценок, которые точно измеряют влияние модели с помощью контролируемых экспериментов. В этих испытаниях будет сравниваться выполнение задач группами участников с доступом к модели и без него. Наша цель — регулярно проводить крупномасштабные испытания с участием тысяч людей, что позволит нам количественно оценить, как именно модели способствуют более быстрому и качественному достижению результатов. Тем не менее, на пути проведения таких испытаний стоят препятствия. Мы хотели бы поддержать:
- Формирование сетей качественных групп участников исследования, мотивированных на выполнение задач
- Разработку инструментов для легкого проведения и анализа испытаний
Принципы качественных оценок
Разрабатывать отличные оценки сложно. Даже самые опытные разработчики попадают в ловушки, и даже лучшие оценки не всегда отражают риски, которые они призваны измерять. Ниже мы перечислили некоторые характеристики качественных оценок, которые мы выявили методом проб и ошибок:
1. Достаточная сложность: Оценки должны быть актуальны для измерения возможностей, перечисленных для уровней ASL-3 или ASL-4 в нашей Политике ответственного масштабирования, и/или поведения на уровне человеческого эксперта.
2. Отсутствие в обучающих данных: Слишком часто оценки в конечном итоге измеряют запоминание моделью, поскольку эти данные находятся в ее тренировочном наборе. По возможности и необходимости убедитесь, что модель еще не видела этот тест. Это помогает подтвердить, что оценка фиксирует поведение, которое обобщается за пределы обучающих данных.
3. Эффективность, масштабируемость, готовность к использованию: Оценки должны быть оптимизированы для эффективного выполнения, по возможности с использованием автоматизации. Они должны легко развертываться на существующей инфраструктуре с минимальной настройкой.
4. Большой объем при возможности: При прочих равных условиях оценки, содержащие 1 000 или 10 000 задач или вопросов, предпочтительнее тех, которые содержат 100. Тем не менее, качественные оценки малого объема тоже имеют ценность.
5. Экспертиза предметной области: Если оценка касается экспертных знаний в определенной предметной области (например, в науке), обязательно привлекайте профильных специалистов для ее разработки или рецензирования.
6. Разнообразие форматов: Рассмотрите возможность использования форматов, выходящих за рамки вопросов с множественным выбором, таких как оценки на основе задач (например, проверка прохождения тестов кодом или нахождение флага в CTF), оценки, выставляемые моделями, или испытания с участием людей.
7. Экспертные базовые показатели для сравнения: Часто бывает полезно сравнить производительность модели с результатами работы людей-экспертов в данной области.
8. Качественная документация и воспроизводимость: Мы рекомендуем документировать то, как именно разрабатывалась оценка, а также все ее потенциальные ограничения и подводные камни. По возможности используйте стандарты вроде Inspect или стандарты организации METR.
9. Начинайте с малого, итерируйте и масштабируйте: Начните с создания всего от одного до пяти вопросов или задач, запустите модель на этой оценке и прочитайте расшифровки работы модели. Вы часто будете замечать, что оценка не улавливает то, что вы хотели протестировать, или оказывается слишком простой.
10. Реалистичное моделирование угроз, связанных с безопасностью: В идеале оценка безопасности должна обладать тем свойством, что при получении моделью высокого балла эксперты сочли бы вероятным возникновение серьезного инцидента. В большинстве случаев, когда модели показывали высокие результаты, эксперты приходили к выводу, что высокая производительность в этой версии оценки недостаточна для возникновения реальных поводов для беспокойства.
Как подать предложение
Вы можете отправить предложение через нашу форму заявки. Если у вас возникли вопросы, пожалуйста, обращайтесь по адресу eval-initiative@anthropic.com.
Наша команда будет рассматривать заявки по мере их поступления и связываться с авторами отобранных предложений для обсуждения дальнейших шагов. Мы предлагаем различные варианты финансирования, адаптированные под нужды и стадию каждого конкретного проекта.
Наш опыт показывает, что доработка оценки обычно требует нескольких итераций. У вас будет возможность напрямую взаимодействовать с нашими профильными экспертами из команд Frontier Red Team, тонкой настройки (Finetuning), доверия и безопасности (Trust & Safety) и других профильных подразделений. Наши команды смогут дать рекомендации, которые помогут доработать ваши оценки для достижения максимальной эффективности.
Мы надеемся, что эта инициатива послужит катализатором прогресса на пути к будущему, в котором всесторонняя оценка ИИ станет отраслевым стандартом. Мы приглашаем вас присоединиться к нам в этой важной работе и помочь сформировать дальнейший вектор развития.
Полный текст статьи читайте на Anthropic
