Партнерство с Accenture в области встроенной оценки

Мы начинаем партнерство с компанией Accenture для проведения независимой оценки передовых систем ИИ. Это важный шаг в реализации обязательства, данного в статье нашего генерального директора «Мы должны задавать темп на передовом рубеже» (We Must Pace the Frontier), по внедрению независимых оценщиков внутрь компании Anthropic.
Партнерство будет возглавлять Faculty — специализированное подразделение Accenture по работе с ИИ. Оно будет включать оценку и тестирование моделей на уязвимости (red-teaming), проведение проверок на соответствие ценностям (alignment) и тестирование механизмов защиты моделей. Accenture помогает компаниям и правительствам внедрять искусственный интеллект в самых разных отраслях. Их понимание того, как предприятия используют ИИ на практике, лежит в основе их подхода к безопасности, и этот опыт они привнесут в оценку наших моделей.
Anthropic и Accenture ожидают инвестировать не менее чем по 1 миллиарду долларов каждая в развитие потенциала в этой области в течение следующих пяти лет.
Встроенная оценка — это новое явление, и многие детали ее работы еще прорабатываются. В отличие от современных внешних оценщиков, встроенные оценщики будут работать внутри AI-компаний, обладая уровнем доступа, сопоставимым с доступом сотрудника. Такой доступ позволяет им наблюдать за тем, как формируются модели в процессе обучения, прослеживать решения, определяющие порядок создания и развертывания этих моделей, а также напрямую общаться с сотрудниками. С этой позиции встроенные оценщики могут оценивать деятельность компании, проверять выполнение ее обязательств по безопасности и выявлять слепые зоны. Они также могут сообщать об инцидентах и предоставлять общественности более обоснованную информацию о преимуществах и рисках.
Следует уточнить: независимые встроенные оценщики не снимают с нас ответственности, но делают ее более проверяемой. Безопасность наших моделей остается нашей обязанностью.
На данный момент не существует стандартов относительно того, к какой информации должны иметь доступ встроенные оценщики и как они должны отчитываться о своих находках. Также нет устоявшейся системы финансирования независимой оценки. В долгосрочной перспективе мы считаем, что финансирование должно поступать из объединенных или государственных источников, как мы заявляли в нашей концепции передового ИИ (Advanced AI Framework) в июне. Поскольку в настоящее время ни того, ни другого не существует, мы планируем работать с различными оценщиками в рамках различных схем финансирования.
Учитывая важность и срочность этой работы, Anthropic будет финансировать работу Accenture напрямую. Мы также ведем диалог с METR и другими некоммерческими организациями, занимающимися оценкой, с целью пилотирования элементов встроенной оценки за счет их собственного финансирования. В конечном счете мы верим, что сфере передового ИИ необходима экосистема оценщиков, работающих на основе общих стандартов.
Мы ожидаем, что лаборатории передового ИИ будут работать с несколькими организациями одновременно. Наше партнерство не является эксклюзивным: Anthropic будет сотрудничать с другими оценщиками, о которых будет объявлено в ближайшие недели, а Accenture будет работать с другими разработчиками ИИ в аналогичном качестве.
Мы продолжим обучать и выпускать передовые модели, и мы хотим, чтобы независимые оценщики работали рядом с нами в этом процессе. Мы делимся этими наработками уже сейчас, чтобы люди и другие разработчики ИИ могли ознакомиться с нашим подходом. Мы ожидаем, что наш подход будет развиваться по мере взросления этой области, и мы будем делиться новыми подробностями по мере начала работы и привлечения дополнительных оценщиков.
Полный текст статьи читайте на Anthropic
