Передовые практики развертывания языковых моделей

Cohere, OpenAI и AI21 Labs разработали предварительный набор передовых практик, применимых к любой организации, которая разрабатывает или развертывает большие языковые модели.

Best Practices For Deploying Language Models

Иллюстрация: Джастин Джей Ван (Justin Jay Wang)

Cohere, OpenAI и AI21 Labs разработали предварительный набор передовых практик, применимых к любой организации, которая разрабатывает или развертывает большие языковые модели. Компьютеры, способные читать и писать, уже здесь, и они обладают потенциалом кардинально повлиять на повседневную жизнь. Будущее взаимодействия человека и машины полно возможностей и перспектив, однако любая мощная технология требует тщательного развертывания.

Приведенное ниже совместное заявление представляет собой шаг на пути к созданию сообщества для решения глобальных проблем, порождаемых прогрессом в области ИИ, и мы призываем другие организации, желающие принять в этом участие, связаться с нами.

Совместные рекомендации по развертыванию языковых моделей

Мы рекомендуем несколько ключевых принципов, которые помогут поставщикам больших языковых моделей (LLM) снизить риски этой технологии, чтобы в полной мере реализовать ее потенциал в расширении возможностей человека.

Хотя эти принципы были разработаны на основе нашего опыта предоставления LLM через API, мы надеемся, что они окажутся полезными независимо от стратегии выпуска (например, открытый исходный код или использование внутри компании). Мы ожидаем, что эти рекомендации со временем претерпят значительные изменения, поскольку коммерческое применение LLM и сопутствующие аспекты безопасности являются новыми и постоянно развиваются. Мы активно изучаем ограничения LLM и возможные пути их ненадлежащего использования, а также устраняем их, и со временем будем обновлять эти принципы и практики в сотрудничестве с более широким сообществом.

Мы делимся этими принципами в надежде, что другие поставщики LLM смогут извлечь из них уроки и принять их, а также для активизации общественного обсуждения вопросов разработки и развертывания LLM.

Запрет ненадлежащего использования

Публикуйте рекомендации по использованию и условия предоставления услуг LLM таким образом, чтобы исключить причинение существенного вреда отдельным лицам, сообществам и обществу, например, посредством спама, мошенничества или искусственного формирования общественного мнения (астротурфинга). В рекомендациях по использованию также следует указать сферы, где применение LLM требует особого контроля, и запретить недопустимые сценарии использования с высоким уровнем риска, такие как классификация людей на основе защищенных признаков.

Создавайте системы и инфраструктуру для контроля за соблюдением рекомендаций по использованию. Это может включать в себя ограничение частоты запросов (rate limits), фильтрацию контента, утверждение заявок на приложение до предоставления доступа к продакшн-среде, мониторинг аномальной активности и другие меры защиты.

Минимизация непреднамеренного вреда

Проактивно снижайте риски вредоносного поведения моделей. Передовые практики включают в себя комплексную оценку моделей для надлежащего определения ограничений, минимизацию потенциальных источников предвзятости в обучающих корпусах, а также методы минимизации небезопасного поведения, например, посредством обучения на основе отзывов людей.

Документируйте известные слабые места и уязвимости, такие как предвзятость или способность генерировать небезопасный код, поскольку в некоторых случаях никакие профилактические меры не могут полностью исключить вероятность непреднамеренного вреда. Документация также должна содержать передовые практики безопасности, специфичные для конкретных моделей и сценариев использования.

Продуманное сотрудничество с заинтересованными сторонами

Формируйте команды с разнообразным опытом и запрашивайте широкие отзывы. Разнообразие точек зрения необходимо для характеристики и понимания того, как языковые модели будут функционировать в разнообразном реальном мире, где без должного контроля они могут усиливать предвзятость или оказаться бесполезными для некоторых групп населения.

Публично раскрывайте уроки, извлеченные из вопросов безопасности и ненадлежащего использования LLM, чтобы обеспечить их широкое внедрение и содействовать межотраслевой доработке передовых практик.

Относитесь с уважением ко всему труду в цепочке поставок языковых моделей. Например, поставщики должны предъявлять высокие требования к условиям труда сотрудников, проверяющих результаты работы моделей внутри компании, и требовать от подрядчиков соблюдения четко определенных стандартов (например, обеспечивать разметчикам возможность отказаться от выполнения определенной задачи).

Будучи поставщиками LLM, публикация этих принципов знаменует собой первый шаг в совместном управлении более безопасной разработкой и развертыванием больших языковых моделей. Мы рады продолжить сотрудничество друг с другом и с другими сторонами для поиска новых возможностей по снижению непреднамеренного вреда и предотвращению злонамеренного использования языковых моделей.

  • Скачать в формате PDF

Поддержка со стороны других организаций

«Хотя большие языковые модели открывают большие перспективы, они имеют присущие им серьезные проблемы безопасности, над которыми необходимо работать. Эти передовые практики служат важным шагом на пути к минимизации вреда от таких моделей и максимизации их потенциальных преимуществ».

—Anthropic

«Поскольку большие языковые модели (LLM) становятся все более мощными и выразительными, снижение рисков приобретает все большее значение. Мы приветствуем эти и другие усилия, направленные на проактивное снижение рисков и привлечение внимания пользователей к областям, требующим особой бдительности. Изложенные здесь принципы являются важным вкладом в глобальный диалог».

—Джон Бансемер (John Bansemer), директор проекта CyberAI и старший научный сотрудник Центра безопасности и новых технологий (CSET)

«Google подтверждает важность комплексных стратегий при анализе моделей и данных обучения в целях минимизации рисков причинения вреда, предвзятости и искажения информации. Это обдуманный шаг, предпринятый этими поставщиками ИИ в целях продвижения принципов и документации, направленных на обеспечение безопасности ИИ».

—Google

«Чтобы реализовать потенциал больших языковых моделей, мы должны продолжать сотрудничество в рамках отрасли и делиться передовыми практиками ответственной разработки и развертывания таких моделей с одновременным снижением потенциальных рисков. Мы приветствуем эти и другие усилия, которые стимулируют продуманные и практические действия по всей отрасли, опираясь на опыт ключевых заинтересованных сторон из академических кругов, гражданского общества и правительств и сотрудничая с ними».

—Microsoft

«Безопасность фундаментальных моделей, таких как большие языковые модели, вызывает все большую озабоченность общества. Мы высоко оцениваем инициативу Cohere, OpenAI и AI21 Labs, которые сделали первый шаг к определению ключевых принципов ответственной разработки и развертывания с точки зрения разработчиков моделей. Нам предстоит еще многое сделать, и мы считаем крайне важным привлечь больше голосов из академических кругов, промышленности и гражданского общества для выработки более детальных принципов и норм сообщества. Как мы отмечаем в нашей недавней публикации в блоге, важен не только конечный результат, но и легитимность самого процесса».

—Перси Лян (Percy Liang), директор Стэнфордского центра исследований фундаментальных моделей (CRFM)

Присоединяйтесь к работе

Если вы занимаетесь разработкой языковых моделей или работаете над снижением связанных с ними рисков, мы будем рады пообщаться с вами. Пожалуйста, обращайтесь по адресу bestpractices@openai.com.

Автор

OpenAI

Полный текст статьи читайте на OpenAI