Как оценки (evals) определяют новый этап развития ИИ для бизнеса

Это руководство объясняет бизнес-лидерам, как фреймворки оценки («evals») превращают бизнес-цели в стабильные результаты.

Более одного миллиона компаний по всему миру используют ИИ для повышения эффективности и создания ценности. Однако некоторые организации сталкиваются с трудностями в достижении ожидаемых результатов. В чем причина этого разрыва?

В OpenAI мы используем ИИ внутри компании для достижения наших амбициозных целей. Один из ключевых наборов инструментов, которые мы применяем — это оценки (evals), то есть методы измерения и повышения способности ИИ-системы оправдывать ожидания. 

Подобно требованиям к продукту, оценки переводят размытые цели и абстрактные идеи в конкретные и четкие формулировки. Стратегическое использование оценок позволяет сделать ориентированный на клиента продукт или внутренний инструмент более надежным в масштабе, снизить количество критических ошибок, защитить от рисков и обеспечить организации измеримый путь к росту рентабельности инвестиций (ROI). 

В OpenAI наши модели — это наши продукты, поэтому наши исследователи используют строгиепередовые оценки (frontier evals)1для измерения эффективности моделей в различных областях. Хотя передовые оценки помогают нам быстрее выпускать более качественные модели, они не могут учесть все нюансы, необходимые для гарантии того, что модель справится с конкретным рабочим процессом в определенной бизнес-среде. Именно поэтому внутренние команды также создали десятки контекстных оценок (contextual evals), предназначенных для оценки производительности в рамках конкретного продукта или внутреннего процесса. Вот почему бизнес-лидеры должны научиться создавать контекстные оценки, адаптированные под нужды и операционную среду своей организации. 

Это руководство предназначено для руководителей предприятий, желающих внедрить оценки в своих организациях. Контекстные оценки, каждая из которых создана для конкретного рабочего процесса или продукта организации, находятся на этапе активного развития, и устоявшиеся процессы для них еще не сформировались. В результате в этой статье предлагается общий подход, который доказал свою эффективность в самых разных ситуациях. Мы ожидаем, что эта сфера будет развиваться и появятся новые фреймворки, учитывающие специфические бизнес-контексты и цели. Например, отличная оценка для передового потребительского продукта на базе ИИ может потребовать иного процесса, чем оценка для внутренней автоматизации на основе стандартной операционной процедуры. Мы верим, что представленный ниже фреймворк послужит сводом передовых практик в обоих случаях и станет полезным руководством при создании оценок, адаптированных под нужды вашей организации.

Как работают оценки: Спецификация → Измерение → Улучшение

Diagram titled

1. Спецификация: Определите, что значит «превосходно»

Начните с небольшой наделенной полномочиями команды, которая сможет простыми словами описать назначение вашей ИИ-системы, например: «Преобразовывать квалифицированные входящие письма в запланированные демо-показы, оставаясь в рамках фирменного стиля».

Эта команда должна состоять из специалистов с технической и предметной экспертизой (в данном примере в команду стоит включить экспертов по продажам). Они должны сформулировать наиболее важные результаты для измерения, описать рабочий процесс от начала до конца и определить каждую ключевую точку принятия решений, с которой столкнется ваша ИИ-система. Для каждого этапа этого рабочего процесса команда должна определить, как выглядит успех и чего следует избегать. Этот процесс создаст сопоставление десятков примеров входных данных (например, входящих писем) с выходными данными, которые система должна производить. Полученный эталонный набор (golden set) примеров должен стать живым, авторитетным справочником суждений и вкуса ваших лучших экспертов в отношении того, что представляет собой «превосходный» результат.

Не позволяйте трудностям старта ошеломить вас и не пытайтесь решить все сразу. Этот процесс носит итеративный и сложный характер. Раннее прототипирование может очень помочь. Изучение 50–100 результатов ранней версии системы покажет, как и когда она дает сбои. Этот «анализ ошибок» приведет к созданию таксономии различных ошибок (и их частоты), которую можно будет отслеживать по мере совершенствования вашей системы.

Этот процесс не является чисто техническим — он кросс-функциональный и сосредоточен на определении бизнес-целей и желаемых процессов. Не следует требовать от технических команд изолированного суждения о том, что лучше всего служит клиентам или потребностям других отделов, таких как продуктовый, отдел продаж или HR. Следовательно, предметные эксперты, технические руководители и другие ключевые стейкхолдеры должны разделять ответственность. 

2. Измерение: Тестирование в реальных условиях

Следующий шаг — измерение. Цель измерения состоит в надежном выявлении конкретных примеров того, как и когда система дает сбои. Для этого создайте выделенную тестовую среду, которая точно повторяет реальные условия, а не просто демо-версию или песочницу для промптов. Оценивайте производительность по сравнению с вашим эталонным набором и анализом ошибок в тех же условиях и при тех же граничных случаях, с которыми ваша система столйдется в реальности.

Рубрики могут помочь внести конкретику в оценку результатов работы вашей системы, однако существует риск переоценить поверхностные элементы в ущерб общим целям. Кроме того, некоторые качества трудно или невозможно измерить. В одних случаях важны традиционные бизнес-метрики, в других — потребуется изобрести новые. Держите экспертов в курсе дела на всех этапах и тесно связывайте процесс с вашими основными задачами.

Для реального тестирования системы по возможности используйте примеры из жизненных ситуаций, а также включайте или придумывайте редкие, но чреватые серьезными издержками граничные случаи. 

Некоторые оценки можно масштабировать с помощью оценщика на базе LLM (LLM grader) — ИИ-модели, которая оценивает результаты так же, как это сделал бы эксперт; тем не менее, важно сохранять участие человека. Ваш предметный эксперт должен регулярно проверять точность таких оценщиков, а также напрямую просматривать логи поведения системы. 

Оценки помогают определить, когда система готова к запуску, но они не заканчиваются на этом этапе. Вы должны непрерывно измерять качество реальных результатов работы системы, созданных на основе реальных входных данных. Как и для любого продукта, сигналы от ваших конечных пользователей (внешних или внутренних) имеют особую важность и должны быть заложены в вашу систему оценки.

3. Улучшение: Учитесь на ошибках

Последний шаг — настройка процесса непрерывного совершенствования. Устранение проблем, выявленных в ходе оценки, может принимать различные формы: уточнение промптов, настройка доступа к данным, обновление самой оценки для лучшего отражения целей и т. д. По мере выявления новых типов ошибок добавляйте их в анализ ошибок и устраняйте их. Каждая итерация дополняет предыдущую: новые критерии и более четкие ожидания от поведения системы помогают выявлять новые граничные случаи и тонкие, упрямые проблемы, требующие исправления.

Для поддержки этой итеративности создайте маховик данных (data flywheel). Регистрируйте входные данные, результаты и исходы; периодически выбирайте образцы из этих логов и автоматически направляйте неоднозначные или дорогостоящие кейсы на экспертную оценку. Добавляйте экспертные суждения в свой фреймворк оценки и анализ ошибок, а затем используйте их для обновления промптов, инструментов или моделей. Проходя через этот цикл, вы будете более четко определять свои ожидания от системы, точнее настраивать ее под эти ожидания и выявлять дополнительные релевантные результаты и исходы для отслеживания. Масштабирование этого процесса дает большой, дифференцированный и специфичный для вашего контекста набор данных, который трудно скопировать — это ценный актив, который ваша организация может использовать для создания лучшего продукта или процесса на рынке. 

Хотя оценки создают систематический способ улучшения вашей ИИ-системы, могут возникать новые виды сбоев. На практике по мере развития моделей, данных и бизнес-целей оценки также необходимо постоянно поддерживать, расширять и подвергать стресс-тестированию.

Для внедрения внешних решений оценки не заменяют более традиционные A/B-тесты и продуктовые эксперименты. Они дополняют традиционное экспериментирование, помогая направлять друг друга и обеспечивая понимание того, как вносимые вами изменения влияют на производительность в реальном мире. 

Что оценки означают для бизнес-лидеров

Каждый крупный технологический сдвиг перестраивает операционную эффективность и конкурентные преимущества. Такие фреймворки, как OKR и KPI, помогли организациям переориентироваться на «измерение того, что важно» для их бизнеса в эпоху аналитики больших данных. Оценки — это естественное продолжение измерения для эпохи искусственного интеллекта.

Работа с вероятностными системами требует новых видов измерений и более глубокого учета компромиссов. Руководители должны решать, когда точность имеет решающее значение, когда можно проявить большую гибкость и как сбалансировать скорость и надежность.

Оценки трудно реализовать по той же причине, по которой сложно создавать отличные продукты: они требуют строгости, видения и вкуса. При правильном подходе оценки становятся уникальными факторами дифференциации. В мире, где информация находится в свободном доступе, а экспертные знания демократизированы, ваше преимущество зависит от того, насколько успешно ваши системы работают в вашем контексте. Надежные оценки создают нарастающие преимущества и институциональные ноу-хау по мере совершенствования ваших систем. 

По своей сути оценки связаны с глубоким пониманием бизнес-контекста и целей. Если вы не можете определить, что значит «превосходно» для вашего сценария использования, вы вряд ли этого добьетесь. В этом смысле оценки подчеркивают ключевой урок эпохи ИИ: управленческие навыки — это навыки работы с ИИ. Четкие цели, прямая обратная связь, рассудительность и ясное понимание вашего ценностного предложения, стратегии и процессов по-прежнему имеют значение, возможно, даже больше, чем когда-либо.

По мере появления новых передовых практик и фреймворков мы будем делиться ими. А пока мы призываем вас экспериментировать с оценками и выяснять, какие процессы подходят для ваших нужд лучше всего. Для начала определите проблему, которую нужно решить, и своего эксперта в данной области, соберите небольшую команду и, если вы создаете решения на базе нашего API, изучите нашу документацию платформы.

Не надейтесь на «превосходный» результат — задайте его, измерьте и улучшайте систему до тех пор, пока не достигнете его.

Автор

OpenAI

Сноски

  1. 1

    Если вы хотите поддержать нашу работу по созданию нового поколения ИИ-моделей, мы приглашаем вас внести свой вклад в GDPVal — наш новейший бенчмарк оценки производительности ИИ-моделей на реальных задачах. Если вы являетесь отраслевым экспертом и хотите внести свой вклад в GDPval, пожалуйста, выразите свою заинтересованность здесь. Если вы являетесь клиентом OpenAI и хотели бы принять участие в следующем этапе тестирования GDPval, пожалуйста, сообщите нам об этом здесь.

Полный текст статьи читайте на OpenAI