Система оценки для эпохи ИИ

Frame-1.png?w=1600&h=900&fit=fill

Главный вопрос, который я постоянно слышу от финансовых директоров, звучит просто: как извлечь больше ценности из наших расходов на искусственный интеллект?

Годами рынок оценивал успех программного обеспечения по уровню внедрения: купленным рабочим местам, активным пользователям и продленным лицензиям. Понимание ценности ИИ требует более весомого показателя: выполненной работы.

Базовый экономический вопрос, стоящий перед финансовыми директорами и другими бизнес-лидерами, заключается в том, растет ли ценность выполненной ИИ работы быстрее, чем затраты на ее создание.

Ответ на этот вопрос требует более глубокого анализа, чем такой показатель, как стоимость токена. У модели с более низкой ценой токены могут стоить дешевле, но для достижения отличных результатов может потребоваться больше попыток, больше времени или больше человеческой проверки. Более мощная модель может иметь более дорогие токены, но при этом выполнять ту же задачу за один проход. Важное значение имеет полная стоимость достижения успешного результата в сопоставлении с ценностью, которую этот результат создает.

Идеальной системой оценки для эпохи ИИ может считаться «Полезный интеллект на один доллар». Этот показатель отвечает на четыре ключевых вопроса:

  1. Выполняет ли ИИ действительно важную работу?
  2. Какова стоимость каждой успешно выполненной задачи?
  3. Могут ли люди полагаться на полученный результат?
  4. Приносит ли каждый вложенный в ИИ доллар больше ценности по мере роста использования?

1. Сколько полезной работы выполняется?

Начнем с самой работы.

Сколько проблем клиентов помог решить ИИ? Сколько изменений в коде он помог внедрить? Сколько контрактов он проверил? Сколько времени он вернул людям? Сколько решений стали лучше благодаря тому, что нужный контекст был доступен в нужный момент?

Токены создают ценность, когда они превращаются в полезную для людей работу. По мере того как модели становятся более способными, они могут брать на себя более длительные и сложные задачи: сохранять контекст, рассуждать в несколько этапов, работать с различными инструментами и адаптироваться по ходу дела.

Лучше всего начать с одного рабочего процесса. Определите, что означает «готово», и измерьте этот результат в той системе, где выполняется работа.

Для службы поддержки «готово» может означать решение проблемы клиента. Для команды инженеров это может быть изменение в коде, прошедшее все тесты. Для юридического отдела — контракт, проверенный точно и в срок.

Представьте финансовую команду, готовящуюся к обзору прогнозов. Большая часть работы выполняется до принятия окончательного решения: поиск последнего прогноза, перенос данных в Excel или Таблицы, выявление изменений, сверка вкладок, переделка слайдов и проверка того, что все цифры идеально сходятся.

ChatGPT Work может взять на себя значительную часть этого процесса, предоставив команде больше времени для решения действительно важных вопросов: Что изменилось? Почему? Что нам делать дальше?

На практике это и есть полезный интеллект на доллар. Выполняется больше работы и быстрее, в то время как люди тратят больше времени на применение суждений, творчества и экспертных знаний.

2. Какова реальная стоимость успешной задачи?

Следующий вопрос заключается в том, во сколько обходится качественное выполнение этой работы.

Задачи ИИ сильно различаются. Быстрый ответ может потребовать минимум вычислений. Рабочий процесс, связанный с программированием, исследованиями или финансами, может включать более глубокие рассуждения, использование инструментов и множество действий. Такие более сложные задачи могут требовать больших вычислительных ресурсов, но они способны создавать гораздо большую ценность.

На уровне модели стоимость успешной задачи зависит от цены, объема используемых вычислений и вероятности достижения правильного результата. Для бизнеса полная стоимость также включает рабочее время сотрудников, человеческую проверку, повторные попытки и переделку.

Расчет прост:

  • Сложите все затраты на выполнение работы.
  • Посчитайте задачи, которые достигли требуемого уровня качества.
  • Разделите общие затраты на количество успешных задач.

Именно поэтому самая низкая цена за токен не всегда обеспечивает самую низкую стоимость результата. Передовая модель может обеспечить наилучшую ценность даже для рутинного запроса, если она выдает правильный ответ с первого раза, сокращая количество повторных попыток, задержек, проверок и общих затрат на вычисления.

Семейство моделей с различными уровнями (tiers) предоставляет клиентам больше возможностей для оптимизации этого уравнения. Модель GPT-5.6, которую мы выпустили на прошлой неделе, представлена в трех вариантах: Sol — наша флагманская модель; Terra балансирует между производительностью и стоимостью; Luna — наша самая быстрая и доступная модель.

Эти уровни служат полезными отправными точками. Экономика всей задачи в конечном итоге должна определять выбор подходящей модели. Клиент может использовать Luna для быстрого высокообъемного рабочего процесса, Terra для работы, требующей большей глубины, или Sol, когда более сильные рассуждения дают лучший результат с меньшим количеством попыток.

Мы обучили GPT-5.6 извлекать больше полезной работы из каждого токена. В индексе искусственного интеллекта для агентов-программистов (Artificial Analysis Coding Agent Index) модель GPT-5.6 Sol с максимальным уровнем рассуждений установила новый стандарт качества, используя при этом на 54% меньше выходных токенов по сравнению с другой ведущей моделью. На графике ниже представлено это сравнение.

DeepSWE v1.1: Долгосрочные инженерные задачи; GPT-5.6 Sol достигает нового рекордного показателя в 72,7%, превосходя модель Claude Fable 5 с ее 69.9% при прогнозируемой стоимости API на 36,2% ниже.

Во всем семействе GPT-5.6 цель остается неизменной: больше успешной работы на каждый доллар. Большая эффективность делает существующие задачи более доступными по цене. Большие возможности делают возможными совершенно новые виды работ.

Каждое новое поколение моделей должно улучшать обе стороны этого уравнения. Клиенты должны иметь возможность выполнять более ценную работу, в то время как стоимость выполнения каждой задачи продолжает снижаться.

3. Насколько часто ИИ справляется с работой правильно?

Третий критерий — это надежность.

Внедрение ИИ обычно углубляется поэтапно. Сначала ИИ помогает создавать черновики. Затем он находит контекст и производит логические выкладки, используя различные инструменты и данные. Со временем он начинает предпринимать действия, обрабатывать исключения и завершать рабочие процессы, причем люди обеспечивают необходимый контроль и экспертную оценку там, где это необходимо.

Каждый шаг создает больше ценности и предъявляет больше требований к системе.

Надежность имеет прямую экономическую ценность. Когда результаты точны, имеют надежные источники, последовательны и должным образом эскалируются, люди тратят меньше времени на проверку, исправление и повторение работы. Успешные задачи обходятся дешевле, а организации приобретают уверенность в использовании ИИ в более важных рабочих процессах.

Команды могут сделать этот показатель конкретным, отслеживая три результата:

  • Готово к использованию: Результат соответствует уровню качества в исходном виде.
  • Требует исправления: Результат потребовал повторной попытки или правок человеком.
  • Требует эскалации: Потребовалось вмешательство человека для завершения работы.

Эти метрики дают более полную картину, чем простая точность модели. Они показывают, действительно ли ИИ снижает объем работы, связанной с завершением проекта.

Надежность также требует четких границ. Прежде чем ИИ перейдет от создания черновиков к совершению реальных действий, организации должны определить:

  • К каким данным система может иметь доступ.
  • Какие системы она может использовать или изменять.
  • В каких случаях человек должен проверить или одобрить действие.

Безопасность, конфиденциальность и контроль создают основу для более глубокого использования. Людям необходимо понимать, как ведет себя система, как обрабатываются их данные и каким образом регулируются ее действия.

ChatGPT Work опирается на надежную базу безопасности, конфиденциальности, соответствия требованиям и управления рабочей средой, заложенную в ChatGPT Enterprise. Это позволяет организациям предоставлять ИИ больше контекста и доступа к более ценным рабочим процессам, сохраняя при этом надлежащий контроль.

Функциональные возможности обеспечивают первое знакомство. Надежность делает ИИ частью того, как выполняется работа.

4. Приносит ли каждый доллар, потраченный на ИИ, больше работы по мере роста использования?

Заключительный вопрос заключается в том, улучшается ли экономика по мере масштабирования.

Компании могут измерить это, отслеживая один и тот же рабочий процесс во времени. Отслеживайте, сколько задач достигли уровня качества, общую стоимость их выполнения и стоимость одной успешной задачи. Если объем выполненной работы растет быстрее, чем общие затраты, в то время как качество держится на прежнем уровне или улучшается, каждый доллар, вложенный в ИИ, приносит больше ценности.

В центре этого уравнения находятся вычислительные мощности.

Вычисления питают исследования и каждую задачу, которую выполняет ИИ. Они определяют качество продукта, скорость, надежность, доступность и стоимость. Вычислительные мощности для обучения создают будущие возможности. Вычислительные мощности для инференса выполняют полезную работу сегодня. И то, и другое должно воплощаться в лучшие результаты для клиентов.

Лучшие модели, более эффективный инференс, специализированное оборудование, более высокий коэффициент использования, более умная маршрутизация и продуманный дизайн продуктов — все это повышает отдачу от вычислений. Каждое поколение инфраструктуры помогает обучать более способные модели. Затем лучшие алгоритмы, аппаратное и программное обеспечение помогают обслуживать эти модели с большей эффективностью.

Клиенты ощущают эти улучшения на практическом уровне: лучшие ответы, более быстрые результаты, меньше исправлений, более надежные продукты и более низкая стоимость выполнения необходимых им задач.

Эти достижения носят накопительный характер. Улучшенная инфраструктура ускоряет исследования. Исследования производят более способные и эффективные модели. Лучшие модели улучшают продукты. Лучшие продукты стимулируют внедрение, обучение и рост доходов. Такой рост поддерживает дальнейшие инвестиции в следующее поколение исследований, вычислений, развертывания и безопасности.

OpenAI объединяет эти элементы в рамках единой общей интеллектуальной платформы. Пользователи применяют ее через ChatGPT и ChatGPT Work. Разработчики создают свои решения с помощью Codex и API. Предприятия внедряют ее в системы, где непосредственно выполняется работа.

Когда совершенствуется один уровень, выгоду получают каждый продукт и каждый клиент.

Система оценки для эпохи ИИ

В совокупности эти четыре критерия показывают, растет ли показатель полезного интеллекта на один доллар.

Полезная работа говорит нам о том, что производит ИИ. Стоимость успешной задачи показывает, каких усилий стоит достижение результата. Надежность показывает, какой объем работы люди могут уверенно использовать. Ценность в масштабе показывает, приносят ли каждый доллар и каждая единица вычислений больше пользы с течением времени.

Наша цель — создать такой ИИ, который помогает людям выполнять более значимую работу, принимать более качественные решения и тратить больше времени на те аспекты своей профессиональной деятельности, которые требуют чисто человеческого суждения и творчества.

Наша задача — улучшать это уравнение с каждым новым поколением: создавать более способные модели, обеспечивать более быстрые и надежные результаты, а также снижать стоимость работы, которую необходимо выполнить клиентам.

Именно так ИИ со временем становится все более полезным для все большего числа людей и организаций.

Автор

Сара Фриар (Sarah Friar)

Полный текст статьи читайте на OpenAI