Экономический индекс Anthropic: выводы на основе Claude 3.7 Sonnet

В прошлом месяце мы запустили Экономический индекс Anthropic (Anthropic Economic Index) — новую инициативу, в рамках которой мы регулярно публикуем данные и исследования, направленные на понимание влияния искусственного интеллекта на рынки труда и экономику в динамике.
Сегодня мы выпускаем наш второй исследовательский отчет в рамках Индекса, охватывающий данные об использовании Claude.ai после запуска Claude 3.7 Sonnet — нашей новейшей и самой мощной модели, сильными сторонами которой являются агентное программирование и новый режим «расширенного мышления» (extended thinking).
Краткие результаты нашего последнего исследования:
- С момента запуска Claude 3.7 Sonnet мы наблюдаем рост доли использования для написания кода, а также в образовательных, научных и медицинских приложениях;
- Новый режим «расширенного мышления» модели Claude 3.7 Sonnet пользователи применяют преимущественно для решения технических задач, включая те, что связаны с такими профессиями, как исследователи в области компьютерных наук, разработчики программного обеспечения, мультипликаторы и дизайнеры видеоигр;
- Мы публикуем данные о распределении задач по принципу «дополнения» (augmentation) и «автоматизации» (automation) на уровне конкретных задач и профессий. Например, задачи, связанные с копирайтерами и редакторами, демонстрируют наибольший объем итераций над задачами, когда человек и модель пишут что-то вместе. Напротив, задачи, связанные с переводчиками, показывают один из самых высоких уровней директивного поведения — когда модель выполняет задачу при минимальном участии человека.
Кроме того, мы выпускаем первую в своем роде таксономию использования Claude.ai, построенную снизу вверх (bottom-up). Этот новый набор данных охватывает 630 детальных категорий — от «Помощь в решении бытовых проблем с сантехникой, водоснабжением и обслуживанием» до «Предоставление рекомендаций по аккумуляторным технологиям и системам зарядки». Мы надеемся, что эта таксономия окажется полезной для исследователей и выявит сценарии использования, которые могут быть упущены при подходах сверху вниз, сопоставляющих использование со списком заранее определенных задач.
Наборы данных для этих анализов доступны для бесплатной загрузки.
Читайте далее, чтобы узнать подробности о наших выводах.
Что изменилось после запуска Claude 3.7 Sonnet?
В прошлом месяце мы представили Claude 3.7 Sonnet — нашу самую совершенную на сегодняшний день модель с «режимом расширенного мышления». Мы повторно провели наш предыдущий анализ на данных за 11 дней после запуска, охвативших 1 миллион анонимизированных диалогов в Claude.ai Free и Pro. Подавляющая часть проанализированных данных пришлась на Claude 3.7 Sonnet, так как она установлена по умолчанию на Claude.ai и в нашем мобильном приложении.
Напоминаем, что наш инструмент для анализа с сохранением конфиденциальности, Clio, соотносит каждый диалог с одной из 17 000 задач из базы данных O*NET Министерства труда США. Затем мы изучаем общие закономерности в профессиях и высокоуровневых профессиональных категориях, связанных с этими задачами.
Изучая распределение этих 1 миллиона диалогов, мы видим, что доля использования в нескольких профессиональных категориях умеренно выросла, включая программирование, образование и науку. Хотя рост использования в сфере программирования ожидался благодаря улучшенным результатам Claude 3.7 Sonnet в бенчмарках по кодингу, рост в других категориях может отражать либо продолжающееся распространение ИИ в экономике, либо новые варианты применения программирования в этих областях, либо неожиданное улучшение возможностей самой модели.
За два месяца, прошедших с момента сбора исходных данных, мы наблюдаем рост доли использования для написания кода, образования и науки. На графике показана доля трафика Claude.ai Free и Pro по основным профессиональным категориям в O*NET. Серым цветом показано распределение из нашего первого отчета, охватывающего данные за декабрь '25 — январь '25. Цветные полосы показывают увеличение (зеленый) и уменьшение (синий) доли использования по нашим новым данным за февраль '25 — март '25. Обратите внимание, что на графике показана доля использования, а не абсолютные показатели. См. Приложение для графика, показывающего изменения по всему списку профессиональных категорий.
Как люди используют режим расширенного мышления?
В Claude 3.7 Sonnet появился новый режим «расширенного мышления», который при активации пользователем позволяет модели дольше обдумывать ответы на более сложные вопросы.
Наш анализ показывает, что режим расширенного мышления в Claude 3.7 Sonnet используется преимущественно в контексте решения технических и творческих задач. Лидируют задачи, связанные с учеными в области компьютерных и информационных исследований (почти 10% использования расширенного мышления), за ними следуют разработчики программного обеспечения (около 8%). Задачи, связанные с цифровыми креативными ролями, такими как мультипликаторы (~7%) и дизайнеры видеоигр (~6%), также демонстрируют значительное использование.
Хотя эти ранние паттерны использования дают представление о том, когда люди предпочитают применять режим расширенного мышления, множество важных вопросов относительно этой новой возможности модели все еще остаются открытыми. Чтобы стимулировать дальнейшие исследования в этой области, мы выпускаем новый набор данных, который сопоставляет каждую задачу O*NET с долей использования в ней режима мышления. Этот набор данных доступен на нашей странице в Hugging Face.
Для каких задач чаще всего используется режим расширенного мышления? На графике показаны профессии O*NET с наибольшей долей использования режима мышления в связанных с ними задачах. Представлены только те профессии, доля которых в данных составляет не менее 0,5%.Как соотносятся дополнение и автоматизация в зависимости от задач и профессий?
В нашем предыдущем отчете мы анализировали, как использование ИИ различается между дополняющими (augmentative) сценариями, такими как обучение или итеративная доработка результатов, и автоматизирующими (automative) сценариями, такими как прямой запрос на выполнение задачи или отладка ошибок. Наш анализ показывает, что баланс между дополнением и автоматизацией в новых данных практически не изменился: на долю дополнения по-прежнему приходится 57% использования. Тем не менее, мы зафиксировали некоторые изменения в типах использования автоматизации и дополнения — например, доля обучающих взаимодействий, когда пользователь просит Claude предоставить информацию или объяснить различные темы, выросла с ~23% до ~28%.
Баланс между дополнением и автоматизацией оставался относительно постоянным за два месяца между выборками данных (V1 и V2), хотя доля обучающих диалогов заметно возросла.
Мы получили множество запросов через нашу форму для исследователей с просьбой опубликовать данные по автоматизации и дополнению на уровне задач и профессий. Именно это мы и делаем в данном отчете, размещая эти данные на нашей странице в Hugging Face.
Если разбить данные по укрупненным профессиональным категориям, мы увидим, что некоторые категории носят ярко выраженный дополняющий характер; например, задачи в сфере общественного и социального обслуживания, включающие просветительскую деятельность и консультации, приближаются к 75% дополнения. С другой стороны, в задачах, связанных с производством, а также компьютерными и математическими профессиями, баланс смещается ближе к соотношению 50 на 50. Мы не обнаружили ни одной профессиональной категории, где бы доминировала автоматизация.
Доля различных режимов взаимодействия по укрупненным профессиональным категориям. Представлены только те профессиональные категории, доля которых в данных составляет не менее 0,5%.
Переходя к более детальному уровню, мы можем рассмотреть конкретные профессии в рамках этих категорий, а также задачи, связанные с ними. Например, задачи, связанные с копирайтерами и редакторами, демонстрируют наибольший объем итераций над задачами, когда пользователь выполняет различные задачи по написанию и редактированию текстов совместно с моделью. Напротив, задачи, связанные с переводчиками (Translators and Interpreters), показывают один из самых высоких уровней директивного поведения — когда модель используется для перевода документов при минимальном участии человека. Обратите внимание, что описания O*NET могут не совсем точно отражать то, для чего именно используется Claude — например, хотя мы видим использование в профессии «художники-живописцы, включая художников, скульпторов и иллюстраторов», Claude, вероятнее всего, гораздо чаще применяется для создания цифрового искусства, чем для живописи или скульптуры.

Топ профессий по типу взаимодействия. Для каждой из пяти категорий взаимодействия (Обучение, Итерация над задачей, Валидация, Директива и Обратная связь) мы отображаем профессии с наибольшей долей использования в этой категории. Например, библиотекари демонстрируют самую высокую долю обучающих взаимодействий — около 56%, в то время как копирайтеры лидируют в итерациях над задачами — около 58%. Каждая панель включает задачу O*NET в рамках профессии, которая сильнее всего повлияла на данный паттерн взаимодействия; это рассчитывается исходя как из частоты возникновения задачи, так и из того, как часто данный режим взаимодействия используется в рамках задачи. Показатели для других режимов обучения приведены в Приложении.Обратите внимание, что описания O*NET могут не полностью отражать реальное применение Claude — например, несмотря на зафиксированное использование в профессии «художники-живописцы, включая художников, скульпторов и иллюстраторов», на Claude.ai использование, вероятнее всего, сильнее смещено в сторону цифрового искусства, чем скульптуры. Показаны только профессии с представленностью в общем наборе данных не менее 0,5%.Таксономия использования Claude.ai, построенная снизу вверх
Наши исследования до сих пор опирались на базу данных задач и профессий O*NET, созданную и поддерживаемую Министерством труда США. Хотя O*NET охватывает очень большое количество задач, она может не являться лучшей таксономией для описания возможностей моделей общего назначения, которые могут применяться для задач, отсутствующих в O*NET — и, следовательно, упускаемых из виду нашим анализом.
Чтобы восполить этот пробел, мы выпускаем новый набор данных пользовательской активности на Claude.ai, построенный снизу вверх. Этот набор данных также был создан с помощью Clio и использует тот же массив анонимизированных диалогов, что и предыдущий анализ, что позволяет сопоставлять подходы сверху вниз и снизу вверх. Он состоит из 630 детальных кластеров с соответствующими описаниями, метриками распространенности и показателями автоматизации/дополнения, организованных в три иерархических уровня.
Хотя детальный анализ этого набора данных мы оставляем для будущих работ, мы выделим несколько наиболее интересных кластеров:
- Помощь в управлении системами водоснабжения и инфраструктурными проектами
- Создание физических симуляций с возможностями интерактивной визуализации
- Помощь в подборе шрифтов, их внедрении и устранении неполадок
- Помощь в создании или улучшении материалов для подачи заявки на работу
- Предоставление рекомендаций по аккумуляторным технологиям и системам зарядки
- Помощь с учетом часовых поясов в коде и базах данных
Заключение
По мере развития моделей должны совершенствоваться и методы оценки их экономического воздействия. Во втором отчете, охватывающем данные после запуска Claude 3.7 Sonnet, мы фиксируем относительно умеренный рост сценариев использования в программировании, образовании и науке, а также отсутствие изменений в балансе между дополнением и автоматизацией. Мы выяснили, что новый режим расширенного мышления Claude чаще всего применяется в технических областях и задачах, а также выявили паттерны автоматизации и дополнения для различных задач и профессий. Мы публикуем наборы данных для обоих этих направлений анализа.
В ближайшие месяцы мы намерены продолжить отслеживание этих метрик и разработку новых по мере расширения возможностей моделей и их применения в различных секторах экономики.
Работайте с нами
Если вам интересна работа в Anthropic над исследованием влияния ИИ на рынок труда, мы приглашаем вас подать заявку на вакансии исследователя в области общественного воздействия (Societal Impacts Research Scientist), инженера-исследователя (Research Engineer), а также экономиста (Economist).
Приложение
В этом приложении мы делимся дополнительными результатами и техническими деталями.
Кривая задач
Мы также пересчитали график «глубины использования задач» из нашей оригинальной работы. В целом мы наблюдаем очень похожую кривую по сравнению с первым анализом. Если и есть отличия, то площадь под кривой для новой модели немного меньше — возможно, из-за некоторого усиления концентрации диалогов в нашей выборке вокруг программирования. Тем не менее, хотя за последние два месяца мы не увидели кардинальных изменений этой кривой, мы продолжим мониторинг по мере развития возможностей моделей и пользовательских интерфейсов.
Глубина использования задач в разрезе профессий. Например, на графике показано, что примерно для 40% профессий ИИ используется как минимум в 20% их задач (где x = 0,2, y ≈ 0,4). Кривые в первом и втором отчетах практически не изменились.Полные изменения по профессиональным категориям
Процентная доля использования по профессиональным категориям, отражающая показатели из нашего первоначального отчета (серые полосы) с соответствующим ростом (желтый) и снижением (синий) во втором отчете. Компьютерные и математические профессии представляют собой категорию с наибольшим абсолютным приростом (+3%), в то время как несколько других категорий, таких как образование и наука, демонстрируют заметный процентный рост.
Результаты для других режимов взаимодействия


Топ профессий по типу взаимодействия. Для каждой из пяти категорий взаимодействия (Обучение, Итерация над задачей, Валидация, Директива и Обратная связь) мы отображаем профессии с наибольшей долей использования в этой категории. Например, библиотекари демонстрируют самую высокую долю обучающих взаимодействий — около 56%, в то время как копирайтеры лидируют в итерациях над задачами — около 58%. Каждая панель включает задачу O*NET в рамках профессии, которая сильнее всего повлияла на данный паттерн взаимодействия; это рассчитывается исходя как из частоты возникновения задачи, так и из того, как часто данный режим взаимодействия используется в рамках задачи. Показатели для других режимов обучения приведены в основной части публикации.Обратите внимание, что описания O*NET могут не полностью отражать реальное применение Claude — например, несмотря на зафиксированное использование в профессии «художники-живописцы, включая художников, скульпторов и иллюстраторов», использование на Claude.ai, вероятнее всего, сильнее смещено в сторону цифрового искусства, чем скульптуры. Показаны только профессии с представленностью в общем наборе данных не менее 0,5%.Дополнительные методологические детали
Хотя мы в основном следуем методологии нашего первоначального отчета, мы внесли несколько изменений, которые фиксируем здесь ради прозрачности:
- В отличие от предыдущего отчета, мы не проводим фильтрацию на предмет того, относятся ли диалоги к какой-либо профессиональной категории. Вместо этого мы просто исключаем диалоги, которые были помечены нашими классификаторами безопасности. Мы обнаружили, что такие подходы приводят к результатам, аналогичным нашему первому анализу, при этом сохраняя больший объем данных, который мы можем опубликовать через нашу таксономию использования, построенную снизу вверх.
- Мы используем Claude 3.7 Sonnet во всех случаях, где ранее применяли Claude 3.5 Sonnet. Мы выяснили, что использование нашей более новой модели повысило точность классификации согласно внутренним бенчмаркам, которые мы используем для оценки точности Clio.
Полный текст статьи читайте на Anthropic
