Представляем Claude нового поколения

Claude 3

Сегодня мы анонсируем семейство моделей Claude 3, которые устанавливают новые отраслевые стандарты в широком спектре когнитивных задач. В семейство входят три передовые модели в порядке возрастания возможностей: Claude 3 Haiku, Claude 3 Sonnet и Claude 3 Opus. Каждая последующая модель предлагает все более высокую производительность, позволяя пользователям выбирать оптимальный баланс между интеллектом, скоростью и стоимостью для их конкретных задач.

Opus и Sonnet теперь доступны для использования на сайте claude.ai и в API Claude, который теперь официально запущен в 159 странах. Haiku станет доступна в ближайшее время.

Семейство моделей Claude 3

Новый стандарт интеллектуальных возможностей

Opus, наша самая умная модель, превосходит аналоги по большинству стандартных тестов для оценки ИИ-систем, включая экспертные знания на уровне бакалавриата (MMLU), экспертные рассуждения на уровне магистратуры (GPQA), базовую математику (GSM8K) и многое другое. Она демонстрирует уровень понимания и беглости речи, близкий к человеческому, при решении сложных задач, задавая вектор развития общего искусственного интеллекта.

Все модели Claude 3 обладают расширенными возможностями в анализе и прогнозировании, создании нюансированного контента, генерации кода и общении на языках, отличных от английского, таких как испанский, японский и французский.

Ниже приведено сравнение моделей Claude 3 с аналогами наших конкурентов по нескольким тестам [1] возможностей:

Практически мгновенные результаты

Модели Claude 3 могут обслуживать интерактивные чаты с клиентами, автодополнение текста и задачи по извлечению данных, где ответы требуются немедленно и в реальном времени.

Haiku — это самая быстрая и экономичная модель на рынке в своей весовой категории по уровню интеллекта. Она способна прочитать насыщенную информацией и данными научную статью с arXiv (~10 тыс. токенов) с диаграммами и графиками менее чем за три секунды. После запуска мы планируем еще больше улучшить её производительность.

Для подавляющего большинства рабочих нагрузок Sonnet работает в 2 раза быстрее, чем Claude 2 и Claude 2.1, обладая при этом более высоким уровнем интеллекта. Она превосходно справляется с задачами, требующими быстрых ответов, такими как поиск информации или автоматизация продаж. Opus обеспечивает скорость, сопоставимую с Claude 2 и 2.1, но с гораздо более высоким уровнем интеллекта.

Широкие возможности компьютерного зрения

Модели Claude 3 обладают сложными возможностями визуального восприятия на уровне других ведущих моделей. Они могут обрабатывать широкий спектр визуальных форматов, включая фотографии, диаграммы, графики и технические схемы. Мы особенно рады предоставить эту новую модальность нашим корпоративным клиентам, у некоторых из которых до 50% баз знаний закодировано в различных форматах, таких как PDF-файлы, блок-схемы или презентации.

Меньше необоснованных отказов

Предыдущие модели Claude часто давали ненужные отказы, что свидетельствовало о недостатке понимания контекста. Мы добились значительного прогресса в этой области: Opus, Sonnet и Haiku со значительно меньшей вероятностью будут отказываться отвечать на запросы, находящиеся на грани системных ограничений, по сравнению с предыдущими поколениями моделей. Как показано ниже, модели Claude 3 демонстрируют более тонкое понимание запросов, распознают реальный вред и гораздо реже отказываются отвечать на безобидные запросы.

Повышенная точность

Компании разного масштаба полагаются на наши модели для обслуживания своих клиентов, поэтому для нас критически важно, чтобы результаты работы моделей сохраняли высокую точность при масштабировании. Для оценки этого мы используем большой набор сложных вопросов на основе фактов, которые направлены на выявление известных слабостей в текущих моделях. Мы классифицируем ответы на правильные, неправильные (или галлюцинации), а также признания неуверенности, когда модель заявляет, что не знает ответа, вместо того чтобы предоставлять неверную информацию. По сравнению с Claude 2.1, Opus демонстрирует двукратное улучшение точности (правильных ответов) на эти сложные открытые вопросы, а также снижает уровень неверных ответов.

Помимо создания более надежных ответов, в ближайшее время мы добавим в модели Claude 3 возможность цитирования, чтобы они могли указывать на точные предложения в справочных материалах для подтверждения своих ответов.

Длинный контекст и практически идеальная память

Семейство моделей Claude 3 при запуске будет изначально поддерживать окно контекста в 200 тысяч токенов. Тем не менее, все три модели способны принимать входные данные, превышающие 1 миллион токенов, и мы можем предоставить эту возможность избранным клиентам, которым требуется повышенная вычислительная мощность.

Для эффективной обработки запросов с длинным контекстом моделям необходимы надежные возможности извлечения информации. Тест «Игла в стоге сена» (NIAH) измеряет способность модели точно извлекать информацию из огромного массива данных. Мы повысили надежность этого бенчмарка, используя одну из 30 случайных пар «игла/вопрос» на каждый запрос и проводя тестирование на разнообразном краудсорсинговом корпусе документов. Claude 3 Opus не только достигла практически идеальной памяти, превысив точность в 99%, но в некоторых случаях даже выявила ограничения самого теста, распознав, что предложение-«игла» было искусственно внедрено в исходный текст человеком.

Ответственный подход к разработке

Мы разработали семейство моделей Claude 3 так, чтобы они были столь же надежными, сколь и функциональными. У нас есть несколько специализированных команд, которые отслеживают и минимизируют широкий спектр рисков: от дезинформации и материалов с насилием над детьми до биологических угроз, вмешательства в выборы и навыков автономной репликации. Мы продолжаем развивать такие методы, как конституционный ИИ (Constitutional AI), которые повышают безопасность и прозрачность наших моделей, а также настроили наши модели для предотвращения проблем с конфиденциальностью, которые могут возникнуть из-за новых модальностей.

Устранение предвзятости в усложняющихся моделях — это непрерывный процесс, и в новом релизе мы добились серьезных успехов. Как показано в карточке модели, Claude 3 демонстрирует меньше предвзятости, чем наши предыдущие модели, согласно бенчмарку предвзятости для ответов на вопросы (BBQ). Мы по-прежнему привержены развитию методов, которые снижают предвзятость и способствуют большей нейтральности наших моделей, гарантируя отсутствие у них перекосов в ту или иную политическую сторону.

Хотя семейство моделей Claude 3 продемонстрировало прогресс в ключевых областях биологических и кибернетических знаний, а также автономности по сравнению с предыдущими моделями, оно остается на уровне безопасности ИИ 2 (ASL-2) в соответствии с нашей политикой ответственного масштабирования. Наши оценки в ходе тестирования на проникновение (red teaming) (проведенного в соответствии с нашими обязательствами перед Белым домом и Указом президента США 2023 года) показали, что на данный момент модели представляют пренебрежимо малый потенциал катастрофического риска. Мы продолжим внимательно следить за будущими моделями, чтобы оценивать их близость к порогу ASL-3. Дополнительные сведения о безопасности доступны в карточке модели Claude 3.

Удобство в использовании

Модели Claude 3 лучше справляются с выполнением сложных многоступенчатых инструкций. Они особенно искусны в соблюдении тональности бренда и рекомендаций по ответам, а также в создании клиентского опыта, которому наши пользователи могут доверять. Кроме того, модели Claude 3 лучше генерируют популярные структурированные данные в таких форматах, как JSON, что упрощает постановку задач для Claude в таких сценариях использования, как классификация естественного языка и анализ тональности.

Характеристики моделей

Claude 3 Opus — наша самая умная модель с лучшей на рынке производительностью при решении сложнейших задач. Она способна ориентироваться в открытых запросах и незнакомых сценариях с поразительной беглостью и человеческим пониманием. Opus демонстрирует нам пределы возможностей генеративного ИИ.

Стоимость [Входные данные: $/млн токенов | Выходные данные: $/млн токенов]$15 | $75
Окно контекста200K*
Потенциальное применение
  • Автоматизация задач: планирование и выполнение сложных действий через API и базы данных, интерактивное написание кода
  • НИОКР: обзор исследований, мозговой штурм и генерация гипотез, поиск лекарств
  • Стратегия: углубленный анализ графиков и диаграмм, финансовых показателей и рыночных трендов, прогнозирование
Отличительная особенностьБолее высокий уровень интеллекта, чем у любой другой доступной модели.
data

*Доступно 1 млн токенов для специфических сценариев использования, обращайтесь за подробностями.

Claude 3 Sonnet обеспечивает идеальный баланс между интеллектом и скоростью — особенно для корпоративных рабочих нагрузок. Она демонстрирует высокую производительность при более низкой стоимости по сравнению с аналогами и создана для надежной работы в крупномасштабных ИИ-развертываниях.

Стоимость [Входные данные: $/млн токенов | Выходные данные: $/млн токенов]$3 | $15
Окно контекста200K
Потенциальное применение
  • Обработка данных: RAG или поиск и извлечение информации из огромных массивов знаний
  • Продажи: рекомендации продуктов, прогнозирование, таргетированный маркетинг
  • Задачи для экономии времени: генерация кода, контроль качества, извлечение текста из изображений
Отличительная особенностьБолее доступная, чем другие модели с аналогичным интеллектом; лучше подходит для масштабирования.
data

Claude 3 Haiku — наша самая быстрая и компактная модель для практически мгновенного отклика. Она отвечает на простые запросы с непревзойденной скоростью. Пользователи смогут создавать бесшовные ИИ-интерфейсы, имитирующие живое общение с человеком.

Стоимость [Входные данные: $/млн токенов | Выходные данные: $/млн токенов]$0.25 | $1.25
Окно контекста200K
Потенциальное применение
  • Взаимодействие с клиентами: быстрая и точная поддержка в режиме реального времени, перевод
  • Модерация контента: выявление рискованного поведения или запросов клиентов
  • Задачи для экономии средств: оптимизированная логистика, управление запасами, извлечение знаний из неструктурированных данных
Отличительная особенностьУмнее, быстрее и дешевле других моделей в своей категории интеллекта.
data

Доступность моделей

Opus и Sonnet доступны для использования уже сегодня через наш API, который теперь открыт для всех, что позволяет разработчикам регистрироваться и сразу же начать работу с этими моделями. Haiku станет доступна в ближайшее время. Sonnet обеспечивает работу бесплатного функционала на claude.ai, а Opus доступна для подписчиков Claude Pro.

Sonnet также доступна сегодня через Amazon Bedrock и в рамках закрытого превью в Google Cloud Vertex AI ModelGarden — в ближайшем будущем Opus и Haiku появятся на обеих платформах.

Умнее, быстрее, безопаснее

Мы не считаем, что возможности моделей близки к своему пределу, и планируем выпускать частые обновления семейства моделей Claude 3 в течение следующих нескольких месяцев. Мы также рады выпустить серию функций для расширения возможностей наших моделей, особенно для корпоративных сценариев использования и масштабных развертываний. Эти новые функции будут включать вызов инструментов (Tool Use, он же вызов функций), интерактивное написание кода (REPL) и более продвинутые агентские возможности.

Раздвигая границы возможностей ИИ, мы одновременно стремимся к тому, чтобы наши меры безопасности шли в ногу с этими скачками производительности. Наша гипотеза заключается в том, что пребывание на переднем крае разработки ИИ — это самый эффективный способ направить его траекторию к позитивным результатам для общества.

Мы с нетерпением ждем того, что вы создадите с помощью Claude 3, и надеемся на ваши отзывы, которые помогут сделать Claude еще более полезным помощником и творческим компаньоном. Чтобы начать разработку с Claude, посетите сайт anthropic.com/claude.

Сноски

  1. В этой таблице представлены сравнения с коммерчески доступными моделями, для которых были опубликованы результаты тестов. В нашей карточке модели приведены сравнения с моделями, которые были анонсированы, но еще не выпущены, такими как Gemini 1.5 Pro. Кроме того, отметим, что инженеры провели работу по оптимизации промптов и примеров few-shot для тестов и сообщили о более высоких баллах для более новой модели GPT-4T. Источник.

Полный текст статьи читайте на Anthropic