Представляем Claude 2.1


Наша новейшая модель, Claude 2.1, теперь доступна через API в нашей Консоли и обеспечивает работу нашего чата claude.ai. Claude 2.1 предлагает ключевые усовершенствования для корпоративных клиентов, включая лидирующее в отрасли окно контекста на 200 000 токенов, значительное сокращение частоты галлюцинаций модели, системные промпты и нашу новую бета-функцию: использование инструментов. Мы также обновляем ценовую политику, чтобы повысить экономическую эффективность для наших клиентов при работе со всеми моделями.

Окно контекста на 200K токенов

С момента нашего запуска в начале этого года Claude используют миллионы людей для самых разных задач — от перевода академических статей до составления бизнес-планов и анализа сложных контрактов. В ходе обсуждений с нашими пользователями они просили увеличить контекстное окно и повысить точность ответов при работе с длинными документами.

В ответ на это мы удваиваем объем информации, которую вы можете передать Claude, установив лимит в 200 000 токенов, что эквивалентно примерно 150 000 слов или более чем 500 страницам текста. Теперь наши пользователи могут загружать техническую документацию (например, целые кодовые базы), финансовые отчеты (например, формы S-1) или даже масштабные литературные произведения, такие как «Илиада» или «Одиссея». Получив возможность работать с большими массивами контента или данных, Claude может создавать краткие выжимки, отвечать на вопросы, прогнозировать тенденции, сравнивать несколько документов и многое другое.

Обработка сообщения длиной 200K — это сложнейшая задача и первое в своем роде достижение в отрасли. Мы рады предоставить эту мощную новую возможность в руки наших пользователей; задачи, на выполнение которых у человека обычно уходят часы, Claude может решить за несколько минут. Мы ожидаем, что по мере развития технологии задержка (лаг) будет существенно снижаться.

Двукратное сокращение частоты галлюцинаций

Claude 2.1 также продемонстрировал значительные успехи в плане достоверности: количество ложных утверждений снизилось в 2 раза по сравнению с предыдущей моделью Claude 2.0. Это позволяет предприятиям создавать высокопроизводительные ИИ-приложения, решающие конкретные бизнес-задачи, и более уверенно и надежно внедрять ИИ во все рабочие процессы.

Мы проверили точность Claude 2.1 с помощью большой подборки сложных вопросов на фактожлогию, которые выявляют известные слабости современных моделей. Используя критерии, позволяющие отличать неверные утверждения («Пятый по численности населения город в Боливии — Монтеро») от признания неуверенности («Я не уверен, какой город является пятым по численности населения в Боливии»), Claude 2.1 со значительно большей вероятностью воздерживался от ответа, чем предоставлял неверную информацию.

Claude 2.1 также добился заметных успехов в понимании и суммировании текста, особенно в отношении длинных, сложных документов, требующих высокой степени точности — например, юридических документов, финансовых отчетов и технических спецификаций. В ходе наших оценок Claude 2.1 продемонстрировал сокращение неверных ответов на 30% и в 3–4 раза меньшую частоту ошибочных выводов о том, что документ подтверждает то или иное утверждение.


Хотя мы воодушевлены этим ростом точности, повышение прецизионности и надежности результатов для наших пользователей остается главной задачей для наших команд по продукту и исследованиям.

Использование инструментов API (Tool Use)

По многочисленным просьбам мы также добавили функцию использования инструментов — новую бета-функцию, которая позволяет Claude интегрироваться в существующие процессы, продукты и API пользователей. Эта расширенная совместимость призвана сделать Claude более полезным в повседневной работе пользователей.

Теперь Claude может координировать работу определяемых разработчиком функций или API, выполнять поиск по веб-источникам и извлекать информацию из частных баз знаний. Пользователи могут определить набор инструментов для Claude и сформулировать запрос. Модель сама решит, какой инструмент необходим для выполнения задачи, и выполнит действие от их имени, например:

  • Использование калькулятора для сложных математических расчетов
  • Преобразование запросов на естественном языке в структурированные вызовы API
  • Ответы на вопросы путем поиска по базам данных или с использованием API веб-поиска
  • Выполнение простых действий в программном обеспечении через закрытые API
  • Подключение к наборам данных продуктов для формирования рекомендаций и помощи пользователям в совершении покупок

Функция использования инструментов находится на ранней стадии разработки — мы создаем функции для разработчиков и руководства по составлению промптов для более простой интеграции в ваши приложения. Мы призываем пользователей делиться отзывами об использовании инструментов, чтобы помочь сформировать и улучшить продукт.

Опыт разработчиков

Мы работали над тем, чтобы упростить работу разработчиков с консолью Claude API и облегчить тестирование новых промптов для более быстрого обучения. Наш новый продукт Workbench позволяет разработчикам итерировать промпты в интерактивной среде и получить доступ к новым настройкам модели для оптимизации поведения Claude. Они могут создавать несколько промптов и переключаться между ними для разных проектов, а изменения сохраняются по мере работы для сохранения исторического контекста. Разработчики также могут генерировать фрагменты кода для использования своих промптов напрямую в одном из наших SDK.

Мы также представляем системные промпты, которые позволяют пользователям давать Claude пользовательские инструкции для повышения производительности. Системные промпты задают полезный контекст, который расширяет возможности Claude по принятию заданных личностей и ролей или структурированию ответов более настраиваемым и последовательным образом, отвечающим потребностям пользователя.

Claude 2.1 уже доступен через наш API, а также обеспечивает работу нашего чат-интерфейса на сайте claude.ai как для бесплатного, так и для тарифного плана Pro. Использование контекстного окна на 200K токенов зарезервировано за пользователями Claude Pro, которые теперь могут загружать файлы большего размера, чем когда-либо прежде. Мы с нетерпением ждем возможности увидеть варианты использования, которые вдохновят эти новые функции, поскольку мы продолжаем работу над созданием самых безопасных и технически совершенных систем ИИ в отрасли.

Полный текст статьи читайте на Anthropic