Кэширование промптов в API

Предлагаем автоматические скидки на входные данные, которые модель недавно обрабатывала

DALL·E generated impressionist oil painting of layered light green columns interwoven with parallel emerald streams, forming a harmonious and repetitive tapestry.

Многие разработчики при создании ИИ-приложений неоднократно используют один и тот же контекст в разных вызовах API, например при внесении изменений в кодовую базу или в ходе долгих многошаговых диалогов с чат-ботом. Сегодня мы представляем функцию кэширования промптов (Prompt Caching), которая позволяет разработчикам снизить затраты и задержки. Повторно используя недавно обработанные токены ввода, разработчики могут получить скидку 50% и более высокую скорость обработки промптов.

Доступность и цены кэширования промптов

Начиная с сегодняшнего дня, кэширование промптов автоматически применяется к последним версиям GPT‑4o, GPT‑4o mini, o1‑preview и o1‑mini, а также к дообученным (fine-tuned) версиям этих моделей. Кэшированные промпты предлагаются со скидкой по сравнению с промптами без кэширования.

Ниже представлен обзором цен:

Входные токены без кэширования

Кэшированные входные токены

Выходные токены

GPT‑4o

gpt-4o-2024–08–06

$2.50

$1.25

$10.00

Дообучение GPT‑4o

$3.75

$1.875

$15.00

GPT‑4o mini

gpt-4o-mini-2024–07–18

$0.15

$0.075

$0.60

Дообучение GPT‑4o mini

$0.30

$0.15

$1.20

o1

o1‑preview

$15.00

$7.50

$60.00

o1 mini

$3.00

$1.50

$12.00

Мониторинг использования кэша

Вызовы API к поддерживаемым моделям будут автоматически использовать преимущества кэширования промптов для промптов длиной более 1024 токенов. API кэширует самый длинный префикс промпта, который был вычислен ранее, начиная с 1024 токенов и увеличивая его с шагом в 128 токенов. Если вы повторно используете промпты с общими префиксами, мы автоматически применим скидку кэширования промптов без каких-либо изменений в вашей интеграции API.

Запросы, использующие кэширование промптов, содержат значение cached_tokens в поле usage в ответе API:

JavaScript

1
usage: {
2
total_tokens: 2306,
3
prompt_tokens: 2006,
4
completion_tokens: 300,
5
6
prompt_tokens_details: {
7
cached_tokens: 1920,
8
audio_tokens: 0,
9
},
10
completion_tokens_details: {
11
reasoning_tokens: 0,
12
audio_tokens: 0,
13
}
14
}

Кэши обычно очищаются после 5–10 минут бездействия и всегда удаляются в течение одного часа с момента последнего использования кэша. Как и в случае со всеми API-сервисами, кэширование промптов подпадает под действие наших обязательств по корпоративной конфиденциальности. Кэши промптов не разделяются между организациями.

Кэширование промптов — это один из множества инструментов для разработчиков, позволяющих масштабировать свои приложения в продакшене, сохраняя баланс между производительностью, стоимостью и задержками. Для получения дополнительной информации обратитесь к документации по кэшированию промптов.

Автор

OpenAI

Полный текст статьи читайте на OpenAI