Кэширование промптов в API
Предлагаем автоматические скидки на входные данные, которые модель недавно обрабатывала

Многие разработчики при создании ИИ-приложений неоднократно используют один и тот же контекст в разных вызовах API, например при внесении изменений в кодовую базу или в ходе долгих многошаговых диалогов с чат-ботом. Сегодня мы представляем функцию кэширования промптов (Prompt Caching), которая позволяет разработчикам снизить затраты и задержки. Повторно используя недавно обработанные токены ввода, разработчики могут получить скидку 50% и более высокую скорость обработки промптов.
Доступность и цены кэширования промптов
Начиная с сегодняшнего дня, кэширование промптов автоматически применяется к последним версиям GPT‑4o, GPT‑4o mini, o1‑preview и o1‑mini, а также к дообученным (fine-tuned) версиям этих моделей. Кэшированные промпты предлагаются со скидкой по сравнению с промптами без кэширования.
Ниже представлен обзором цен:
Входные токены без кэширования | Кэшированные входные токены | Выходные токены | |
|---|---|---|---|
GPT‑4o | |||
gpt-4o-2024–08–06 | $2.50 | $1.25 | $10.00 |
Дообучение GPT‑4o | $3.75 | $1.875 | $15.00 |
GPT‑4o mini | |||
gpt-4o-mini-2024–07–18 | $0.15 | $0.075 | $0.60 |
Дообучение GPT‑4o mini | $0.30 | $0.15 | $1.20 |
o1 | |||
o1‑preview | $15.00 | $7.50 | $60.00 |
o1 mini | $3.00 | $1.50 | $12.00 |
Мониторинг использования кэша
Вызовы API к поддерживаемым моделям будут автоматически использовать преимущества кэширования промптов для промптов длиной более 1024 токенов. API кэширует самый длинный префикс промпта, который был вычислен ранее, начиная с 1024 токенов и увеличивая его с шагом в 128 токенов. Если вы повторно используете промпты с общими префиксами, мы автоматически применим скидку кэширования промптов без каких-либо изменений в вашей интеграции API.
Запросы, использующие кэширование промптов, содержат значение cached_tokens в поле usage в ответе API:
JavaScript
1usage: {2 total_tokens: 2306,3 prompt_tokens: 2006,4 completion_tokens: 300,5 6 prompt_tokens_details: {7 cached_tokens: 1920,8 audio_tokens: 0,9 },10 completion_tokens_details: {11 reasoning_tokens: 0,12 audio_tokens: 0,13 }14}Кэши обычно очищаются после 5–10 минут бездействия и всегда удаляются в течение одного часа с момента последнего использования кэша. Как и в случае со всеми API-сервисами, кэширование промптов подпадает под действие наших обязательств по корпоративной конфиденциальности. Кэши промптов не разделяются между организациями.
Кэширование промптов — это один из множества инструментов для разработчиков, позволяющих масштабировать свои приложения в продакшене, сохраняя баланс между производительностью, стоимостью и задержками. Для получения дополнительной информации обратитесь к документации по кэшированию промптов.
Автор
Полный текст статьи читайте на OpenAI
