Обновлено 03.08.2026

Кэширование промптов: что оплачивается на самом деле

Когда появляется cache read, чем он отличается от обычного input и почему кэш нельзя обещать для каждого запроса.

Что кэширует модель

Prompt caching позволяет upstream повторно использовать совпадающий префикс контекста: например, стабильную системную инструкцию, описание инструментов или начало длинного документа. Точный механизм, минимальный размер и срок жизни зависят от модели и поставщика.

API Router передаёт совместимые кэш-параметры и учитывает cache usage, который подтвердил upstream. Шлюз не подменяет модельный кэш собственным хранилищем ответов.

Почему cache read равен нулю

  • Это первый запрос с данным префиксом.
  • Префикс изменился даже в небольшой детали.
  • Контекст слишком короткий для правил конкретной модели.
  • Истёк срок жизни записи.
  • Выбранный маршрут не вернул подтверждённые cache usage поля.

Как повысить вероятность попадания

  • Держите стабильные инструкции в начале запроса.
  • Не вставляйте текущую дату или случайный ID в начало системного промпта.
  • Располагайте меняющиеся пользовательские данные после стабильного префикса.
  • Не меняйте порядок описаний инструментов без необходимости.
  • Проверяйте результат серией запросов, а не одной попыткой.

Как читать биллинг

Если upstream сообщил cache read, он отображается отдельно от обычного input и рассчитывается по своей ставке. Если подтверждения нет, токены считаются как обычный вход. Не следует вручную вычитать предполагаемый кэш из input: источником истины остаётся usage, возвращённый модельным маршрутом.

Готовы попробовать?

Создайте ключ в личном кабинете и отправьте первый запрос.

Создать аккаунт