Обновлено 03.08.2026
Input, output и cache tokens без путаницы
Какие токены оплачиваются и почему длинная история увеличивает расход.
Input
Весь контекст запроса: системные инструкции, история сообщений, файлы и описания инструментов. В агентных IDE он может повторно отправляться на каждом шаге.
Output
Ответ модели, включая reasoning-токены, если upstream учитывает их в usage.
Cache read
Повторно использованная upstream-моделью часть контекста. Она отображается отдельно, когда провайдер возвращает подтверждённый usage.