Редакция API Router · 04.08.2026 · 6 мин чтения
Как рассчитать реальную стоимость LLM-API: кэш, reasoning-токены и скрытые наценки
Разбираем, почему сравнение только input/output токенов занижает бюджет: кэш-записи по 1.25×, long context, batch-скидки и reasoning-токены. Пошаговая методика TCO с примерами.
Введение: почему прайс-лист обманывает ваш бюджет
Считать бюджет на LLM-API по прайсу «input + output» — самый надёжный способ получить смету, которая разойдётся с реальным счётом в разы. Провайдеры давно тарифицируют не только токены, но и то, как вы их подаёте: кэш, длинный контекст, режим batch и даже reasoning-цепочки. Разберём, где прячутся деньги, и дадим формулу, которая учитывает всё это. Методику проверим на данных OpenAI и Anthropic по состоянию на август 2026 года; цены Gemini
2.5 Pro в официальном прайсе Google на момент подготовки не верифицированы, поэтому в расчёты их не включаем. Если вам нужен актуальный список моделей и цен — смотрите каталог API Router. Погнали разбираться, как не переплатить за кэш и reasoning-токены.
Скрытые статьи расходов: кэш, long context, reasoning и batch
Начнём с главного: что именно вы покупаете, когда платите за токены. В прайсе OpenAI и Anthropic есть четыре отдельные позиции: input, output, cache writes и cache hits. Первые две очевидны, а вот кэш — это скрытая ловушка. Когда вы отправляете запрос с одинаковым префиксом (системный промпт, документы для RAG), провайдер кэширует его, чтобы ускорить обработку. За запись в кэш OpenAI берёт
1.25× от обычного input, а за чтение — всего 10% от input. У Anthropic кэш-записи стоят 1.25× (TTL 5 минут) или 2× (TTL 1 час) от input, а чтение — 10%. Если ваш промпт меняется каждый запрос, вы платите за запись кэша, но не получаете скидку на чтение. Это классическая ошибка в расчёте стоимости LLM API: люди сравнивают только input/output, а потом удивляются, почему счёт выше ожиданий. Вторая ловушка — длинный контекст.
У OpenAI для GPT-5.6 Luna запросы с более чем 272K входных токенов тарифицируются по двойной ставке input и 1.5× за output, причём для всего запроса целиком. Это значит, что один «тяжёлый» вызов может стоить как три обычных. У Anthropic похожая история: для Claude Opus 4 с контекстом 1M токенов input стоит $30 за миллион против $15 для контекста до 200K. Если вы проектируете RAG-пайплайн с большими документами, закладывайте эту наценку сразу. Третья скрытая статья — reasoning-токены.
У GPT-5.6 и Claude 4 они тарифицируются как обычный output, но их объём может быть значительным. Официальные источники не публикуют проценты, поэтому в TCO закладывайте output с запасом 1.5–2×, особенно для агентов с tool calling. Наконец, batch-режим. Anthropic даёт ровно 50% скидку на input и output для пакетной обработки (подтверждено для Sonnet 4). У OpenAI режимы Batch/Flex/Fast есть, но точный процент скидки в официальном прайсе не зафиксирован — проверяйте перед расчётом.
Если ваша нагрузка терпит задержку в часы, batch-режим может уполовинить счёт.
Формула TCO и примеры расчёта
Теперь соберём всё в формулу. Для каждого вызова считайте: `cost = (input_tokens × input_rate + cache_write_tokens ×
1.25 × input_rate + cache_read_tokens × 0.1 × input_rate + output_tokens × output_rate + reasoning_tokens × output_rate) × long_context_multiplier` Long context multiplier равен 1, если контекст меньше порога, и 2 для input / 1.5 для output — если больше. Для batch-режима умножьте итог на 0.5 (для Anthropic). Проверим на трёх типовых нагрузках. Чат-бот с короткими диалогами: 1000 запросов в день, 500 input-токенов, 200 output, кэш-хиты 80%. На GPT-5.6 Luna это $0.20 за миллион input и $1.20 за output.
Считаем: input = 0.5K × $0.20 = $0.0001, кэш-чтение = 0.4K × $0.02 = $0.000008, output = 0.2K × $1.20 = $0.00024. Итого за запрос ~$0.00035, за месяц — около $10. RAG-пайплайн с большими документами: 1000 запросов, 50K input, 1K output, кэш-записи 50% (промпт меняется). На Claude Opus 4 (≤200K): input $15, output $75, cache writes $18.75, cache hits $1.50. За запрос: input = 50K × $15 = $0.75, cache writes = 25K × $18.75 = $0.47, cache hits = 25K × $1.50 = $0.0375, output = 1K × $75 = $0.075.
Итого ~$1.33 за запрос, $40K в месяц — и это без учёта long context. Агент с tool calling: 1000 задач, каждая — 10 вызовов, 2K input, 1K output, reasoning 50% от output. На GPT-5.6 Terra: input $2, output $12. За вызов: input = 2K × $2 = $0.004, output = 1K × $12 = $0.012, reasoning = 0.5K × $12 = $0.006. Итого $0.022 за вызов, $220 за 10K вызовов. Если бы провайдер давал скидку 50% на batch — было бы $110.
Чек-лист для вашего TCO
Теперь чек-лист для вашего TCO. Первое: всегда запрашивайте разбивку по cached_tokens и cache_write_tokens в ответе API — это покажет реальную структуру затрат. Второе: для RAG фиксируйте промпт-префикс и используйте явный кэш, чтобы не платить за лишние записи. Третье: закладывайте reasoning-токены как output с коэффициентом
1.5–2 для агентов. Четвёртое: проверяйте порог long context у каждой модели — у GPT-5.6 Luna это 272K, у других моделей порог может отличаться. Пятое: для фоновых задач используйте batch-режим, если провайдер даёт скидку. Шестое: сравнивайте не прайс, а TCO на вашем сценарии — «дешёвая» Luna с частыми кэш-записями может оказаться дороже Terra.
Если не хотите считать вручную, обратите внимание на тарифы API Router: там есть пакеты токенов от 5 до 1000 миллионов, а также PAYG с раздельной тарификацией input, output и cache read. Точные цены зависят от модели и режима, но пакетная модель упрощает прогнозирование бюджета. Для интеграции смотрите документацию — поддерживаются OpenAI-compatible, Claude native и Gemini native API.
Заключение Итог: расчёт стоимости LLM API — это не умножение input на цену.
Это учёт кэша, длинного контекста, reasoning и batch-режима. Начните с малого: возьмите один сценарий, посчитайте по формуле выше, сравните с реальным счётом — и вы увидите, где утекают деньги. А если нужен готовый инструмент, изучите открытые калькуляторы — но помните, что они не заменяют проверку по первичным источникам. Вопросы сообщества на Reddit и Habr часто советуют «просто взять самую дешёвую модель», но без TCO это лотерея. Считайте сами — и переплата исчезнет.
Источники
- OpenAI API Pricing
- GPT-5.6 Luna Model
- OpenAI Model Guidance
- Anthropic List Prices (PDF) - Google AI Pricing Материал подготовлен автоматизированной редакцией API Router на основе указанных источников.