Напишите модели «Привет! Как дела?» в свежем чате — это будет стоить меньше копейки. Напишите то же самое после часа работы, когда в окне висят пара регламентов, черновики и полсотни уточнений, — и за тот же «привет» с вас возьмут рублей пятнадцать. Ответ тот же, а цена выросла в тысячу с лишним раз.
Причина простая и от этого обидная: модель ничего не помнит. Каждый ваш вопрос она перечитывает вместе со всей историей разговора, с самого начала. И вы платите за каждое перечитывание. Этот счётчик тикает молча — на экране вы видите только ответ.
Вот про этот невидимый счётчик и поговорим.
Что такое токен и за что мы платим
Токен — единица, которой модель меряет текст. Режет текст на токены токенизатор — и это не внешняя утилита, а часть самой модели: его словарь фиксируется при обучении. Частые сочетания символов склеиваются в один токен, редкие слова рассыпаются на несколько. Отсюда два следствия. Первое: одна и та же фраза у разных моделей превращается в разное число токенов, поэтому лобовое сравнение «цены за миллион» между моделями слегка хромает. Второе: смена токенизатора — это скрытое изменение цены. Свежий пример: у Claude Sonnet 5 новый токенизатор, который, по данным самой Anthropic, даёт на том же тексте примерно на 30% больше токенов, чем у предыдущей версии, — тариф на бумаге не менялся, а счёт вырос. Для быстрой прикидки держите в голове: примерно четыре символа — один токен; на русском обычно выходит чуть дороже, чем на английском.
Посчитаем на пальцах. Системная инструкция «Ты ассистент, который поддерживает беседу» — примерно 10 токенов. «Привет! Как твои дела?» — ещё 5. Ответ «У меня всё хорошо, а у тебя как?» — 8. Итого 23 токена. Claude Sonnet 5 через OpenRouter стоит 2 $ за миллион входных токенов и 10 $ за миллион выходных (это вводный тариф — с сентября 2026-го обещают 3 $ и 15 $); при курсе 80 ₽/$ весь этот обмен — меньше копейки.
А теперь тот же «привет», но в чате уже накопилось тысяч сто токенов контекста. Сто тысяч — это не библиотека Конгресса. Это два-три загруженных регламента и пара десятков уточнений, которые набегают незаметно. И вот уже каждый ваш вопрос, любой, даже обычное «спасибо», стоит рублей пятнадцать — потому что модель обязана заново прочитать всё, что было до него. Лайфхак: не говорите модели "спасибо".
Важно: за эти токены модель делает вполне осязаемую работу — пишет код, собирает статью или ведёт агентский сценарий. Есть отдельная интересная тема, что одни модели решают ту же задачу меньшим числом токенов, но по более дорогой цене за штуку, — своего рода КПД. До неё дойдём в другой раз. Сейчас про более грубую ошибку, которую совершают почти все.
Обзоры смотрят на выход. Агент живёт входом
Откройте любое сравнение моделей — там почти наверняка обсуждают цену генерации, то есть выходного токена. Для одноразовых задач это честно: классифицировать письмо или перевести абзац. Контекст крошечный, и платим мы в основном за результат.
В агентском режиме всё переворачивается. Агент на каждом шаге таскает с собой системный промпт, файлы и всю память диалога — а наружу выдаёт короткую мысль или вызов инструмента. Я поднял логи своей системы, которая работает на моих интенсивах. Агентские сценарии мы там используем в очень ограниченном виде с несложными сценариями — и тем не менее среднее соотношение входных токенов к выходным получилось 38:1, а медиана — 30:1. Это не бенчмарк основан на реальные данных: только за последний период через систему прошло 6,6 миллиарда токенов на входе и около 160 миллионов на выходе. Вдумайтесь: чтобы получить миллион токенов ответа, агент прожёвывает под сорок миллионов на входе.
Поэтому я считаю не цену выхода, а реальную стоимость миллиона выходных токенов:
реальная стоимость ≈ 30 × цена_входа + цена_выхода
Прикинем по прайсу OpenRouter:
| Модель | Вход, $/1M | Выход, $/1M | Реальная стоимость при 30:1, $/1M выхода |
|---|---|---|---|
| Grok 4.3 | 1,25 | 2,50 | 40 |
| Claude Sonnet 5 | 2,00 | 10,00 | 70 |
| Qwen3.6-35B-A3B | 0,13 | 1,00 | 4,9 |
В рублях по курсу 80 — примерно 3 200, 5 600 и 390 ₽ за миллион полезного выхода. У Grok при этом есть нюанс: свыше 200K токенов контекста включается повышенный тариф, а агент как раз там и живёт. Заметьте: по колонке «выход» Grok вчетверо дешевле Sonnet, а по реальной стоимости — меньше чем вдвое. А Qwen выигрывает не выходом, а копеечным входом. Картина меняется полностью, стоило поменять метрику.
Оговорка про кэш. Провайдер может сохранить результат обработки входа (так называемый KV-кэш) и при следующем запросе не пересчитывать повторяющуюся часть — это называется кэшированием промпта. Кэшированный вход продаётся в разы дешевле обычного, и это, кстати, лучшее доказательство того, что чтение входа стоит провайдеру реальных вычислений. Но длинный агент без кэша платит полную цену за каждое перечитывание.
Почему у токена впервые появились прямые затраты
Тут есть момент, который мне кажется самым интересным во всей этой истории.
В классическом корпоративном ИТ вычисления всегда растворялись в постоянных расходах. Купили серверы, заложили амортизацию — и всё. Запустил кто-то тяжёлый отчёт в 1С — ну, процессоры погрелись. Никто никогда не считал себестоимость конкретного отчёта, да и не мог: не было способа её выделить. Тиражирование ИТ-системы по умолчанию считалось бесплатным.
С токенами так не получается. У каждого токена есть прямые переменные расходы, которые можно посчитать буквально по счётчику электричества: столько-то на обработку входа (эта стадия называется prefill), столько-то на генерацию. Плюс каждый потраченный ватт нужно ещё и отвести — охлаждение. Амортизацию карты и аренду стойки я сознательно выношу за скобки: даже голое электричество уже даёт нижнюю границу цены.
Проверим на моём локальном стенде: Qwen3.6-35B-A3B на RTX 4090 с 48 ГБ, паспортное потребление 450 Вт. Тут важна деталь, которую часто путают — у инференса две фазы с разным характером. Prefill (чтение входа) обрабатывает все токены параллельно: это перемножение больших матриц, тензорные ядра работают на полную, и потребление держится у потолка. Генерация же выдаёт токены по одному, и ради каждого модель заново протаскивает через шину памяти активные веса вместе с KV-кэшем — внутренним «конспектом» всего контекста. Карта при этом выглядит занятой на 100%, но упирается не в вычисления, а в память: тензорные ядра ждут данных, и реальное потребление заметно ниже пикового. Замеры это подтверждают: на серверных GPU декод тянет примерно 160–300 Вт при потолке 700 Вт.
Генерация у меня идёт со скоростью около 150 токенов в секунду. Миллион выходных токенов — примерно 1,85 часа; при реальном потреблении порядка 300 Вт это 0,56 кВт·ч, по тарифу 8 ₽/кВт·ч — около 4,5 ₽.
Теперь вход. На миллион выхода агенту нужно подать порядка 30 миллионов токенов. Prefill быстрее — около 2000 токенов в секунду, — но карта на этой фазе работает почти на полную мощность, под 430 Вт. Тридцать миллионов токенов — это 4,2 часа и 1,8 кВт·ч, ещё около 14 ₽. Итого: порядка 19 ₽ за миллион выходных токенов — только электричество и только в профиле 30:1.
В пересчёте на штуку выходит наглядно. Выходной токен: 300 Вт / 150 ток/с = 2 Дж. Входной: 430 Вт / 2000 ток/с ≈ 0,2 Дж. Один выходной токен энергетически в девять раз дороже входного — но входных в тридцать раз больше, поэтому по сумме счёта вход всё равно побеждает: сама генерация — меньше пяти рублей, три четверти уходит на чтение входа. Та же перевёрнутая экономика, что и в облачном прайсе.
Облако устроено по той же физике, но с другими коэффициентами. Серверные карты эффективнее по токенам на ватт, инженерия инференса и кэш разгоняют prefill. Зато сверху ложатся инфраструктурные расходы площадки — и моя гипотеза в том, что они съедают заметную часть выигрыша от железа. Проверить легко, у нас есть одна и та же модель в двух местах.
Qwen3.6-35B-A3B на OpenRouter: реальная стоимость 4,9 $, около 390 ₽ за миллион выхода. Та же модель на cloud.ru: 219,6 ₽ за миллион входа и 329,4 ₽ за миллион выхода. Считаем: 30 × 219,6 + 329,4 = 6 917 ₽. Одна модель. Разница почти в восемнадцать раз. Да, сравнение грубое — у площадок разные SLA и разная степень оптимизации, — но даже со всеми поправками на серверное железо такой разрыв уже не объяснить ничем, кроме экономики самой площадки.
И вот что из этого следует. Раньше нагрев сервера от ночного отчёта нельзя было ни посчитать, ни отнести на конкретную задачу — а теперь можно. У единицы вычисления впервые появилась конкретная и считаемая цена. Запустили агента — потратили деньги, и видно, сколько именно.
Как считать и чем пользоваться
Моя быстрая прикидка для агентских систем с длинным контекстом: беру цену выходного токена, умножаю на два — и сверяю, сходится ли порядок с формулой 30×in + out. Сходится — потолок бюджета понятен. Не сходится — иду в логи: где раздувается вход и не тащим ли мы за собой лишний миллион токенов истории.
Рычаги, которые работают у меня:
- Подписки и кодовые планы с потолком — Codex, Claude, Cursor, уровень около 200 $. Главная их ценность даже не в цене, а в крышке сверху: сколько бы ты ни работал, больше не спишут. У российских API такой крышки почему-то нет, и это отдельная боль — вместе с вопросами контура безопасности данных.
- Жёсткий лимит контекста. В Cursor, например, есть планки 300K и 1M. Чем выше поставил «на всякий случай», тем дороже каждый следующий «привет».
- Рутину — вниз. Скрипты, микрокодинг и прочие повторяемые операции — на быстрые и кэширующие модели, у меня это в том числе локальный Qwen 3.6. Фронтир держу для сложных и больших задач внутри подписок.
- API — третьим слоем, когда первых двух контуров не хватает. И чтобы этим зоопарком управлять, нужен слой абстракции вроде LiteLLM: одна точка маршрутизации, модель меняется без переписывания всего остального.
Остаётся размерность, которую я пока не умею считать хорошо, — интеллектуальный труд на токен: сколько пользы модель реально произвела на единицу расхода. Рабочий подход — дать разным моделям одинаковую пачку задач и сравнить, сколько токенов ушло до приемлемого результата. Об этом — в следующей статье.
Что меняется для управления
Итого. Обзоры говорят про цену исходящих токенов — а в агентской работе платят в основном за входящие. Вход как минимум сравним с генерацией, на практике — многократно её превосходит. Считайте реальную стоимость через коэффициент 30:1, и счета перестанут удивлять.
Но дело не только в счетах. Пока токен — строчка в облачном инвойсе, команда выбирает модель по красоте бенчмарка. Когда токен становится единицей прямых переменных затрат, появляются нормальные управленческие вопросы: какой контекст мы держим, что отдаём на рутину и где нам действительно нужен фронтир, а где хватит локального железа. По сути, мы впервые получили возможность считать мыслительную работу машины так же предметно, как привыкли считать узкие места в обычных процессах. Грех не воспользоваться.
Дмитрий Гуреев — эксперт МШУ Сколково, Gureev.PRO. Автор книги «Цифровое мышление в бизнесе» (МИФ, 2026)
Комментарии (0)