Напишите модели «Привет! Как дела?» в свежем чате — это будет стоить меньше копейки. Напишите то же самое после часа работы, когда в окне висят пара регламентов, черновики и полсотни уточнений, — и за тот же «привет» с вас возьмут рублей пятнадцать. Ответ тот же, а цена выросла в тысячу с лишним раз.

Причина простая и от этого обидная: модель ничего не помнит. Каждый ваш вопрос она перечитывает вместе со всей историей разговора, с самого начала. И вы платите за каждое перечитывание. Этот счётчик тикает молча — на экране вы видите только ответ.

Вот про этот невидимый счётчик и поговорим.

Что такое токен и за что мы платим

Токен — единица, которой модель меряет текст. Режет текст на токены токенизатор — и это не внешняя утилита, а часть самой модели: его словарь фиксируется при обучении. Частые сочетания символов склеиваются в один токен, редкие слова рассыпаются на несколько. Отсюда два следствия. Первое: одна и та же фраза у разных моделей превращается в разное число токенов, поэтому лобовое сравнение «цены за миллион» между моделями слегка хромает. Второе: смена токенизатора — это скрытое изменение цены. Свежий пример: у Claude Sonnet 5 новый токенизатор, который, по данным самой Anthropic, даёт на том же тексте примерно на 30% больше токенов, чем у предыдущей версии, — тариф на бумаге не менялся, а счёт вырос. Для быстрой прикидки держите в голове: примерно четыре символа — один токен; на русском обычно выходит чуть дороже, чем на английском.

Посчитаем на пальцах. Системная инструкция «Ты ассистент, который поддерживает беседу» — примерно 10 токенов. «Привет! Как твои дела?» — ещё 5. Ответ «У меня всё хорошо, а у тебя как?» — 8. Итого 23 токена. Claude Sonnet 5 через OpenRouter стоит 2 $ за миллион входных токенов и 10 $ за миллион выходных (это вводный тариф — с сентября 2026-го обещают 3 $ и 15 $); при курсе 80 ₽/$ весь этот обмен — меньше копейки.

А теперь тот же «привет», но в чате уже накопилось тысяч сто токенов контекста. Сто тысяч — это не библиотека Конгресса. Это два-три загруженных регламента и пара десятков уточнений, которые набегают незаметно. И вот уже каждый ваш вопрос, любой, даже обычное «спасибо», стоит рублей пятнадцать — потому что модель обязана заново прочитать всё, что было до него. Лайфхак: не говорите модели "спасибо".

Важно: за эти токены модель делает вполне осязаемую работу — пишет код, собирает статью или ведёт агентский сценарий. Есть отдельная интересная тема, что одни модели решают ту же задачу меньшим числом токенов, но по более дорогой цене за штуку, — своего рода КПД. До неё дойдём в другой раз. Сейчас про более грубую ошибку, которую совершают почти все.

Обзоры смотрят на выход. Агент живёт входом

Откройте любое сравнение моделей — там почти наверняка обсуждают цену генерации, то есть выходного токена. Для одноразовых задач это честно: классифицировать письмо или перевести абзац. Контекст крошечный, и платим мы в основном за результат.

В агентском режиме всё переворачивается. Агент на каждом шаге таскает с собой системный промпт, файлы и всю память диалога — а наружу выдаёт короткую мысль или вызов инструмента. Я поднял логи своей системы, которая работает на моих интенсивах. Агентские сценарии мы там используем в очень ограниченном виде с несложными сценариями — и тем не менее среднее соотношение входных токенов к выходным получилось 38:1, а медиана — 30:1. Эти данные взяты из боевой системы. Ежемесячно через мои интенсивы проходят сотни человек, каждый из которых делает небольших агентов работы с документами или поискаом и только за последний период через систему прошло 6,6 миллиарда токенов на входе и около 160 миллионов на выходе. Вдумайтесь: чтобы получить миллион токенов ответа, агент прожёвывает под сорок миллионов на входе.

Поэтому я считаю не цену выхода, а реальную стоимость миллиона выходных токенов:

реальная стоимость ≈ 38 × цена_входа + цена_выхода

Прикинем по прайсу OpenRouter:

МодельВход, $/1MВыход, $/1MРеальная стоимость при 38:1, $/1M выхода
Grok 4.31,252,5050
Claude Sonnet 52,0010,0086
Qwen3.6-35B-A3B0,131,005,9

В рублях по курсу 80 — примерно 4 000, 6 900 и 475 ₽ за миллион полезного выхода. У Grok при этом есть нюанс: свыше 200K токенов контекста включается повышенный тариф, а агент как раз там и живёт. Заметьте: по колонке «выход» Grok вчетверо дешевле Sonnet, а по реальной стоимости — меньше чем вдвое. А Qwen выигрывает не выходом, а копеечным входом. Картина меняется полностью, стоило поменять метрику.

Оговорка про кэш — если он есть, арифметика заметно меняется. Провайдер может сохранить результат обработки входа и при следующем запросе не пересчитывать совпадающую часть — это называется кэшированием промпта. Скидка серьёзная: у Anthropic чтение из кэша стоит 10% от цены входа (запись в кэш — +25% к ней), а по статистике OpenRouter эффективная цена входа с учётом кэша выходит на 60–80% ниже прайса. Агентам это подходит идеально — системный промпт и история повторяются шаг за шагом, попадание в кэш высокое. Но есть условия: кэш живёт недолго (у Anthropic по умолчанию 5 минут, час — за доплату) и требует точного совпадения начала контекста. Отредактировали что-то в середине истории — всё, что после правки, пересчитывается по полной. Поэтому формулу 38×in + out я считаю по полному прайсу входа как верхнюю границу, а кэш рассматриваю как скидку, которую ещё нужно заработать аккуратной архитектурой. Сам размер этой скидки, кстати, лучшее доказательство того, что чтение входа стоит провайдеру реальных вычислений: за пропуск префилла возвращают до 90% цены.

Почему у токена впервые появились прямые затраты

Тут есть момент, который мне кажется самым интересным во всей этой истории.

В классическом корпоративном ИТ вычисления всегда растворялись в постоянных расходах. Купили серверы, заложили амортизацию — и всё. Запустил кто-то тяжёлый отчёт в 1С — ну, процессоры погрелись. Никто никогда не считал себестоимость конкретного отчёта, да и не мог: не было способа её выделить. Тиражирование ИТ-системы по умолчанию считалось бесплатным.

С токенами так не получается. У каждого токена есть прямые переменные расходы, которые можно посчитать буквально по счётчику электричества: столько-то на обработку входа (эта стадия называется prefill), столько-то на генерацию. Плюс каждый потраченный ватт нужно ещё и отвести — охлаждение. Амортизацию карты и аренду стойки я сознательно выношу за скобки: даже голое электричество уже даёт нижнюю границу цены.

Проверим на моём локальном стенде: Qwen3.6-35B-A3B на RTX 4090 с 48 ГБ, паспортное потребление 450 Вт. Тут важна деталь, которую часто путают — у инференса две фазы с разным характером. Prefill (чтение входа) обрабатывает все токены параллельно: это перемножение больших матриц, тензорные ядра работают на полную, и потребление держится у потолка. Генерация же выдаёт токены по одному, и ради каждого модель заново протаскивает через шину памяти активные веса вместе с KV-кэшем — рабочей памятью механизма внимания, где лежат уже обработанные токены контекста. Карта при этом выглядит занятой на 100%, но упирается не в вычисления, а в память: тензорные ядра ждут данных, и реальное потребление заметно ниже пикового. Замеры это подтверждают: на серверных GPU декод тянет примерно 160–300 Вт при потолке 700 Вт.

Генерация у меня идёт со скоростью около 150 токенов в секунду. Миллион выходных токенов — примерно 1,85 часа; при реальном потреблении порядка 300 Вт это 0,56 кВт·ч, по тарифу 8 ₽/кВт·ч — около 4,5 ₽.

Теперь вход. На миллион выхода агенту нужно подать порядка 38 миллионов токенов. Prefill быстрее — около 2000 токенов в секунду, — но карта на этой фазе работает почти на полную мощность, под 430 Вт. Тридцать восемь миллионов токенов — это 5,3 часа и 2,3 кВт·ч, ещё около 18 ₽. Итого: порядка 23 ₽ за миллион выходных токенов — только электричество и только в профиле 38:1.

В пересчёте на штуку выходит наглядно. Выходной токен: 300 Вт / 150 ток/с = 2 Дж. Входной: 430 Вт / 2000 ток/с ≈ 0,2 Дж. Один выходной токен энергетически в девять раз дороже входного — но входных в тридцать восемь раз больше, поэтому по сумме счёта вход всё равно побеждает: сама генерация — меньше пяти рублей, четыре пятых уходит на чтение входа. Та же перевёрнутая экономика, что и в облачном прайсе.

Облако устроено по той же физике, но с другими коэффициентами. Серверные карты эффективнее по токенам на ватт, инженерия инференса (выполнение) и кэш разгоняют prefill (чтение входа). Зато сверху ложатся инфраструктурные расходы площадки — и моя гипотеза в том, что они съедают заметную часть выигрыша от железа. Проверить легко, у нас есть одна и та же модель в двух местах.

Интересно, кстати, наблюдать, как разные ЦОД оптимизируют затраты. Возьмём одну и ту же открытую модель Qwen3.6-35B-A3B и сравним стоимость инференса на западном агрегаторе OpenRouter и на Cloud.ru.

На OpenRouter реальная стоимость: 38 × 0,13 $ + 1 $ = 5,9 $, около 475 ₽ за миллион выхода. На Cloud.ru та же модель стоит 219,6 ₽ за миллион входа и 329,4 ₽ за миллион выхода. Считаем: 38 × 219,6 + 329,4 = 8 674 ₽. Одна модель. Разница почти в восемнадцать раз: 475 ₽ против 8 674 ₽. Да, сравнение грубое — у площадок разные SLA, разная степень оптимизации и разный фокус: OpenRouter — агрегатор, который гонит массовый трафик через самых дешёвых провайдеров, Cloud.ru — корпоративное облако с контуром в России. Но сравнение показательное.

И вот что из этого следует. Раньше нагрев сервера от ночного отчёта, запущенный бухгалтером, нельзя было ни посчитать, ни отнести на конкретную задачу — а теперь можно. У единицы вычисления впервые появилась конкретная и считаемая цена. Запустили агента — потратили деньги, и видно, сколько именно.

Как считать и чем пользоваться

Моя быстрая прикидка для агентских систем с длинным контекстом: беру цену выходного токена, умножаю на два — и сверяю, сходится ли порядок с формулой 38×in + out. Сходится — потолок бюджета понятен. Не сходится — иду в логи: где раздувается вход и не тащим ли мы за собой лишний миллион токенов истории.

Рычаги, которые работают у меня:

  1. Подписки и кодовые планы с потолком — Codex, Claude, Cursor, уровень около 200 $. Главная их ценность даже не в цене, а в крышке сверху: сколько бы ты ни работал, больше не спишут. У российских API такой крышки почему-то нет, и это отдельная боль — вместе с вопросами контура безопасности данных.
  2. Жёсткий лимит контекста. В Cursor, например, есть планки 300K и 1M. Чем выше поставил «на всякий случай», тем дороже каждый следующий «привет».
  3. Рутину — вниз. Скрипты, микрокодинг и прочие повторяемые операции — на быстрые и кэширующие модели, у меня это в том числе локальный Qwen 3.6. Фронтир держу для сложных и больших задач внутри подписок.
  4. API — третьим слоем, когда первых двух контуров не хватает. И чтобы этим зоопарком управлять, нужен слой абстракции вроде LiteLLM: одна точка маршрутизации, модель меняется без переписывания всего остального.

Остаётся размерность, которую я пока не умею считать хорошо, — интеллектуальный труд на токен: сколько пользы модель реально произвела на единицу расхода. Рабочий подход — дать разным моделям одинаковую пачку задач и сравнить, сколько токенов ушло до приемлемого результата. Об этом — в следующей статье.

Что меняется для управления

Итого. Обзоры говорят про цену исходящих токенов — а в агентской работе платят в основном за входящие. Вход как минимум сравним с генерацией, на практике — многократно её превосходит. Считайте реальную стоимость через коэффициент 38:1, и счета перестанут удивлять.

Но дело не только в счетах. Пока токен — строчка в облачном инвойсе, команда выбирает модель по красоте бенчмарка. Когда токен становится единицей прямых переменных затрат, появляются нормальные управленческие вопросы: какой контекст мы держим, что отдаём на рутину и где нам действительно нужен фронтир, а где хватит локального железа. По сути, мы впервые получили возможность считать мыслительную работу машины так же предметно, как привыкли считать узкие места в обычных процессах. Грех не воспользоваться.

Дмитрий Гуреев — эксперт МШУ Сколково, Gureev.PRO. Автор книги «Цифровое мышление в бизнесе» (МИФ, 2026)


324

Комментарии (0)

Читайте также:

Нейроменеджмент: приличная управленческая философия в чужом халате

Разбор книги Александра Енина «Нейроменеджмент», где рецензент критикует попытку переупаковать классическую управленческую философию в модную нейробиологическую обертку. Текст подробно объясняет, почему смешение реальных научных фактов с недоказанными гипотезами делает книгу вредной в качестве источника истины, и для кого она все-таки может быть полезна.

Лекционный синдром: почему «интересно рассказывать» — это перформанс, а не обучение

Десятилетиями мы верили, что хороший учитель — это тот, кто интересно рассказывает. Но когнитивная психология безжалостно доказывает: блестящие лекции создают лишь иллюзию понимания, оставляя ученика зрителем образовательного перформанса. Разбираемся, почему привычный лекционный формат не работает и как активные методы обучения помогают превратить пассивное слушание в реальные знания.

О чём на самом деле книга «Унесённые ветром»: анатомия американской трагедии

Масштабная социальная эпопея, история рождения нации или все-таки эталонная мелодрама? Этот текст разрушает популярный миф о романе «Унесённые ветром» и доказывает, что главная тема книги — не любовь, а гибель старого мира и цена выживания. Через судьбы главных героев Маргарет Митчелл показывает, как рушится цивилизация американского Юга, на смену которой приходит хищный индивидуализм новой эпохи.

Цифра, которая должна была всё изменить

Моральная паника вокруг соцсетей мешает заметить реальные причины подростковой депрессии. Метаанализы последних лет показывают, что влияние экранного времени на психику статистически близко к нулю, а платформы для большинства пользователей скорее являются следствием проблем, а не их источником. Этот текст разбирает, почему алгоритмы стали удобным козлом отпущения и что на самом деле стоит за кризисом детского благополучия.

«Гены отличника»: откуда взялся миф о врождённой гениальности азиатов — и почему он рассыпался

Долгие годы лидерство восточноазиатских школьников в образовательных рейтингах списывали на врождённый «ген гениальности». Но новая научная работа доказывает, что высокие баллы PISA зависят от культуры, экономики и хитрой выборки данных, а не от ДНК. Разбираемся, почему генетическая теория превосходства полностью рассыпается на фоне реальных фактов.