Напишите модели «Привет! Как дела?» в свежем чате — это будет стоить меньше копейки. Напишите то же самое после часа работы, когда в окне висят пара регламентов, черновики и полсотни уточнений, — и за тот же «привет» с вас возьмут рублей пятнадцать. Ответ тот же, а цена выросла в тысячу с лишним раз.

Причина простая и от этого обидная: модель ничего не помнит. Каждый ваш вопрос она перечитывает вместе со всей историей разговора, с самого начала. И вы платите за каждое перечитывание. Этот счётчик тикает молча — на экране вы видите только ответ.

Вот про этот невидимый счётчик и поговорим.

Что такое токен и за что мы платим

Токен — единица, которой модель меряет текст. Режет текст на токены токенизатор — и это не внешняя утилита, а часть самой модели: его словарь фиксируется при обучении. Частые сочетания символов склеиваются в один токен, редкие слова рассыпаются на несколько. Отсюда два следствия. Первое: одна и та же фраза у разных моделей превращается в разное число токенов, поэтому лобовое сравнение «цены за миллион» между моделями слегка хромает. Второе: смена токенизатора — это скрытое изменение цены. Свежий пример: у Claude Sonnet 5 новый токенизатор, который, по данным самой Anthropic, даёт на том же тексте примерно на 30% больше токенов, чем у предыдущей версии, — тариф на бумаге не менялся, а счёт вырос. Для быстрой прикидки держите в голове: примерно четыре символа — один токен; на русском обычно выходит чуть дороже, чем на английском.

Посчитаем на пальцах. Системная инструкция «Ты ассистент, который поддерживает беседу» — примерно 10 токенов. «Привет! Как твои дела?» — ещё 5. Ответ «У меня всё хорошо, а у тебя как?» — 8. Итого 23 токена. Claude Sonnet 5 через OpenRouter стоит 2 $ за миллион входных токенов и 10 $ за миллион выходных (это вводный тариф — с сентября 2026-го обещают 3 $ и 15 $); при курсе 80 ₽/$ весь этот обмен — меньше копейки.

А теперь тот же «привет», но в чате уже накопилось тысяч сто токенов контекста. Сто тысяч — это не библиотека Конгресса. Это два-три загруженных регламента и пара десятков уточнений, которые набегают незаметно. И вот уже каждый ваш вопрос, любой, даже обычное «спасибо», стоит рублей пятнадцать — потому что модель обязана заново прочитать всё, что было до него. Лайфхак: не говорите модели "спасибо".

Важно: за эти токены модель делает вполне осязаемую работу — пишет код, собирает статью или ведёт агентский сценарий. Есть отдельная интересная тема, что одни модели решают ту же задачу меньшим числом токенов, но по более дорогой цене за штуку, — своего рода КПД. До неё дойдём в другой раз. Сейчас про более грубую ошибку, которую совершают почти все.

Обзоры смотрят на выход. Агент живёт входом

Откройте любое сравнение моделей — там почти наверняка обсуждают цену генерации, то есть выходного токена. Для одноразовых задач это честно: классифицировать письмо или перевести абзац. Контекст крошечный, и платим мы в основном за результат.

В агентском режиме всё переворачивается. Агент на каждом шаге таскает с собой системный промпт, файлы и всю память диалога — а наружу выдаёт короткую мысль или вызов инструмента. Я поднял логи своей системы, которая работает на моих интенсивах. Агентские сценарии мы там используем в очень ограниченном виде с несложными сценариями — и тем не менее среднее соотношение входных токенов к выходным получилось 38:1, а медиана — 30:1. Это не бенчмарк основан на реальные данных: только за последний период через систему прошло 6,6 миллиарда токенов на входе и около 160 миллионов на выходе. Вдумайтесь: чтобы получить миллион токенов ответа, агент прожёвывает под сорок миллионов на входе.

Поэтому я считаю не цену выхода, а реальную стоимость миллиона выходных токенов:

реальная стоимость ≈ 30 × цена_входа + цена_выхода

Прикинем по прайсу OpenRouter:

МодельВход, $/1MВыход, $/1MРеальная стоимость при 30:1, $/1M выхода
Grok 4.31,252,5040
Claude Sonnet 52,0010,0070
Qwen3.6-35B-A3B0,131,004,9

В рублях по курсу 80 — примерно 3 200, 5 600 и 390 ₽ за миллион полезного выхода. У Grok при этом есть нюанс: свыше 200K токенов контекста включается повышенный тариф, а агент как раз там и живёт. Заметьте: по колонке «выход» Grok вчетверо дешевле Sonnet, а по реальной стоимости — меньше чем вдвое. А Qwen выигрывает не выходом, а копеечным входом. Картина меняется полностью, стоило поменять метрику.

Оговорка про кэш. Провайдер может сохранить результат обработки входа (так называемый KV-кэш) и при следующем запросе не пересчитывать повторяющуюся часть — это называется кэшированием промпта. Кэшированный вход продаётся в разы дешевле обычного, и это, кстати, лучшее доказательство того, что чтение входа стоит провайдеру реальных вычислений. Но длинный агент без кэша платит полную цену за каждое перечитывание.

Почему у токена впервые появились прямые затраты

Тут есть момент, который мне кажется самым интересным во всей этой истории.

В классическом корпоративном ИТ вычисления всегда растворялись в постоянных расходах. Купили серверы, заложили амортизацию — и всё. Запустил кто-то тяжёлый отчёт в 1С — ну, процессоры погрелись. Никто никогда не считал себестоимость конкретного отчёта, да и не мог: не было способа её выделить. Тиражирование ИТ-системы по умолчанию считалось бесплатным.

С токенами так не получается. У каждого токена есть прямые переменные расходы, которые можно посчитать буквально по счётчику электричества: столько-то на обработку входа (эта стадия называется prefill), столько-то на генерацию. Плюс каждый потраченный ватт нужно ещё и отвести — охлаждение. Амортизацию карты и аренду стойки я сознательно выношу за скобки: даже голое электричество уже даёт нижнюю границу цены.

Проверим на моём локальном стенде: Qwen3.6-35B-A3B на RTX 4090 с 48 ГБ, паспортное потребление 450 Вт. Тут важна деталь, которую часто путают — у инференса две фазы с разным характером. Prefill (чтение входа) обрабатывает все токены параллельно: это перемножение больших матриц, тензорные ядра работают на полную, и потребление держится у потолка. Генерация же выдаёт токены по одному, и ради каждого модель заново протаскивает через шину памяти активные веса вместе с KV-кэшем — внутренним «конспектом» всего контекста. Карта при этом выглядит занятой на 100%, но упирается не в вычисления, а в память: тензорные ядра ждут данных, и реальное потребление заметно ниже пикового. Замеры это подтверждают: на серверных GPU декод тянет примерно 160–300 Вт при потолке 700 Вт.

Генерация у меня идёт со скоростью около 150 токенов в секунду. Миллион выходных токенов — примерно 1,85 часа; при реальном потреблении порядка 300 Вт это 0,56 кВт·ч, по тарифу 8 ₽/кВт·ч — около 4,5 ₽.

Теперь вход. На миллион выхода агенту нужно подать порядка 30 миллионов токенов. Prefill быстрее — около 2000 токенов в секунду, — но карта на этой фазе работает почти на полную мощность, под 430 Вт. Тридцать миллионов токенов — это 4,2 часа и 1,8 кВт·ч, ещё около 14 ₽. Итого: порядка 19 ₽ за миллион выходных токенов — только электричество и только в профиле 30:1.

В пересчёте на штуку выходит наглядно. Выходной токен: 300 Вт / 150 ток/с = 2 Дж. Входной: 430 Вт / 2000 ток/с ≈ 0,2 Дж. Один выходной токен энергетически в девять раз дороже входного — но входных в тридцать раз больше, поэтому по сумме счёта вход всё равно побеждает: сама генерация — меньше пяти рублей, три четверти уходит на чтение входа. Та же перевёрнутая экономика, что и в облачном прайсе.

Облако устроено по той же физике, но с другими коэффициентами. Серверные карты эффективнее по токенам на ватт, инженерия инференса и кэш разгоняют prefill. Зато сверху ложатся инфраструктурные расходы площадки — и моя гипотеза в том, что они съедают заметную часть выигрыша от железа. Проверить легко, у нас есть одна и та же модель в двух местах.

Qwen3.6-35B-A3B на OpenRouter: реальная стоимость 4,9 $, около 390 ₽ за миллион выхода. Та же модель на cloud.ru: 219,6 ₽ за миллион входа и 329,4 ₽ за миллион выхода. Считаем: 30 × 219,6 + 329,4 = 6 917 ₽. Одна модель. Разница почти в восемнадцать раз. Да, сравнение грубое — у площадок разные SLA и разная степень оптимизации, — но даже со всеми поправками на серверное железо такой разрыв уже не объяснить ничем, кроме экономики самой площадки.

И вот что из этого следует. Раньше нагрев сервера от ночного отчёта нельзя было ни посчитать, ни отнести на конкретную задачу — а теперь можно. У единицы вычисления впервые появилась конкретная и считаемая цена. Запустили агента — потратили деньги, и видно, сколько именно.

Как считать и чем пользоваться

Моя быстрая прикидка для агентских систем с длинным контекстом: беру цену выходного токена, умножаю на два — и сверяю, сходится ли порядок с формулой 30×in + out. Сходится — потолок бюджета понятен. Не сходится — иду в логи: где раздувается вход и не тащим ли мы за собой лишний миллион токенов истории.

Рычаги, которые работают у меня:

  1. Подписки и кодовые планы с потолком — Codex, Claude, Cursor, уровень около 200 $. Главная их ценность даже не в цене, а в крышке сверху: сколько бы ты ни работал, больше не спишут. У российских API такой крышки почему-то нет, и это отдельная боль — вместе с вопросами контура безопасности данных.
  2. Жёсткий лимит контекста. В Cursor, например, есть планки 300K и 1M. Чем выше поставил «на всякий случай», тем дороже каждый следующий «привет».
  3. Рутину — вниз. Скрипты, микрокодинг и прочие повторяемые операции — на быстрые и кэширующие модели, у меня это в том числе локальный Qwen 3.6. Фронтир держу для сложных и больших задач внутри подписок.
  4. API — третьим слоем, когда первых двух контуров не хватает. И чтобы этим зоопарком управлять, нужен слой абстракции вроде LiteLLM: одна точка маршрутизации, модель меняется без переписывания всего остального.

Остаётся размерность, которую я пока не умею считать хорошо, — интеллектуальный труд на токен: сколько пользы модель реально произвела на единицу расхода. Рабочий подход — дать разным моделям одинаковую пачку задач и сравнить, сколько токенов ушло до приемлемого результата. Об этом — в следующей статье.

Что меняется для управления

Итого. Обзоры говорят про цену исходящих токенов — а в агентской работе платят в основном за входящие. Вход как минимум сравним с генерацией, на практике — многократно её превосходит. Считайте реальную стоимость через коэффициент 30:1, и счета перестанут удивлять.

Но дело не только в счетах. Пока токен — строчка в облачном инвойсе, команда выбирает модель по красоте бенчмарка. Когда токен становится единицей прямых переменных затрат, появляются нормальные управленческие вопросы: какой контекст мы держим, что отдаём на рутину и где нам действительно нужен фронтир, а где хватит локального железа. По сути, мы впервые получили возможность считать мыслительную работу машины так же предметно, как привыкли считать узкие места в обычных процессах. Грех не воспользоваться.

Дмитрий Гуреев — эксперт МШУ Сколково, Gureev.PRO. Автор книги «Цифровое мышление в бизнесе» (МИФ, 2026)


8

Комментарии (0)

Читайте также:

Чтение длиннее СМС: как умение не отвлекаться стало новой роскошью

Способность читать длинные тексты и удерживать внимание превращается из обыденного навыка в элитарную привилегию. Исследования показывают, что смартфоны и алгоритмы физически истощают когнитивный ресурс, делая глубокое мышление новым маркером социального неравенства. Разбираемся, почему в мире избытка информации умение концентрироваться становится дороже доступа к знаниям.

Рыцари подводного фронта: как книги формируют патриотизм — от «Тайны двух океанов» до наших дней

Как «Тайна двух океанов», так и современные подростковые романы учат детей любить Родину, но делают это совершенно по-разному. Мы сравнили классическую советскую фантастику с актуальной детской литературой, чтобы понять, как изменились образы героев, источники угроз и сами инструменты патриотического воспитания. Оказалось, что на смену монументальной идеологии пришло бережное плетение личных историй и развитие критического мышления.

Медуза, которая всех обманула

Медузы, киты и голые землекопы нашли уникальные способы обмануть старение, но за каждым биологическим «бессмертием» скрывается высокая цена. Разбираемся, как работают механизмы вечной жизни в дикой природе и почему для человека эти эволюционные лайфхаки остаются недоступными.

От свинцовых банок до твердотельной керамики: полтора века эволюции аккумуляторов

Полтора века эволюции аккумуляторов — это история непрерывной смены химических парадигм: каждая новая технология решала старую проблему, но порождала новую. От свинцовых банок Гастона Планте до современных твердотельных батарей инженеры боролись с сульфатацией, эффектом памяти и тепловым разгоном. Рассказываем, как переход к керамическим электролитам пытается разорвать этот порочный круг и сделать источники питания одновременно мощными и безопасными.

Рабство с красивой иконкой: почему «гиг-экономика» не сделала вас свободным

Гиг-экономика продает курьерам и таксистам сказку о свободе, но на смену живому начальнику пришел беспристрастный и жесткий алгоритм. Этот текст — о том, как платформы лишают работников социальных гарантий, перекладывают на них все издержки и превращают изматывающий труд в квест за виртуальными медалями.