Растущие затраты на гонку потребления токенов
В последнее время мы наблюдаем рост практики, называемой Tokenmaxxing. Все больше компаний отслеживают продуктивность своих сотрудников с помощью токенов, потраченных на использование ИИ. Дженсен Хуанг, генеральный директор Nvidia, четко подводит итог этому настроению: «Если этот инженер за 500 000 долларов не потратил хотя бы 250 000 долларов на токены, я буду глубоко обеспокоен».
Критики могут утверждать, что у Дженсена есть стимул выступать за более высокое использование токенов, так как это напрямую переводится в более высокие доходы для Nvidia.
Это настроение в корпоративной Америке очевидно среди нескольких продуктовых компаний и стартапов. Генеральный директор Databricks Али Годси выделил одного инженера, который потратил более 7000 долларов на токены ИИ, в то время как стартапы, такие как Sendbird, имеют таблицу лидеров, отслеживающую расходы токенов каждого сотрудника.
Стремление к большему потреблению токенов не ограничивается только технологическими компаниями, это наблюдается повсеместно. Расходы на токены юридического технологического стартапа Harvey увеличились примерно в 12 раз до 12 триллионов токенов в месяц. На данный момент очевидно, что все хотят увеличить свои расходы на токены, но стоит исследовать причины этого.
Больше токенов означает больше продуктивности, или, по крайней мере, это утверждение, которое делают энтузиасты ИИ и ранние последователи tokenmaxxing. Идет гонка на то, чтобы потратить как можно больше токенов, и компании с радостью оплачивают счета. Принятие больших языковых моделей (LLM) — это совершенно новый способ работы в различных секторах, и компании, которые не успеют адаптироваться, останутся позади.
Счет за LLM уже здесь, и он огромен
С начала ажиотажа вокруг token maxxing в начале 2026 года мы увидели, как многие компании внедрили ограничения на использование токенов, поскольку расходы возросли экспоненциально.
Одной из самых крупных историй в этой области стало сообщение в начале 2026 года от технического директора Uber Правина Неппалли Наги в интервью с The Information, в котором он сообщил, что они исчерпали свой годовой бюджет на ИИ всего за 4 месяца и вернулись к началу, чтобы определить следующие шаги.
Как сообщила Сара Перес, Uber не единственная компания, столкнувшаяся с проблемами из-за превышения бюджета на ИИ. Адам Моссери из Meta видит будущее, в котором у каждого сотрудника будут ограничения на токены. Они уже добавили политики, чтобы снизить потребление токенов, сократив ненужные расходы.
Таблица лидеров по расходам на ИИ, которая привлекла внимание ранее в этом году, уже закрыта. Microsoft аннулировала лицензии на код Claude и объединила всех под Copilot.
Стоимость тренда tokenmaxxing уже здесь, и важно исследовать коренные причины этого огромного увеличения расходов в бухгалтерских отчетах предприятий.
Существует несколько факторов, способствующих росту расходов, связанных с использованием LLM. Некоторые из этих причин связаны с первым широким принятием использования ИИ в корпоративной Америке. В 2026 году компании создали внутренние панели для отслеживания расходов на ИИ и активно поощряли своих сотрудников использовать больше ИИ в повседневных задачах.
Выбор модели имеет решающее значение
Помимо широкого принятия, одной из основных внутренних причин высоких затрат на токены является выбор модели. Модели высшего уровня стоят в 5-10 раз дороже, чем их более оптимизированные аналоги.
Следующая таблица предоставляет подробный обзор оптимизированных и моделей высшего уровня Claude. Все цены указаны на основе миллиона токенов. Обратите внимание, что цены указаны с июля 2026 года, и они могут измениться, но это все равно помогает подчеркнуть основную мысль.
Используя Haiku в качестве базового уровня, мы замечаем, что Opus 5 стоит в 5 раз дороже. Новые флагманские модели еще дороже, где такие модели, как Fable 5, стоят в 10 раз дороже, чем оптимизированная модель, такая как Haiku. Эти ценовые различия подчеркивают выбор модели как одну из лучших стратегий оптимизации затрат.
Чтобы бороться с растущими затратами, связанными с высоким потреблением токенов, компаниям рекомендуется разумно выбирать модели. Большие пограничные модели, такие как Opus, рекомендуются для сложных сеансов кодирования, в то время как модели, такие как Haiku, рекомендуются для быстрых вопросов и задач подагента.
Большое окно контекста увеличивает стоимость
На модели одного размера, такой как Opus 5, большое окно контекста является решающим фактором в общей стоимости. Проще говоря, окно контекста — это рабочая память LLM для сеанса, которая включает подсказки, историю беседы, извлеченные документы и ответы модели. Удвоение размера окна контекста может в четыре раза увеличить необходимые вычисления.
Чтобы наблюдать влияние потребления контекста на стоимость, я проведу простой тест. Будут запущены два идентичных сеанса Claude. Будет задан один и тот же вопрос, но разница будет в том, что в одном из сеансов будет использован «Одиссея» Гомера в окне контекста.
Оба сеанса ответят на один и тот же вопрос: «Кто такая Каллипсо и почему она держала Одиссея в плену?»
Этот вопрос о романе выбран, потому что текст произведения состоит из 132 953 слов, что примерно соответствует 177 000 токенов. По сравнению с сеансом кодирования, где могут быть загружены новые зависимости и проверены сторонние пакеты, этот метод передачи контекста в сеанс приводит к предсказуемому количеству потребления контекста.
Сессия Claude, в которой текст не скопирован в контекст, сможет выполнить веб-поиск и ответить на вопрос с меньшими затратами токенов. Следующая таблица показывает потребление токенов сеансов.
Это большое различие в потреблении токенов соответствует значительной разнице в стоимости сеансов.
Одним из интересных выводов здесь является то, что без подачи контекста вопрос, заданный в обоих сеансах Claude, одинаков, но стоимость каждого сеанса показывает большую разницу.
Для одного и того же вопроса сеанс с подачей контекста стоил 0,24 доллара, в то время как сеанс без контекста стоил всего 0,12 доллара. Когда сеанс продолжает расти, эта стоимость становится базой, добавляемой к каждому новому запросу LLM. Ответ, полученный в сеансе со всем контекстом, был более детализированным и более качественным, но он стоил в 2 раза дороже.
Для многих практических приложений необходимо передавать точный контекст, который нужен LLM, но найти границу, которую нужно провести, гораздо сложнее. В какой-то момент пользователь жертвует контекстом и стоимостью ради качества ответа. Постоянное увеличение окна контекста не является жизнеспособным вариантом, и такие модели, как Haiku, предотвращают эту проблему, ограничивая окно токенов до 200 000.
Максимизация результатов >> максимизация токенов
Выбирая большие модели для каждой задачи и добавляя сеансы с дополнительным контекстом, пользователи могут легко увеличить свои счета за LLM. В корпоративной Америке были стимулы для пользователей увеличить использование ИИ.
Существуют критики тренда token maxxing, которые утверждают, что потраченные токены — это ошибочная метрика, и, как сообщает Бускет, мы должны рассчитывать увеличенный выход, связанный с использованием LLM. Ямини Ранган, генеральный директор HubSpot, лучше всего подытожила это в своем посте в LinkedIn: «Максимизация результатов >> максимизация токенов».
Тренд tokenmaxxing похож на начало 2000-х, когда компании рассчитывали количество строк кода. Объем генерируемого кода или документов, подлежащих проверке, в лучшем случае является прокси, а в худшем — ошибочной метрикой.
Соня Хуанг из Sequoia Capital признает Бускету, что token maxxing — это ошибочная метрика и может быть необходима для быстрого принятия LLM. В будущем я ожидаю увидеть множество оптимизаций и инструментов, создаваемых вокруг проблемы выбора модели и оптимизации окна контекста.
Другие статьи
Растущие затраты на гонку потребления токенов
Почему токенмаксинг приводит к росту затрат на ИИ, как выбор модели и контекстные окна влияют на счета LLM, и почему компаниям следует сосредоточиться на результатах.
