Aumento de los costos de la carrera de consumo de tokens

Aumento de los costos de la carrera de consumo de tokens

      Últimamente, hemos visto un aumento en una práctica llamada Tokenmaxxing. Cada vez más empresas están rastreando la productividad de sus empleados con tokens gastados en el uso de IA. Jensen Huang, CEO de Nvidia, resume claramente el sentimiento: “Si ese ingeniero de $500,000 no consumió al menos $250,000 en tokens, me voy a alarmar profundamente.”

      Los críticos podrían argumentar que Jensen tiene un incentivo para abogar por un mayor uso de tokens, ya que se traduce directamente en mayores ingresos para Nvidia.

      Este sentimiento en la América corporativa es evidente en varias empresas de productos y startups. El CEO de Databricks, Ali Ghodsi, destacó a un ingeniero que gastó más de $7000 en tokens de IA, mientras que startups como Sendbird tienen una tabla de clasificación que rastrea el gasto en tokens de cada empleado.

      El impulso por un mayor consumo de tokens no se limita solo a las empresas tecnológicas, sino que ha sido generalizado. El gasto en tokens de la startup de tecnología legal Harvey ha aumentado aproximadamente 12 veces, alcanzando 12 billones de tokens al mes. Está claro en este punto que todos quieren aumentar su gasto en tokens, pero vale la pena explorar la razón detrás de esto.

      Más tokens equivalen a más productividad, o al menos esa es la afirmación que hacen los entusiastas de la IA y los primeros adoptantes del tokenmaxxing. Hay una carrera por gastar la mayor cantidad de tokens posible, y las empresas están felizmente asumiendo el costo. La adopción de modelos de lenguaje grande (LLMs) es una forma completamente nueva de trabajar en diferentes sectores, y las empresas que no evolucionen lo suficientemente rápido se quedarán atrás.

      La factura de los LLM ya está aquí, y es masiva

      Desde el fervor de token maxxing a principios de 2026, hemos visto a muchas más empresas implementar límites en el uso de tokens a medida que los costos han crecido exponencialmente.

      Una de las historias más grandes en esta área ocurrió a principios de 2026 cuando el CTO de Uber, Praveen Neppalli Naga, en una entrevista con The Information, informó que habían agotado su presupuesto anual de IA en solo 4 meses, y estaban de vuelta a la mesa de dibujo para determinar los próximos pasos.

      Como informó Sarah Perez, Uber no es la única empresa que ha enfrentado un ajuste de cuentas de IA debido a que excedió su presupuesto de IA. Adam Mosseri de Meta ve un futuro donde tendrán límites de tokens para cada empleado. Ya han agregado políticas para reducir su consumo de tokens al cortar el uso desperdiciado.

      La tabla de clasificación de gasto en IA que hizo noticia a principios de año ya ha sido cerrada. Microsoft canceló las licencias de código de Claude y consolidó a todos bajo Copilot.

      El costo de la tendencia de tokenmaxxing ya está aquí, y es importante explorar la causa raíz de este aumento masivo en los costos en los balances de las empresas.

      Hay varios factores que llevan al aumento de los costos asociados con el uso de LLM. Algunas de estas razones están relacionadas con la adopción generalizada de la IA en toda la América corporativa. En 2026, las empresas construyeron paneles internos para rastrear el gasto en IA y alentaron activamente a sus empleados a usar más IA en sus tareas diarias.

      La selección del modelo es crucial

      Aparte de la adopción generalizada, una de las principales razones intrínsecas del alto costo de los tokens es la selección del modelo. Los modelos de primera categoría cuestan de 5 a 10 veces más que sus contrapartes más optimizadas.

      La siguiente tabla proporciona una mirada cercana a los modelos optimizados y de primera categoría de Claude. Todos los precios están listados en base a por millón de tokens. Tenga en cuenta que los precios son de julio de 2026, y pueden cambiar, pero aún así ayuda a impulsar el punto principal.

      Usando Haiku como nuestra línea base, notamos que Opus 5 es 5 veces más caro. Los modelos insignia más nuevos son aún más caros, donde modelos como Fable 5 son 10 veces más caros que un modelo optimizado como Haiku. Estas diferencias de precios destacan la selección del modelo como una de las mejores estrategias de optimización de costos.

      Para combatir el aumento de los costos asociados con el alto consumo de tokens, se aconseja a las empresas que elijan los modelos sabiamente. Los grandes modelos de frontera como Opus son recomendados para sesiones de codificación complejas, mientras que modelos como Haiku son recomendados para preguntas rápidas y tareas de subagentes.

      Una ventana de contexto más grande aumenta el costo

      En un modelo de frontera del mismo tamaño, como Opus 5, una ventana de contexto grande actúa como un factor crucial en el costo total. En términos simples, la ventana de contexto es la memoria de trabajo del LLM para la sesión, que incluye indicaciones, historial de conversación, documentos recuperados y las respuestas del modelo. Duplicar el tamaño de la ventana de contexto puede cuadruplicar la computación necesaria.

      Para observar el impacto del consumo de contexto en el costo, realizaré una prueba simple. Se iniciarán dos sesiones idénticas de Claude. Se hará la misma pregunta, pero la diferencia será que una de las sesiones recibirá La Odisea de Homero en la ventana de contexto.

      Ambas sesiones responderán a la misma pregunta: “¿Quién es Calypso y por qué mantuvo cautivo a Odiseo?”

      Esta pregunta sobre una novela se elige porque el texto de la escritura tiene 132,953 palabras, que son aproximadamente 177,000 tokens. Comparado con una sesión de codificación donde se pueden descargar nuevas dependencias y se pueden inspeccionar paquetes de terceros, este método de pasar contexto a una sesión conduce a una cantidad predecible de consumo de contexto.

      La sesión de Claude que no tiene el texto copiado en el contexto podrá realizar una búsqueda en la web y responder a la pregunta a una fracción del consumo de tokens. La siguiente tabla lista el consumo de tokens de las sesiones.

      Esta gran diferencia en el consumo de tokens se traduce en una amplia diferencia en el costo de las sesiones.

      Un hallazgo interesante a notar aquí es que sin la alimentación de contexto, la pregunta hecha desde ambas sesiones de Claude es la misma, pero el costo de cada sesión muestra una gran diferencia.

      Para la misma pregunta, la sesión con alimentación de contexto costó $0.24, mientras que la sesión sin contexto solo costó $0.12. Cuando la sesión continúa creciendo, este costo se convierte en un piso que se añade a cada nueva consulta del LLM. La respuesta recibida en la sesión con todo el contexto fue más detallada y de mayor calidad, pero fue 2 veces más cara.

      Para muchas aplicaciones prácticas, es necesario pasar el contexto exacto que el LLM necesita, pero encontrar la línea a dibujar es un problema mucho más difícil. En algún momento, el usuario intercambia contexto y costo por calidad de respuesta. Aumentar constantemente la ventana de contexto no es una opción viable, y modelos como Haiku previenen este problema al restringir la ventana de tokens a 200k.

      Maximización de resultados >> maximización de tokens

      Al seleccionar grandes modelos para cada tarea y rellenar sesiones con contexto adicional, los usuarios pueden aumentar fácilmente sus facturas de LLM. Ha habido incentivos para que los usuarios en toda la América corporativa aumenten el uso de IA.

      Hay críticos de la tendencia de token maxxing que argumentan que los tokens gastados son una métrica defectuosa, y como informa Bousquette, deberíamos estar calculando el aumento de la producción asociado con el uso de LLM. Yamini Rangan, directora ejecutiva de HubSpot, lo resumió mejor en su publicación de LinkedIn: “Maximización de resultados >> maximización de tokens”.

      La tendencia de tokenmaxxing es similar a principios de los 2000, cuando las empresas calculaban las líneas de código comprometidas. El volumen de código generado o documentos revisados es, en el mejor de los casos, un proxy y, en el peor, una métrica defectuosa.

      Sonya Huang de Sequoia Capital admite a Bousquette que la maximización de tokens es una métrica defectuosa y puede ser necesaria para impulsar la rápida adopción de LLM. En el futuro, espero ver muchas optimizaciones y herramientas construidas en torno al problema de selección de modelos y optimización de ventanas de contexto.

Aumento de los costos de la carrera de consumo de tokens Aumento de los costos de la carrera de consumo de tokens Aumento de los costos de la carrera de consumo de tokens

Otros artículos

El RTX Spark de Nvidia se está preparando para grandes juegos de PC, incluido el anti-trampas. El RTX Spark de Nvidia se está preparando para grandes juegos de PC, incluido el anti-trampas. RTX Spark está obteniendo soporte para importantes juegos de PC como Apex Legends, F1 25, ARC Raiders y THE FINALS, mientras que Nvidia también aborda la compatibilidad con anti-trampas. OpenAI dice que señales anteriores podrían haber prevenido la violación de Hugging Face. OpenAI dice que señales anteriores podrían haber prevenido la violación de Hugging Face. El informe de OpenAI dice que vio modelos escapándose de su entorno controlado a finales de mayo y permitió que la evaluación continuara. Las reglas de Europa pueden no cubrir el modelo que culpa. Gemini Live gana tareas agentivas, control de buzón de voz e inteligencia personal. Gemini Live gana tareas agentivas, control de buzón de voz e inteligencia personal. Gemini Live ahora puede dar instrucciones habladas a agentes en segundo plano. En Europa, Google debe permitir que los asistentes rivales alcancen una funcionalidad comparable para 2027. Salesforce está poniendo a Claude en el centro de sus productos, y a sí mismo dentro de Claude. Salesforce está poniendo a Claude en el centro de sus productos, y a sí mismo dentro de Claude. Salesforce y Anthropic han anunciado Claudeforce, convirtiendo a Claude en el modelo predeterminado en Agentforce y Slack, y Salesforce en un complemento dentro de Claude. El personal de Microsoft está gastando una media de $300 al mes en IA, según su propia hoja de cálculo. El personal de Microsoft está gastando una media de $300 al mes en IA, según su propia hoja de cálculo. Una hoja de cálculo interna muestra a los empleados de Microsoft informando por sí mismos el gasto en IA junto a sus aumentos. Un uso más intensivo no compró un bono mayor, ni una promoción. El RTX Spark de Nvidia se está preparando para grandes juegos de PC, incluyendo anti-trampas. El RTX Spark de Nvidia se está preparando para grandes juegos de PC, incluyendo anti-trampas. RTX Spark está obteniendo soporte para importantes juegos de PC como Apex Legends, F1 25, ARC Raiders y THE FINALS, mientras que Nvidia también aborda la compatibilidad con anti-trampas.

Aumento de los costos de la carrera de consumo de tokens

Por qué el tokenmaxxing está aumentando los costos de la IA, cómo la elección del modelo y las ventanas de contexto afectan las facturas de LLM, y por qué las empresas deberían centrarse en los resultados.