El escritor apuesta por agentes de IA más baratos con Palmyra X6 y un arnés más ligero.
Writer, la empresa de IA empresarial, ha lanzado Palmyra X6, su nuevo modelo insignia, junto con un “arnés” mejorado diseñado para hacer algo que la industria ha sido curiosamente reacia a prometer: gastar menos tokens.
El modelo es una variación post-entrenamiento del GLM-5.2 de código abierto de Z.ai, y está disponible para los clientes de Writer desde hoy.
La propuesta llega en un momento nervioso. A medida que la IA agente multiplica silenciosamente los pasos, y por lo tanto los tokens, detrás de cada tarea, las facturas empresariales han comenzado a doler.
Writer está apostando a que ha llegado una reacción en contra de los costos, y no está sola en percibir la oportunidad, con Baseten recaudando $1.5 mil millones bajo la teoría de que las ganancias de la IA residen en la inferencia barata.
Un arnés, según lo cuenta Writer, es la capa de orquestación envuelta alrededor de un modelo, la maquinaria que decide cómo un agente de múltiples pasos ejecuta realmente cada solicitud.
Optimiza esa capa, recortando las llamadas redundantes y el contexto inflado que los agentes tienden a acumular, y reduces el consumo de tokens sin tocar nunca el modelo en sí.
Los ahorros, dice Writer, son sustanciales. La empresa estima que el nuevo modelo y el arnés juntos reducen los costos en hasta un 50% para tareas básicas, mientras que un documento de investigación de Writer encontró que los cambios en la eficiencia del arnés por sí solos recortaron los costos en aproximadamente un 40% en promedio durante las pruebas.
Lo que hace interesante al arnés es que es agnóstico al modelo. Funciona con los propios modelos de Writer, pero también con externos servidos a través de Microsoft Azure y Amazon Bedrock, por lo que las ganancias de eficiencia no están bloqueadas en la hoja de ruta de un solo proveedor.
“El arnés es el único componente cuya eficiencia se multiplica en cada modelo que una organización ejecuta, presente y futuro”, escriben los investigadores de Writer, enmarcando la orquestación en lugar de la calidad bruta del modelo como la palanca que las empresas han estado ignorando.
También es un punto agudo. La afirmación subyacente de Writer es que los grandes laboratorios tienen poco incentivo para ayudarte a gastar menos, porque sus ingresos aumentan con cada token que quemas. La desconfianza hacia ese arreglo está haciendo mucho trabajo en el mensaje de la empresa.
La CEO May Habib lo expresó de manera contundente. “La empresa está absolutamente harta de perseguir el siguiente estándar”, dijo. “Quieren costos más planos.” Es una inversión ingeniosa del guion de ventas habitual, en el que cada nuevo modelo es más rápido, más inteligente y, invariablemente, más hambriento.
Una tendencia más amplia de maximización del ahorro, en la que los compradores optan por modelos chinos más baratos, ya ha comenzado a desestabilizar las valoraciones que sustentan las futuras OPI de OpenAI y Anthropic, una señal de que la sensibilidad al precio ya no es una preocupación marginal.
Construir el modelo insignia sobre GLM-5.2 es revelador por derecho propio. En lugar de entrenar un modelo de frontera desde cero, Writer tomó una base de código abierto capaz y la especializó a través del post-entrenamiento, una ruta que mantiene los costos bajos y se ajusta perfectamente a la historia frugal que está vendiendo.
Para los compradores europeos, el marco debería sentirse familiar. El escepticismo sobre los incentivos de los hiperescaladores estadounidenses y una preferencia por arquitecturas que no estén a merced de un solo proveedor ha sido un tema recurrente en este lado del Atlántico, y Writer está apuntando directamente a ello.
Hay advertencias que vale la pena tener en cuenta. Las cifras de eficiencia producidas por un proveedor sobre su propio producto merecen el habitual grano de sal, y “hasta” un 50% no es lo mismo que un 50% garantizado, pero la dirección del viaje es difícil de disputar.
El cambio más profundo es lo que Writer llama ingeniería de arnés: la disciplina de gastar menos tokens por tarea en lugar de perseguir otro punto en una tabla de clasificación. Si se afianza, y los incentivos sugieren cada vez más que lo hará, la era del modelo cada vez más hambriento puede finalmente estar encontrando su presupuesto.
Otros artículos
El escritor apuesta por agentes de IA más baratos con Palmyra X6 y un arnés más ligero.
El escritor ha lanzado Palmyra X6 y un arnés mejorado que dice puede reducir los costos de los agentes de IA en hasta un 50%, apostando a que ha llegado la reacción en contra de los costos empresariales.
