La economía de un agente de voz: cuánto cuesta realmente un minuto de conversación
La mayoría de los precios de los agentes de voz comienzan con un solo número: el costo del agente de voz por minuto. Sin embargo, esta cifra no revela mucho sobre el costo real de operar un sistema de producción.
Descubrí esto de primera mano mientras construía y operaba un agente de voz para uso empresarial. Cuando se tiene en cuenta el reconocimiento de voz, la conversión de texto a voz, el uso de modelos, la telefonía y la infraestructura, un minuto de producción implica varios costos diferentes.
Por eso, es más útil observar el costo por resultado exitoso en su lugar.
Lo que hay dentro de un minuto de voz
Un agente de voz de producción generalmente tiene cinco capas de costo principales, principalmente:
El reconocimiento de voz convierte el audio entrante en texto y generalmente se cobra por minuto de audio.
La inferencia de LLM cobra por tokens, no por tiempo. Las llamadas más largas pueden costar más a medida que el modelo procesa instrucciones, historial de conversación y resultados de herramientas.
La conversión de texto a voz convierte las respuestas de nuevo en audio y generalmente se cobra por caracteres, tokens o la cantidad de voz generada. Si el agente habla mucho, la TTS puede convertirse en un costo variable alto.
La telefonía y el transporte añaden cargos basados en el tiempo conectado, dependiendo del proveedor, tipo de llamada y ubicación.
La infraestructura de voz en tiempo real incluye servidores de medios, orquestación, computación, tasa de sesión, registro y monitoreo. Las plataformas gestionadas a menudo incluyen estos en su precio por minuto, pero si construyes tu propio sistema, asumes más costos de ingeniería.
Entonces, cuando ves un precio de IA conversacional como “$0.05 por minuto”, no significa mucho a menos que sepas lo que realmente está incluido.
Una llamada de 35 minutos tiene dos tamaños
Considera una conversación de estilo entrevista de 35 minutos. Alguien podría hablar durante 20 minutos, mientras que el agente lo hace durante 12. Las pausas, interrupciones y transiciones de turno ocupan el tiempo restante.
Cada capa de costo ve esa llamada de manera diferente. El STT se preocupa principalmente por el habla de los participantes. La TTS se preocupa por el habla del agente. La telefonía y la infraestructura pueden medir los 35 minutos completos.
El LLM ve otra dimensión: el contexto acumulado.
Al comienzo de una llamada, el modelo podría procesar solo instrucciones del sistema y algunos intercambios. Después de 20 turnos, puede necesitar incluir respuestas anteriores, diálogo reciente, salidas de herramientas e instrucciones nuevamente antes de hacer la siguiente respuesta. Esto significa que un turno posterior puede costar más que el anterior, incluso si ambas respuestas tardan el mismo tiempo en decirse.
Los equipos pueden ralentizar el crecimiento del contexto resumiendo diálogos antiguos, eliminando información obsoleta, solo incorporando lo que es relevante o utilizando caché si el modelo lo permite. Así que cada método tiene pros y contras. Si eliminas demasiado, la colección podría olvidar algo importante. Pero si mantienes todo, tu uso de tokens sigue aumentando.
Noté esta diferencia en conversaciones largas. Un participante puede dar 5 respuestas claras. Otro podría interrumpir, pedir aclaraciones y luego volver a la pregunta original. Ambas llamadas podrían tomar aproximadamente el mismo tiempo, pero la segunda crea más turnos y trabaja para el modelo.
Mientras que la duración de la llamada establece el punto de partida, cómo va la conversación decidirá cuánto tiempo costará realmente.
El silencio, las interrupciones y la latencia añaden costo
Las conversaciones reales tienen momentos de silencio. Alguien podría hacer una pausa para pensar o buscar un documento. Si bien el reconocimiento de voz no cobrará por cada segundo de silencio, la telefonía y la infraestructura de sesión seguirán cobrando mientras haya una conexión abierta.
Las interrupciones añaden otro costo. Si comienzas a hablar mientras el agente está hablando, el sistema detendrá su respuesta, aunque el servicio de TTS ya haya creado audio que nadie escucha.
La latencia puede empeorar el problema. Responder demasiado lentamente puede hacer que las personas se repitan o comiencen otra oración. Esto crea otro turno, más procesamiento y más tiempo conectado.
Para reducir la latencia, necesitas modelos más rápidos, mejor detección de turnos, infraestructura mejorada o más trabajo de ingeniería. Si bien estas pueden aumentar los costos directos, estas opciones pueden prevenir sistemas lentos que pueden volverse costosos con turnos adicionales.
Las llamadas fallidas pertenecen al numerador
Digamos que tu sistema necesita 108 intentos para producir 100 resultados exitosos. Las ocho fallas pueden haber utilizado ya la transcripción, tokens del modelo, voz generada, telefonía e infraestructura antes de finalizar. Si los usuarios intentan nuevamente, comienza otro conjunto de costos.
Los modelos prácticos a menudo se ven así:
Costo por resultado exitoso = (Pila de voz + costos de falla y reintento + manejo humano + evaluación y operaciones) / Resultados exitosos
Ilustración práctica del costo del agente de voz por minuto, Fuente: Felipe Duarte — Crédito: Felipe Duarte
Cuando ocurre una falla también importa. Perder una llamada después del minuto 34 cuesta más que perderla después del minuto 1. Un precio bajo en el encabezado no puede compensar las bajas tasas de finalización.
El cambio de voz no inglesa cambia la economía
Trabajar en un idioma que no es inglés cambió cómo evalué los componentes. La calidad del reconocimiento importaba más que el precio en el encabezado porque un error podría desencadenar otra respuesta, un turno del modelo y una llamada más larga.
La calidad de la voz también tenía que mantenerse clara durante llamadas largas. La detección de turnos tenía que manejar acentos reales, diferentes velocidades de habla, interrupciones y frases cotidianas en lugar de audio de referencia limpio.
Algunos proveedores cobran más por modelos de habla multilingües o de mayor capacidad. Pero el alto costo a menudo proviene de lo que sucede después. Si un reconocedor más barato causa más repeticiones y turnos de clasificación, la conversación termina costando más.
Y eso cambió mi enfoque: mejorar la conversación primero, luego el componente.
La transferencia y evaluación humana también cuentan
Algunas conversaciones deben pasar a una persona. Ese puede ser el resultado correcto, pero el manejo humano aún pertenece al modelo de costo. Si un flujo de trabajo requiere con frecuencia varios minutos de seguimiento manual, recortar medio centavo del precio de TTS puede afectar apenas el caso de negocio.
Los sistemas de producción también necesitan observabilidad y evaluación. La observabilidad te dice cuándo la latencia aumenta, una herramienta falla o una transferencia deja de funcionar. La evaluación te dice si la conversación logró el resultado deseado. Ambos requieren infraestructura y esfuerzo de ingeniería, aunque ninguno aparece en la tarifa por minuto en el encabezado.
Construir versus comprar es una cuestión de volumen
Las plataformas gestionadas cobran por el trabajo que una pila autoconstruida debe absorber: orquestación, manejo de medios, escalado, integraciones y recuperación de fallas. La autoensamblaje puede reducir el costo variable de la API, pero añade gastos fijos de ingeniería y operación.
La comparación útil es:
Prima de plataforma por minuto x volumen esperado
versus:
Costo de ingeniería y operación de poseer la pila
A un volumen modesto, pagar una tarifa variable más alta aún puede ser más barato en general. A volúmenes muy grandes, ahorrar unos centavos en millones de minutos puede justificar poseer más infraestructura. El punto de cruce depende del costo del equipo, los requisitos de confiabilidad, la forma del tráfico y los precios de la plataforma.
La economía de unidades de IA de voz decide qué escala
La calidad del modelo establece el mínimo. Después de eso, la economía determina si un caso de uso funciona.
Una entrevista de 30 minutos, una sesión de admisión o un flujo de trabajo de programación pueden justificar costos más altos si la finalización exitosa crea suficiente valor o reemplaza un esfuerzo humano significativo. Una interacción de dos minutos aún puede tener una economía pobre si se reintenta, se escala o se entrega poco valor.
Rastrea el tiempo conectado, el tiempo de habla, la voz generada, el conteo de turnos, el crecimiento del contexto, las interrupciones, los reintentos, la escalada y la tasa de finalización. Luego compara el costo total de un resultado exitoso con su valor.
Los costos de los agentes de voz de IA están cayendo, pero no de manera uniforme. Los precios de modelos, voz, orquestación e infraestructura cambian a diferentes tasas, cambiando continuamente la viabilidad de diferentes casos de uso.
Los agentes de voz que escalan no solo usarán el mejor modelo. Combinarán una calidad de modelo suficiente con un diseño de conversación y un modelo operativo que produzca suficiente valor por resultado exitoso.
Hasta que calcules ese número, no sabes cuánto cuesta tu agente de voz. Solo sabes lo que cobran sus componentes.
Referencias:
Andreessen Horowitz. (2024, 29 de mayo). Hola, IA: Nuestra tesis sobre agentes de voz de IA. https://a16z.com/ai-voice-agents/
Andreessen Horowitz. (2025, 29 de enero). Agentes de voz de IA: actualización 2025. https://a16z.com/ai-voice-agents-2025-update/
Deepgram. (202
Otros artículos
La economía de un agente de voz: cuánto cuesta realmente un minuto de conversación
El precio por minuto de un agente de voz oculta cinco capas de costo, gastos generales de fallos y crecimiento contextual que determinan si un caso de uso realmente escala.
