La economía de un agente de voz: cuánto cuesta realmente un minuto de conversación

La economía de un agente de voz: cuánto cuesta realmente un minuto de conversación

      La mayoría de los precios de los agentes de voz comienzan con un solo número: el costo del agente de voz por minuto. Sin embargo, esta cifra no revela mucho sobre el costo real de operar un sistema de producción.

      Descubrí esto de primera mano mientras construía y operaba un agente de voz para uso empresarial. Cuando se tiene en cuenta el reconocimiento de voz, la conversión de texto a voz, el uso de modelos, la telefonía y la infraestructura, un minuto de producción implica varios costos diferentes.

      Por eso, es más útil observar el costo por resultado exitoso en su lugar.

      Lo que hay dentro de un minuto de voz

      Un agente de voz de producción generalmente tiene cinco capas de costo principales, principalmente:

      El reconocimiento de voz convierte el audio entrante en texto y generalmente se cobra por minuto de audio.

      La inferencia de LLM cobra por tokens, no por tiempo. Las llamadas más largas pueden costar más a medida que el modelo procesa instrucciones, historial de conversación y resultados de herramientas.

      La conversión de texto a voz convierte las respuestas de nuevo en audio y generalmente se cobra por caracteres, tokens o la cantidad de voz generada. Si el agente habla mucho, la TTS puede convertirse en un costo variable alto.

      La telefonía y el transporte añaden cargos basados en el tiempo conectado, dependiendo del proveedor, tipo de llamada y ubicación.

      La infraestructura de voz en tiempo real incluye servidores de medios, orquestación, computación, tasa de sesión, registro y monitoreo. Las plataformas gestionadas a menudo incluyen estos en su precio por minuto, pero si construyes tu propio sistema, asumes más costos de ingeniería.

      Entonces, cuando ves un precio de IA conversacional como “$0.05 por minuto”, no significa mucho a menos que sepas lo que realmente está incluido.

      Una llamada de 35 minutos tiene dos tamaños

      Considera una conversación de estilo entrevista de 35 minutos. Alguien podría hablar durante 20 minutos, mientras que el agente lo hace durante 12. Las pausas, interrupciones y transiciones de turno ocupan el tiempo restante.

      Cada capa de costo ve esa llamada de manera diferente. El STT se preocupa principalmente por el habla de los participantes. La TTS se preocupa por el habla del agente. La telefonía y la infraestructura pueden medir los 35 minutos completos.

      El LLM ve otra dimensión: el contexto acumulado.

      Al comienzo de una llamada, el modelo podría procesar solo instrucciones del sistema y algunos intercambios. Después de 20 turnos, puede necesitar incluir respuestas anteriores, diálogo reciente, salidas de herramientas e instrucciones nuevamente antes de hacer la siguiente respuesta. Esto significa que un turno posterior puede costar más que el anterior, incluso si ambas respuestas tardan el mismo tiempo en decirse.

      Los equipos pueden ralentizar el crecimiento del contexto resumiendo diálogos antiguos, eliminando información obsoleta, solo incorporando lo que es relevante o utilizando caché si el modelo lo permite. Así que cada método tiene pros y contras. Si eliminas demasiado, la colección podría olvidar algo importante. Pero si mantienes todo, tu uso de tokens sigue aumentando.

      Noté esta diferencia en conversaciones largas. Un participante puede dar 5 respuestas claras. Otro podría interrumpir, pedir aclaraciones y luego volver a la pregunta original. Ambas llamadas podrían tomar aproximadamente el mismo tiempo, pero la segunda crea más turnos y trabaja para el modelo.

      Mientras que la duración de la llamada establece el punto de partida, cómo va la conversación decidirá cuánto tiempo costará realmente.

      El silencio, las interrupciones y la latencia añaden costo

      Las conversaciones reales tienen momentos de silencio. Alguien podría hacer una pausa para pensar o buscar un documento. Si bien el reconocimiento de voz no cobrará por cada segundo de silencio, la telefonía y la infraestructura de sesión seguirán cobrando mientras haya una conexión abierta.

      Las interrupciones añaden otro costo. Si comienzas a hablar mientras el agente está hablando, el sistema detendrá su respuesta, aunque el servicio de TTS ya haya creado audio que nadie escucha.

      La latencia puede empeorar el problema. Responder demasiado lentamente puede hacer que las personas se repitan o comiencen otra oración. Esto crea otro turno, más procesamiento y más tiempo conectado.

      Para reducir la latencia, necesitas modelos más rápidos, mejor detección de turnos, infraestructura mejorada o más trabajo de ingeniería. Si bien estas pueden aumentar los costos directos, estas opciones pueden prevenir sistemas lentos que pueden volverse costosos con turnos adicionales.

      Las llamadas fallidas pertenecen al numerador

      Digamos que tu sistema necesita 108 intentos para producir 100 resultados exitosos. Las ocho fallas pueden haber utilizado ya la transcripción, tokens del modelo, voz generada, telefonía e infraestructura antes de finalizar. Si los usuarios intentan nuevamente, comienza otro conjunto de costos.

      Los modelos prácticos a menudo se ven así:

      Costo por resultado exitoso = (Pila de voz + costos de falla y reintento + manejo humano + evaluación y operaciones) / Resultados exitosos

      Ilustración práctica del costo del agente de voz por minuto, Fuente: Felipe Duarte — Crédito: Felipe Duarte

      Cuando ocurre una falla también importa. Perder una llamada después del minuto 34 cuesta más que perderla después del minuto 1. Un precio bajo en el encabezado no puede compensar las bajas tasas de finalización.

      El cambio de voz no inglesa cambia la economía

      Trabajar en un idioma que no es inglés cambió cómo evalué los componentes. La calidad del reconocimiento importaba más que el precio en el encabezado porque un error podría desencadenar otra respuesta, un turno del modelo y una llamada más larga.

      La calidad de la voz también tenía que mantenerse clara durante llamadas largas. La detección de turnos tenía que manejar acentos reales, diferentes velocidades de habla, interrupciones y frases cotidianas en lugar de audio de referencia limpio.

      Algunos proveedores cobran más por modelos de habla multilingües o de mayor capacidad. Pero el alto costo a menudo proviene de lo que sucede después. Si un reconocedor más barato causa más repeticiones y turnos de clasificación, la conversación termina costando más.

      Y eso cambió mi enfoque: mejorar la conversación primero, luego el componente.

      La transferencia y evaluación humana también cuentan

      Algunas conversaciones deben pasar a una persona. Ese puede ser el resultado correcto, pero el manejo humano aún pertenece al modelo de costo. Si un flujo de trabajo requiere con frecuencia varios minutos de seguimiento manual, recortar medio centavo del precio de TTS puede afectar apenas el caso de negocio.

      Los sistemas de producción también necesitan observabilidad y evaluación. La observabilidad te dice cuándo la latencia aumenta, una herramienta falla o una transferencia deja de funcionar. La evaluación te dice si la conversación logró el resultado deseado. Ambos requieren infraestructura y esfuerzo de ingeniería, aunque ninguno aparece en la tarifa por minuto en el encabezado.

      Construir versus comprar es una cuestión de volumen

      Las plataformas gestionadas cobran por el trabajo que una pila autoconstruida debe absorber: orquestación, manejo de medios, escalado, integraciones y recuperación de fallas. La autoensamblaje puede reducir el costo variable de la API, pero añade gastos fijos de ingeniería y operación.

      La comparación útil es:

      Prima de plataforma por minuto x volumen esperado

      versus:

      Costo de ingeniería y operación de poseer la pila

      A un volumen modesto, pagar una tarifa variable más alta aún puede ser más barato en general. A volúmenes muy grandes, ahorrar unos centavos en millones de minutos puede justificar poseer más infraestructura. El punto de cruce depende del costo del equipo, los requisitos de confiabilidad, la forma del tráfico y los precios de la plataforma.

      La economía de unidades de IA de voz decide qué escala

      La calidad del modelo establece el mínimo. Después de eso, la economía determina si un caso de uso funciona.

      Una entrevista de 30 minutos, una sesión de admisión o un flujo de trabajo de programación pueden justificar costos más altos si la finalización exitosa crea suficiente valor o reemplaza un esfuerzo humano significativo. Una interacción de dos minutos aún puede tener una economía pobre si se reintenta, se escala o se entrega poco valor.

      Rastrea el tiempo conectado, el tiempo de habla, la voz generada, el conteo de turnos, el crecimiento del contexto, las interrupciones, los reintentos, la escalada y la tasa de finalización. Luego compara el costo total de un resultado exitoso con su valor.

      Los costos de los agentes de voz de IA están cayendo, pero no de manera uniforme. Los precios de modelos, voz, orquestación e infraestructura cambian a diferentes tasas, cambiando continuamente la viabilidad de diferentes casos de uso.

      Los agentes de voz que escalan no solo usarán el mejor modelo. Combinarán una calidad de modelo suficiente con un diseño de conversación y un modelo operativo que produzca suficiente valor por resultado exitoso.

      Hasta que calcules ese número, no sabes cuánto cuesta tu agente de voz. Solo sabes lo que cobran sus componentes.

      Referencias:

      Andreessen Horowitz. (2024, 29 de mayo). Hola, IA: Nuestra tesis sobre agentes de voz de IA. https://a16z.com/ai-voice-agents/

      Andreessen Horowitz. (2025, 29 de enero). Agentes de voz de IA: actualización 2025. https://a16z.com/ai-voice-agents-2025-update/

      Deepgram. (202

La economía de un agente de voz: cuánto cuesta realmente un minuto de conversación

Otros artículos

Alina Kukarina sobre por qué la transformación de la IA comienza antes de elegir la tecnología Alina Kukarina sobre por qué la transformación de la IA comienza antes de elegir la tecnología Alina Kukarina argumenta que las iniciativas de IA fracasan cuando las organizaciones saltan el vacío de pensamiento entre la ambición y la implementación, comenzando con la tecnología en lugar de con el propósito. La idea de las gafas inteligentes con reconocimiento facial de Meta acaba de resurgir en una patente. La idea de las gafas inteligentes con reconocimiento facial de Meta acaba de resurgir en una patente. Una nueva patente pública de Meta describe cómo sus gafas inteligentes podrían identificar personas utilizando reconocimiento facial por IA y usar esa información al crear medios. YouTube está aumentando los conteos de vistas, pero los creadores no están ganando más dinero. YouTube está aumentando los conteos de vistas, pero los creadores no están ganando más dinero. YouTube pronto contará una vista pública desde el momento en que un video comienza a reproducirse en videos de formato largo, Shorts y transmisiones en vivo, enviando los totales de vistas visibles más altos. Las Notas de Playlist de Spotify facilitan agregar contexto a tus selecciones favoritas. Las Notas de Playlist de Spotify facilitan agregar contexto a tus selecciones favoritas. Las nuevas Notas de Playlist de Spotify permiten a los editores y usuarios explicar la historia detrás de cada pista, directamente dentro de la propia lista de reproducción. El Pixel 11 me da tres razones para dejar mi iPhone 17, y temo que funcionen. El Pixel 11 me da tres razones para dejar mi iPhone 17, y temo que funcionen. El Pixel 11 tiene un teleobjetivo dedicado, herramientas de IA más inteligentes y una batería mucho más grande, lo que le da una ventaja intrigante sobre el iPhone 17. La economía de un agente de voz: cuánto cuesta realmente un minuto de conversación La economía de un agente de voz: cuánto cuesta realmente un minuto de conversación El precio por minuto de un agente de voz oculta cinco capas de costo, gastos generales de fallos y el crecimiento del contexto que determinan si un caso de uso realmente escala.

La economía de un agente de voz: cuánto cuesta realmente un minuto de conversación

El precio por minuto de un agente de voz oculta cinco capas de costo, gastos generales de fallos y crecimiento contextual que determinan si un caso de uso realmente escala.