L'economia di un agente vocale: quanto costa realmente un minuto di conversazione
La maggior parte dei prezzi degli agenti vocali inizia con un numero singolo: costo per minuto dell'agente vocale. Tuttavia, questa cifra non rivela molto sul costo reale di gestione di un sistema di produzione.
L'ho scoperto di persona mentre costruivo e gestivo un agente vocale per uso aziendale. Quando si considerano il riconoscimento vocale, il text-to-speech, l'uso del modello, la telefonia e l'infrastruttura, un minuto di produzione comporta diversi costi.
Ecco perché è più utile guardare al costo per risultato riuscito.
Cosa c'è all'interno di un minuto vocale
Un agente vocale di produzione ha solitamente cinque principali livelli di costo, principalmente:
Il riconoscimento vocale (STT) converte l'audio in arrivo in testo ed è tipicamente tariffato per minuto audio.
L'inferenza LLM addebita per token, non per tempo. Le chiamate più lunghe possono costare di più mentre il modello elabora istruzioni, cronologia delle conversazioni e risultati degli strumenti.
Il text-to-speech (TTS) trasforma le risposte di nuovo in audio ed è solitamente tariffato per caratteri, token o quantità di discorso generato. Se l'agente parla molto, il TTS può diventare un costo variabile elevato.
La telefonia e il trasporto aggiungono costi basati sul tempo connesso, a seconda del fornitore, del tipo di chiamata e della posizione.
L'infrastruttura vocale in tempo reale include server multimediali, orchestrazione, calcolo, tariffa di sessione, registrazione e monitoraggio. Le piattaforme gestite spesso includono questi costi nel loro prezzo per minuto, ma se costruisci il tuo sistema, ti assumi costi di ingegneria maggiori.
Quindi, quando vedi un prezzo per l'IA conversazionale come "$0,05 al minuto", non significa molto a meno che tu non sappia cosa è effettivamente incluso.
Una chiamata di 35 minuti ha due dimensioni
Considera una conversazione in stile intervista di 35 minuti. Qualcuno potrebbe parlare per 20 minuti, mentre l'agente per 12. Le pause, le interruzioni e le transizioni di turno occupano il tempo rimanente.
Ogni livello di costo vede quella chiamata in modo diverso. Lo STT si preoccupa principalmente del discorso dei partecipanti. Il TTS si preoccupa del discorso dell'agente. La telefonia e l'infrastruttura possono misurare l'intera durata di 35 minuti.
L'LLM vede un'altra dimensione: il contesto accumulato.
All'inizio di una chiamata, il modello potrebbe elaborare solo istruzioni di sistema e alcuni scambi. Dopo 20 turni, potrebbe dover includere risposte precedenti, dialoghi recenti, output degli strumenti e istruzioni di nuovo prima di fornire la prossima risposta. Questo significa che un turno successivo può costare di più rispetto a uno precedente, anche se entrambe le risposte richiedono lo stesso tempo per essere pronunciate.
I team possono rallentare la crescita del contesto riassumendo dialoghi vecchi, rimuovendo informazioni obsolete, estraendo solo ciò che è rilevante o utilizzando la memorizzazione nella cache se il modello lo consente. Quindi, ogni metodo ha pro e contro. Se rimuovi troppo, la raccolta potrebbe dimenticare qualcosa di importante. Ma se mantieni tutto, l'uso dei token continua a salire.
Ho notato questa differenza in conversazioni lunghe. Un partecipante può fornire 5 risposte chiare. Un altro potrebbe interrompere, chiedere chiarimenti e poi tornare alla domanda originale. Entrambe le chiamate potrebbero richiedere circa lo stesso tempo, ma la seconda crea più turni e lavora per il modello.
Mentre la lunghezza della chiamata stabilisce il punto di partenza, come procede la conversazione deciderà quanto tempo costerà effettivamente.
Silenzio, interruzioni e latenza aggiungono costi
Le conversazioni reali hanno momenti di silenzio. Qualcuno potrebbe fermarsi per pensare o cercare un documento. Anche se il riconoscimento vocale non addebita per ogni secondo di silenzio, la telefonia e l'infrastruttura della sessione continuano ad addebitare finché c'è una connessione aperta.
Le interruzioni aggiungono un altro costo. Se inizi a parlare mentre l'agente sta parlando, il sistema interromperà la sua risposta, anche se il servizio TTS ha già creato audio che nessuno sente.
La latenza può aggravare il problema. Rispondere troppo lentamente può far ripetere le persone o iniziare un'altra frase. Questo crea un altro turno, più elaborazione e un tempo di connessione più lungo.
Per ridurre la latenza, hai bisogno di modelli più veloci, di una migliore rilevazione dei turni, di un'infrastruttura migliorata o di più lavoro di ingegneria. Anche se queste opzioni possono aumentare i costi diretti, possono prevenire sistemi lenti che possono diventare costosi con turni extra.
Le chiamate fallite appartengono al numeratore
Diciamo che il tuo sistema ha bisogno di 108 tentativi per produrre 100 risultati riusciti. Gli otto fallimenti potrebbero aver già utilizzato trascrizione, token del modello, discorso generato, telefonia e infrastruttura prima di terminare. Se gli utenti riprovano, inizia un altro insieme di costi.
I modelli pratici spesso appaiono così:
Costo per risultato riuscito = (Stack vocale + costi di fallimento e ripetizione + gestione umana + valutazione e operazioni) / Risultati riusciti
Illustrazione pratica del costo per minuto dell'agente vocale, Fonte: Felipe Duarte — Credito: Felipe Duarte
Quando si verifica un fallimento è importante. Perdere una chiamata dopo il minuto 34 costa di più che perderla dopo il minuto 1. Un prezzo di intestazione basso non può compensare tassi di completamento scadenti.
Il cambiamento della voce non inglese modifica l'economia
Lavorare in una lingua non inglese ha cambiato il modo in cui ho valutato i componenti. La qualità del riconoscimento contava di più del prezzo di intestazione perché un errore potrebbe innescare un'altra risposta, un turno del modello e una chiamata più lunga.
La qualità della voce doveva anche rimanere chiara durante le lunghe chiamate. La rilevazione dei turni doveva gestire accenti reali, diverse velocità di parola, interruzioni e frasi quotidiane invece di audio di benchmark pulito.
Alfornitori alcuni addebitano di più per modelli di discorso multilingue o di maggiore capacità. Ma il costo elevato spesso deriva da ciò che accade dopo. Se un riconoscitore più economico causa più ripetizioni e turni di classificazione, la conversazione finisce per costare di più.
E questo ha cambiato il mio focus: migliorare prima la conversazione, poi il componente.
Il passaggio umano e la valutazione contano anche
Alcune conversazioni dovrebbero passare a una persona. Questo può essere l'esito corretto, ma la gestione umana appartiene comunque al modello di costo. Se un flusso di lavoro richiede frequentemente diversi minuti di follow-up manuale, ridurre di mezzo centesimo il prezzo del TTS potrebbe influenzare a malapena il caso aziendale.
I sistemi di produzione hanno anche bisogno di osservabilità e valutazione. L'osservabilità ti dice quando la latenza aumenta, uno strumento fallisce o un trasferimento smette di funzionare. La valutazione ti dice se la conversazione ha raggiunto il risultato previsto. Entrambi richiedono infrastruttura e sforzo di ingegneria, anche se nessuno dei due appare nella tariffa per minuto di intestazione.
Costruire contro acquistare è una questione di volume
Le piattaforme gestite addebitano per il lavoro che uno stack auto-costruito deve altrimenti assorbire: orchestrazione, gestione dei media, scalabilità, integrazioni e recupero da guasti. L'auto-assemblaggio può ridurre il costo variabile delle API, ma aggiunge spese fisse di ingegneria e operative.
Il confronto utile è:
Premium della piattaforma per minuto x volume previsto
contro:
Costo di ingegneria e operazione di possedere lo stack
A volumi modesti, pagare una tariffa variabile più alta può comunque essere più economico nel complesso. A volumi molto elevati, risparmiare qualche centesimo su milioni di minuti può giustificare il possesso di più infrastruttura. Il punto di crossover dipende dal costo del team, dai requisiti di affidabilità, dalla forma del traffico e dalla tariffazione della piattaforma.
L
Altri articoli
L'economia di un agente vocale: quanto costa realmente un minuto di conversazione
Il prezzo principale al minuto di un agente vocale nasconde cinque strati di costo, spese generali per il fallimento e crescita del contesto che determinano se un caso d'uso scala effettivamente.
