Экономика голосового агента: сколько на самом деле стоит минута разговора
Большинство цен на голосовых агентов начинается с одной цифры: стоимость голосового агента за минуту. Однако эта цифра не раскрывает много о реальной стоимости запуска производственной системы.
Я узнал это на собственном опыте, создавая и управляя голосовым агентом для корпоративного использования. Когда вы учитываете распознавание речи, синтез речи, использование модели, телефонию и инфраструктуру, производственная минута включает в себя несколько различных затрат.
Вот почему более полезно смотреть на стоимость за успешный результат.
Что включает в себя голосовая минута
Производственный голосовой агент обычно имеет пять основных слоев затрат, в основном:
Распознавание речи (STT) преобразует входящий аудиосигнал в текст и обычно оценивается за аудиоминуту.
Инференс LLM (модели с большим количеством параметров) оценивается по токенам, а не по времени. Более длительные звонки могут стоить дороже, так как модель обрабатывает инструкции, историю разговоров и результаты инструментов.
Синтез речи (TTS) преобразует ответы обратно в аудио и обычно оценивается по символам, токенам или количеству сгенерированной речи. Если агент много говорит, TTS может стать высокой переменной затратой.
Телефония и транспорт добавляют расходы на основе времени подключения, в зависимости от провайдера, типа звонка и местоположения.
Инфраструктура голосовой связи в реальном времени включает в себя медиасерверы, оркестрацию, вычисления, тарифы на сессии, ведение журналов и мониторинг. Управляемые платформы часто включают это в свою цену за минуту, но если вы строите свою собственную систему, вы берете на себя больше инженерных затрат.
Итак, когда вы видите цены на разговорный ИИ, такие как «$0.05 за минуту», это не имеет большого значения, если вы не знаете, что на самом деле включено.
35-минутный звонок имеет два размера
Рассмотрим 35-минутный разговор в формате интервью. Кто-то может говорить 20 минут, в то время как агент — 12. Паузы, перерывы и переходы занимают оставшееся время.
Каждый слой затрат рассматривает этот звонок по-разному. STT в основном интересует речь участников. TTS интересует речь агента. Телефония и инфраструктура могут учитывать все 35 минут.
LLM видит еще одно измерение: накопленный контекст.
В начале звонка модель может обрабатывать только системные инструкции и несколько обменов. После 20 поворотов ей может понадобиться включить более ранние ответы, недавний диалог, результаты инструментов и инструкции снова, прежде чем сделать следующий ответ. Это означает, что более поздний поворот может стоить дороже, чем более ранний, даже если оба ответа занимают одинаковое время для произнесения.
Команды могут замедлить рост контекста, подводя итоги старого диалога, удаляя устаревшую информацию, включая только то, что актуально, или используя кэширование, если модель это позволяет. Таким образом, у каждого метода есть свои плюсы и минусы. Если вы удалите слишком много, коллекция может забыть что-то важное. Но если сохранить все, использование токенов продолжает расти.
Я заметил эту разницу в длинных разговорах. Участник может дать 5 четких ответов. Другой может прервать, попросить разъяснения, а затем вернуться к исходному вопросу. Оба звонка могут занять примерно одинаковое время, но второй создает больше поворотов и работает для модели.
Хотя длина звонка устанавливает отправную точку, то, как проходит разговор, определит, сколько времени это на самом деле будет стоить.
Тишина, прерывания и задержка добавляют затраты
Настоящие разговоры имеют моменты тишины. Кто-то может сделать паузу, чтобы подумать или найти документ. Хотя распознавание речи не будет взимать плату за каждую секунду молчания, телефония и инфраструктура сессий продолжают взимать плату, пока есть открытое соединение.
Прерывания добавляют еще одну стоимость. Если вы начинаете говорить, пока агент говорит, система остановит свой ответ, даже если служба TTS уже создала аудио, которое никто не слышит.
Задержка может усугубить проблему. Слишком медленный ответ может заставить людей повторять себя или начинать новое предложение. Это создает еще один поворот, больше обработки и большее время подключения.
Чтобы уменьшить задержку, вам нужны более быстрые модели, лучшее обнаружение поворотов, улучшенная инфраструктура или больше инженерной работы. Хотя это может увеличить прямые затраты, эти варианты могут предотвратить медленные системы, которые могут стать дорогими из-за дополнительных поворотов.
Неудачные звонки относятся к числителю
Предположим, ваша система требует 108 попыток, чтобы произвести 100 успешных результатов. Восемь неудач могли уже использовать транскрипцию, токены модели, сгенерированную речь, телефонию и инфраструктуру, прежде чем закончиться. Если пользователи повторят попытку, начинается новый набор затрат.
Практические модели часто выглядят так:
Стоимость за успешный результат = (Голосовой стек + накладные расходы на неудачи и повторные попытки + человеческое вмешательство + оценка и операции) / Успешные результаты
Практическая иллюстрация стоимости голосового агента за минуту, источник: Фелипе Дуарте — Кредит: Фелипе Дуарте
Когда происходит неудача, это тоже имеет значение. Потеря звонка после 34-й минуты стоит больше, чем потеря его после 1-й минуты. Низкая заглавная цена не может компенсировать плохие показатели завершения.
Неанглийский голос меняет экономику
Работа на неанглийском языке изменила то, как я оценивал компоненты. Качество распознавания имело большее значение, чем заглавная цена, потому что ошибка могла вызвать другой ответ, поворот модели и более длительный звонок.
Качество голоса также должно оставаться четким во время длинных звонков. Обнаружение поворотов должно справляться с реальными акцентами, различными скоростями речи, прерываниями и повседневными фразами вместо чистого эталонного аудио.
Некоторые провайдеры взимают больше за многоязычные или более мощные модели речи. Но высокая стоимость часто возникает из-за того, что происходит дальше. Если более дешевый распознаватель вызывает больше повторений и поворотов классификации, разговор в конечном итоге стоит дороже.
И это изменило мой фокус: сначала улучшить разговор, затем компонент.
Человеческая передача и оценка тоже имеют значение
Некоторые разговоры должны перейти к человеку. Это может быть правильным результатом, но человеческое вмешательство все равно должно быть включено в модель затрат. Если рабочий процесс часто требует нескольких минут ручного последующего взаимодействия, экономия полцента на цене TTS может едва повлиять на бизнес-кейс.
Производственные системы также нуждаются в наблюдаемости и оценке. Наблюдаемость сообщает вам, когда задержка возрастает, инструмент выходит из строя или передача перестает работать. Оценка говорит вам, достиг ли разговор запланированного результата. Оба требуют инфраструктуры и инженерных усилий, хотя ни один из них не появляется в заглавной ставке за минуту.
Построить против купить — это вопрос объема
Управляемые платформы взимают плату за работу, которую самостроенный стек должен в противном случае поглотить: оркестрация, обработка медиа, масштабирование, интеграции и восстановление после сбоев. Самостоятельная сборка может снизить переменные затраты на API, но добавляет фиксированные инженерные и операционные расходы.
Полезное сравнение:
Премия платформы за минуту x ожидаемый объем
против:
Инженерные и операционные затраты на владение стеком
При умеренном объеме оплата более высокой переменной ставки все равно может быть дешевле в целом. При очень больших объемах экономия нескольких центов на миллионах минут может оправдать владение большей инфраструктурой. Точка пересечения зависит от затрат команды, требований к надежности, формы трафика и цен на платформу.
Экономика единицы голосового ИИ определяет, что масштабируется
Качество модели устанавливает минимальную планку. После этого экономика определяет, работает ли случай использования.
30-минутное интервью, сессия приема или рабочий процесс планирования могут оправдать более высокие затраты, если успешное завершение создает достаточную ценность или заменяет значительные человеческие усилия. Двухминутное взаимодействие все еще может
Другие статьи
Экономика голосового агента: сколько на самом деле стоит минута разговора
Заголовочная цена голосового агента за минуту скрывает пять уровней затрат, накладные расходы на неудачи и рост контекста, которые определяют, действительно ли случай использования масштабируется.
