Los modelos de voz de IA se están volviendo más asequibles.
La conversión de texto a voz ha salido de los menús de accesibilidad en los últimos años y ahora se encuentra en el centro de atención como un componente central de la pila de software moderna. La categoría de aplicaciones centradas en la voz está creciendo cada día, y esos activos digitales especializados contribuyen al movimiento de conversión de texto a voz. La tecnología también impulsa audiolibros, asistentes de reuniones y agentes de servicio al cliente. Con el aumento de la demanda, los desarrolladores de modelos han sentido más presión para crear voces con un sonido convincentemente humano, sin picos de latencia ni precios por carácter que hacen que las implementaciones de producción sean insostenibles.
Eliminar obstáculos ayuda a los desarrolladores y a las empresas a ver el valor de incorporar voz a sus productos, por lo que no necesariamente tienen que elegir entre calidad, velocidad y costo. En la discusión más amplia sobre el mercado en evolución de la conversión de texto a voz, este tipo de producto puede crear oportunidades para mejorar el costo, la calidad y la latencia, un pasaje hacia aplicaciones comerciales y de consumo adicionales. Simba 3.2 de SpeechifyAI se encuentra entre los modelos que compiten en estas medidas, ocupando actualmente el primer lugar en la tabla de clasificación de conversión de texto a voz de Artificial Analysis.
Compromisos Comunes en la IA de Voz
Históricamente, han surgido tres problemas para los desarrolladores encargados de evaluar un proveedor de conversión de texto a voz. Existe un compromiso significativo entre los tres modelos prevalentes disponibles en el mundo de la conversión de texto a voz. Los modelos que suenan más naturales son típicamente los más caros, con precios que hacen que productos de alto volumen, como contenido de formato largo, agentes en tiempo real o aplicaciones globales para consumidores, sean financieramente difíciles. Las opciones más rápidas y económicas a veces comprometen la calidad, por lo que las voces tienen una sensación más robótica y tienden a quedarse cortas en emoción y ritmo. Los modelos ajustados para baja latencia, la variedad centrada en la transmisión, también tienen sus fallas: a menudo se quedan atrás en los estándares de fidelidad esperados por estudios y empresas.
El mercado resultante crea un entorno donde los equipos utilizan múltiples proveedores para diferentes usos, o aceptan que existe un límite para lo que el producto puede hacer con la voz. Estas limitaciones se han convertido en una restricción frustrante, ya que los agentes de voz se mueven hacia la producción a gran escala.
Un Cambio Hacia el Rendimiento Todo en Uno
Las mejoras en la arquitectura del modelo y la eficiencia de entrenamiento están ayudando a algunos proveedores a reducir estos compromisos. Como empresa dedicada a la investigación de IA de voz, SpeechifyAI ha trabajado durante los últimos años para eliminar los obstáculos para construir con voz a través de Simba 3.2. El modelo alcanzó el primer lugar en la tabla de clasificación independiente de conversión de texto a voz de Artificial Analysis, que compara modelos comercialmente disponibles utilizando evaluaciones estandarizadas.
El fundador y CEO de Speechify, Cliff Weitzman, enmarcó el lanzamiento en torno a esa combinación. “Simba 3.2 es nuestro mejor modelo hasta ahora, ahora disponible en Speechify.ai,” dijo en un anuncio. “Está diseñado para impulsar agentes de voz a gran escala y perfeccionado a partir de millones de pruebas A/B que realizamos en nuestra plataforma de consumidores. En las API de TTS, tres cosas importan: costo, calidad y latencia. Simba 3.2 ha logrado SOTA en esta trifecta, liderando la tabla de clasificación de TTS de Artificial Analysis a $6/1M caracteres en nuestro plan escalado.” El modelo se está utilizando de manera efectiva. Ahora también impulsa SpeechifyAI Agents, la nueva plataforma de agentes de voz de la empresa para negocios, disponible con sus herramientas de desarrollador en speechify.ai.
Empoderamiento a Través de la Voz
El ideal para los creativos es que cualquier persona que esté construyendo la próxima generación de software pueda acceder a modelos de voz expresivos y confiables. Estas herramientas no deberían estar limitadas a equipos con los presupuestos de infraestructura más grandes. Aunque el acceso está en expansión, el mercado aún se encuentra en una etapa temprana. Las características de voz se están convirtiendo en un componente más común de la comunicación digital junto con el texto y las imágenes. Modelos como Simba 3.2 continúan igualando el campo de juego, de modo que los compromisos ya no definan la categoría. Esto ha abierto un mundo de posibilidades para la generación más joven de desarrolladores, creadores y empresas para que puedan construir productos que creen un mundo digital muy diferente.
Los precios y la disponibilidad son precisos en el momento de la publicación y están sujetos a cambios sin previo aviso. Por favor, consulte el sitio web del minorista para obtener la información de precios más actualizada.
Digital Trends se asocia con colaboradores externos. Todo el contenido de los colaboradores es revisado por el personal editorial de Digital Trends.
Otros artículos
Los modelos de voz de IA se están volviendo más asequibles.
La conversión de texto a voz ha salido de los menús de accesibilidad en los últimos años y ahora se encuentra en el centro de atención como un componente central de la pila de software moderna. La categoría de aplicaciones centradas en la voz está creciendo cada día, y esos activos digitales especializados contribuyen al movimiento de conversión de texto a voz. La tecnología también impulsa audiolibros, asistentes de reuniones y servicio al cliente […]
