Presentamos Cambiador de Voz
- Publicado
EscucharEscucha este artículo
Voice Changer se llamaba originalmente speech-to-speech. En el contexto de agentes de voz con IA, «speech-to-speech» también se refiere a arquitecturas fusionadas en las que un único modelo gestiona directamente la entrada y la salida de audio. ElevenAgents utiliza una arquitectura en cascada avanzada para su plataforma. Más información: Modelos en cascada frente a fusionados.
Cambiador de Voz
Hemos añadido Cambiador de Voz a Síntesis de Voz. Cambiador de Voz es una herramienta de conversión de voz que toma una grabación de una voz y hace que suene como si la hubiera dicho otra, conservando la interpretación original. Esto significa que las emociones, el ritmo, la cadencia y la pronunciación que incluyes en la grabación se trasladan a la voz de salida.
Esto te ofrece un nivel de control que los prompts de texto a voz por sí solos no siempre pueden lograr. Hay dos formas principales de usarlo.
Extrae más emoción de una voz. No todas las voces responden igual de bien a las indicaciones emocionales mediante prompts de texto a voz. Cambiador de Voz te permite grabar o subir locuciones muy expresivas y reproducir ese rango emocional en una voz diferente. Si necesitas que un narrador profesional suene más cercano o que un personaje de un libro infantil suene más juguetón, puedes interpretar tú mismo la entonación y hacer que Cambiador de Voz la transfiera a la voz objetivo.
Perfecciona la entonación. Nuestros modelos de texto a voz suelen manejar bien la entonación desde el principio. Pero cuando necesitas un control preciso sobre cómo se expresa una frase concreta —dónde recae el énfasis, cómo encaja una pausa o qué cadencia transmite—, Cambiador de Voz te permite demostrarlo con tu propia voz y aplicar después esa entonación a cualquier voz que elijas. Esto será aún más útil cuando integremos Cambiador de Voz directamente en Studio, pero el objetivo es el mismo: darte un control preciso sobre el resultado.
Aquí tienes una demostración de uno de los miembros de nuestra comunidad:
Investigación
Para convertir la voz de origen en voz objetivo, necesitamos expresar el contenido de la voz de origen con las características de la voz objetivo. Una analogía útil es el intercambio de caras: aplicaciones que toman dos rostros y los combinan, representando los rasgos de una persona dentro de la estructura mapeada de otra.
Para hacerlo, tomamos la imagen de un rostro y mapeamos sus atributos. Los marcadores del ejemplo de abajo hacen precisamente eso: son los límites dentro de los cuales se representaría el otro rostro.
La clave de la conversión de voz es representar el contenido de la voz de origen utilizando los fonemas de la voz objetivo. Pero hay una contrapartida, igual que en el ejemplo del intercambio de caras: cuantos más marcadores uses para mapear los atributos de un rostro, más restricciones impones al rostro que mapeas dentro de ellos. Menos marcadores implican menos restricciones.
Lo mismo ocurre con la conversión de voz. Cuanta más preferencia demos a la voz objetivo, mayor será el riesgo de que pierda sincronía con la voz de origen. Pero, si no le damos suficiente preferencia, corremos el riesgo de perder gran parte de lo que caracteriza a esa voz. Por ejemplo, si representáramos la grabación de alguien gritando enfadado con una voz susurrante, tendríamos un problema. Si damos demasiada preferencia a las emociones de la voz de origen, perdemos la impresión de que habla una voz susurrante. Si ponemos demasiado énfasis en el patrón de habla susurrante, perdemos la carga emocional de la voz de origen.
Producto y novedades recientes
Cambios en las voces prediseñadas
Estamos haciendo cambios en las voces predeterminadas disponibles en Síntesis de Voz. Retiraremos algunas voces y las sustituiremos por otras nuevas, con más de 20 incorporaciones previstas para las próximas semanas.
También empezaremos a mostrar en la interfaz información sobre cuánto tiempo se espera que esté disponible cada voz. Durante diciembre, renovaremos nuestras funciones de compartir voces y de compensación por uso para mejorar la variedad de voces. Pronto habrá más detalles.
Eleven Turbo v2 y formato uLaw de 8 kHz
Turbo v2 es el resultado de meses de investigación de nuestro equipo. Está diseñado para interacciones en tiempo real, pero funciona para cualquier caso de uso. También admite el formato estándar (m)uLaw de 8 kHz para sistemas IVR.
Normalización y metadatos con Studio
Studio ahora admite las directrices estándar del sector para la publicación de audiolibros, incluidos el ajuste de ganancia y la compresión dinámica. También puedes integrar metadatos (ISBN, autor y título) directamente en tu proyecto de Studio.
Diccionario de pronunciación
Esta ha sido una de nuestras funciones más solicitadas. El mes pasado añadimos compatibilidad con etiquetas SSML para especificar la pronunciación mediante los diccionarios IPA y CMU con nuestros modelos en inglés. Ahora hemos lanzado la compatibilidad con diccionarios de pronunciación en la interfaz de Studio, lo que te permite subir un archivo que especifique la pronunciación mediante IPA, CMU o sustituciones de palabras (alias). Los archivos de diccionario utilizan el estándar abierto del sector .PLS de formato de archivo de léxico.
IPA y CMU son compatibles actualmente con Turbo v2 English. Las sustituciones de palabras son compatibles con todos los modelos e idiomas. La documentación completa está disponible aquí.
Si tienes algún comentario, no dudes en escribirnos por Discord.
Prueba Cambiador de Voz
Dilo como quieras y escúchalo con una voz completamente diferente, con control total sobre la interpretación. Captura susurros, risas, acentos y matices emocionales sutiles.
Di lo que quieras y escúchalo en una voz completamente diferente, con control total sobre la interpretación. Captura susurros, risas, acentos y matices emocionales.




