Presentamos Cambiador de Voz
- Publicado
EscucharEscucha este artículo
Voice Changer se llamaba originalmente speech-to-speech. En el contexto de agentes de voz con IA, «speech-to-speech» también se refiere a arquitecturas fusionadas, en las que un único modelo gestiona directamente la entrada y la salida de audio. ElevenAgents utiliza una arquitectura en cascada avanzada en su plataforma. Más información: Modelos en cascada frente a modelos fusionados.
Cambiador de Voz
Hemos añadido Cambiador de Voz a Síntesis de voz. Cambiador de Voz es una herramienta de conversión de voz que toma una grabación de una voz y hace que suene como si la hubiera dicho otra, conservando la interpretación original. Es decir, las emociones, el ritmo, la cadencia y la pronunciación que aportas a la grabación se trasladan a la voz de salida.
Esto te da un nivel de control que los prompts de Texto a Voz por sí solos no siempre pueden ofrecer. Hay dos formas principales de usarlo.
Extrae más emoción de una voz. No todas las voces responden igual de bien a las indicaciones emocionales mediante prompts de Texto a Voz. Cambiador de Voz te permite grabar o subir locuciones muy expresivas y reproducir ese rango emocional con otra voz. Si necesitas que un narrador profesional suene más cercano o que un personaje de un libro infantil parezca más juguetón, puedes interpretar tú mismo la entonación y hacer que Cambiador de Voz la transfiera a la voz de destino.
Ajusta con precisión la entonación. Nuestros modelos de Texto a Voz suelen gestionar bien la entonación desde el principio. Pero cuando necesitas controlar con precisión cómo se interpreta una frase concreta —dónde recae el énfasis, cómo encaja una pausa o cuál es la cadencia—, Cambiador de Voz te permite demostrarlo con tu propia voz y aplicar después esa entonación a la voz que elijas. Será aún más útil cuando integremos Cambiador de Voz directamente en Studio, pero el objetivo es el mismo: darte un control preciso sobre el resultado.
Aquí tienes una guía de uno de los miembros de nuestra comunidad:
Investigación
Para convertir el habla de origen en habla de destino, debemos expresar el contenido del habla de origen con las características del habla de destino. Una analogía útil es el intercambio de rostros: aplicaciones que toman dos caras y las combinan, representando los rasgos de una persona dentro de la estructura mapeada de otra.
Para hacerlo, tomamos la imagen de una cara y mapeamos sus atributos. Los marcadores del ejemplo siguiente hacen precisamente eso: delimitan el espacio dentro del cual se representaría la otra cara.
La clave de la conversión de voz consiste en representar el contenido del habla de origen utilizando los fonemas del habla de destino. Pero hay una contrapartida, como en el ejemplo del intercambio de rostros: cuantos más marcadores uses para mapear los atributos de una cara, más restricciones impones a la cara que mapeas dentro de ellos. Menos marcadores implica menos restricciones.
Lo mismo ocurre con la conversión de voz. Cuanta más prioridad demos al habla de destino, mayor será el riesgo de perder la sincronía con el habla de origen. Pero, si no le damos suficiente prioridad, corremos el riesgo de perder gran parte de lo que caracteriza a esa voz. Por ejemplo, si reprodujéramos la grabación de alguien gritando enfadado con una voz susurrante, tendríamos un problema. Dar demasiada prioridad a las emociones del habla de origen hace que perdamos la impresión de que habla una voz susurrante. Si enfatizamos demasiado el patrón del habla susurrante, perdemos la carga emocional del habla de origen.
Producto y novedades recientes
Cambios en las voces prediseñadas
Vamos a realizar cambios en las voces predeterminadas disponibles en Síntesis de voz. Retiraremos algunas voces y las sustituiremos por otras nuevas; tenemos previstas más de 20 incorporaciones durante las próximas semanas.
También empezaremos a mostrar en la interfaz cuánto tiempo se espera que siga disponible cada voz. A lo largo de diciembre, renovaremos nuestras funciones de compartir voces y de compensación por uso para mejorar la variedad de voces. Próximamente, más detalles.
Eleven Turbo v2 y formato uLaw de 8 kHz
Turbo v2 es el resultado de meses de investigación de nuestro equipo. Está diseñado para interacciones en tiempo real, pero funciona para cualquier caso de uso. También admite el formato estándar (m)uLaw de 8 kHz para sistemas IVR.
Normalización y metadatos con Studio
Studio ahora admite las directrices estándar del sector para el envío de audiolibros, incluidos el ajuste de ganancia y la compresión dinámica. También puedes insertar metadatos (ISBN, autor y título) directamente en tu proyecto de Studio.
Diccionario de pronunciación
Esta ha sido una de las funciones más solicitadas. El mes pasado, añadimos compatibilidad con etiquetas SSML para especificar la pronunciación mediante los diccionarios IPA y CMU en nuestros modelos en inglés. Ahora hemos incorporado la compatibilidad con diccionarios de pronunciación en la interfaz de Studio, lo que te permite subir un archivo que especifique la pronunciación mediante IPA, CMU o sustituciones de palabras (alias). Los archivos de diccionario utilizan el formato abierto estándar del sector .PLS de archivo de léxico.
Actualmente, Turbo v2 English es compatible con IPA y CMU. Las sustituciones de palabras son compatibles con todos los modelos e idiomas. La documentación completa está disponible aquí.
Si tienes algún comentario, no dudes en escribirnos por Discord.
Prueba Cambiador de Voz
Dilo como quieras y escúchalo con una voz completamente diferente, con control total sobre la interpretación. Captura susurros, risas, acentos y matices emocionales sutiles.
Di lo que quieras y escúchalo en una voz completamente diferente, con control total sobre la interpretación. Captura susurros, risas, acentos y matices emocionales.




