Mezclar una voz.
Remezcla una voz existente mediante un prompt. Este método devuelve una lista de previsualizaciones de voz. Cada previsualización tiene un generated_voice_id y una muestra de la voz como audio MP3 codificado en base64. Para crear una voz, utiliza el generated_voice_id de la previsualización elegida con la ruta de API /v1/text-to-voice.
Parámetros de ruta
Encabezados
Parámetros de consulta
Solicitud
Descripción de los cambios que se deben realizar en la voz.
Texto que se generará; su longitud debe estar entre 100 y 1000 caracteres.
Indica si se debe generar automáticamente un texto adecuado para la descripción de la voz.
Controla el nivel de volumen de la voz generada. -1 es el nivel más bajo, 1 el más alto y 0 corresponde aproximadamente a -24 LUFS.
Número aleatorio que controla la generación de voz. La misma semilla con las mismas entradas produce la misma voz.
Controla hasta qué punto la IA sigue el prompt. Los valores más bajos dan a la IA más libertad creativa, mientras que los más altos la obligan a ceñirse más al prompt. Los valores altos pueden hacer que la voz suene artificial o robótica. Recomendamos utilizar prompts más largos y detallados con una escala de orientación más baja.
Determina si las previsualizaciones de Texto a Voz deben incluirse en la respuesta. Si es true, solo se devolverán los ID generados, que después podrán transmitirse mediante la ruta de API /v1/text-to-voice/:generated_voice_id/stream.
El ID de la sesión de remezcla.
El ID de la iteración de la sesión de remix a la que se deben adjuntar estas generaciones. Si no se proporciona, se creará una nueva iteración.
Controla el equilibrio entre el prompt y el audio de referencia al generar muestras de voz. 0 significa que el prompt apenas influye y 1 que el audio de referencia apenas influye. Solo es compatible con el modelo eleven_ttv_v3.