음성 디자인

Design a voice via a prompt. This method returns a list of voice previews. Each preview has a generated_voice_id and a sample of the voice as base64 encoded mp3 audio. To create a voice use the generated_voice_id of the preferred preview with the /v1/text-to-voice endpoint.

헤더

xi-api-keystring선택 사항

쿼리 매개변수

output_formatenum선택 사항
생성된 오디오의 출력 형식입니다. codec_sample_rate_bitrate 형식으로 지정합니다. 예를 들어 샘플링 레이트가 22.05kHz이고 32kbps인 mp3는 mp3_22050_32로 표현됩니다. 비트레이트가 192kbps인 MP3를 사용하려면 크리에이터 이상의 요금제에 가입해야 합니다. 샘플링 레이트가 44.1kHz인 PCM 형식을 사용하려면 프로 이상의 요금제에 가입해야 합니다. μ-law 형식(mu-law로 표기되기도 하며 흔히 u-law로 근사 표기됨)은 Twilio 오디오 입력에 일반적으로 사용됩니다.

요청

This endpoint expects an object.
voice_descriptionstring필수20-1000 characters

생성된 음성에 사용할 설명입니다.

model_idenum선택 사항기본값 eleven_multilingual_ttv_v2

음성 생성에 사용할 모델입니다. 가능한 값: eleven_multilingual_ttv_v2, eleven_ttv_v3.

허용된 값:
textstring or null선택 사항100-1000 characters

생성할 텍스트입니다. 텍스트 길이는 100자에서 1000자 사이여야 합니다.

auto_generate_textboolean선택 사항기본값 false

음성 설명에 적합한 텍스트를 자동으로 생성할지 여부입니다.

loudnessdouble선택 사항-1-1기본값 0.5

생성된 음성의 볼륨 레벨을 제어합니다. -1은 가장 작고, 1은 가장 크며, 0은 약 -24 LUFS에 해당합니다.

seedinteger or null선택 사항0-2147483647

음성 생성을 제어하는 난수입니다. 동일한 입력에 동일한 시드를 사용하면 동일한 음성이 생성됩니다.

guidance_scaledouble선택 사항0-100기본값 5

AI가 프롬프트를 얼마나 엄격하게 따를지 제어합니다. 값이 낮을수록 AI가 창의성을 발휘할 여지가 커지고, 값이 높을수록 프롬프트를 더 엄격하게 따릅니다. 값이 높으면 음성이 부자연스럽거나 로봇처럼 들릴 수 있습니다. Guidance Scale이 낮을 때는 더 길고 자세한 프롬프트를 사용하는 것이 좋습니다.

stream_previewsboolean선택 사항기본값 false

Determines whether the Text to Voice previews should be included in the response. If true, only the generated IDs will be returned which can then be streamed via the /v1/text-to-voice/:generated_voice_id/stream endpoint.

should_enhanceboolean선택 사항기본값 false

AI를 사용해 음성 설명에 더 많은 세부 정보를 추가하고 음성 생성 품질을 개선할지 여부입니다. 활성화하면 시스템이 간단한 프롬프트를 더 상세한 음성 설명으로 자동 확장합니다. 기본값은 False입니다.

remixing_session_idstring or null선택 사항

리믹싱 세션 ID입니다.

remixing_session_iteration_idstring or null선택 사항

이러한 생성을 첨부할 리믹싱 세션 반복의 ID입니다. 제공하지 않으면 새 반복이 생성됩니다.

qualitydouble or null선택 사항-1-1

품질이 높을수록 음성 출력은 향상되지만 다양성은 줄어듭니다.

reference_audio_base64string or null선택 사항

음성 생성에 사용할 참조 오디오입니다. 오디오는 base64로 인코딩해야 합니다. eleven_ttv_v3 모델을 사용할 때만 지원됩니다.

prompt_strengthdouble or null선택 사항0-1

음성 샘플 생성 시 프롬프트와 참조 오디오 간의 균형을 제어합니다. 0은 프롬프트 영향이 거의 없음을, 1은 참조 오디오 영향이 거의 없음을 의미합니다. eleven_ttv_v3 모델 사용 시에만 지원됩니다.

응답

성공 응답

previewslist of objects

생성된 음성의 미리보기입니다.

textstring

음성을 미리 듣는 데 사용되는 텍스트입니다.

오류

409
Conflict Error
422
Unprocessable Entity Error