음성 디자인
음성 디자인
Design a voice via a prompt. This method returns a list of voice previews. Each preview has a generated_voice_id and a sample of the voice as base64 encoded mp3 audio. To create a voice use the generated_voice_id of the preferred preview with the /v1/text-to-voice endpoint.
헤더
쿼리 매개변수
요청
생성된 음성에 사용할 설명입니다.
음성 생성에 사용할 모델입니다. 가능한 값: eleven_multilingual_ttv_v2, eleven_ttv_v3.
생성할 텍스트입니다. 텍스트 길이는 100자에서 1000자 사이여야 합니다.
음성 설명에 적합한 텍스트를 자동으로 생성할지 여부입니다.
생성된 음성의 볼륨 레벨을 제어합니다. -1은 가장 작고, 1은 가장 크며, 0은 약 -24 LUFS에 해당합니다.
음성 생성을 제어하는 난수입니다. 동일한 입력에 동일한 시드를 사용하면 동일한 음성이 생성됩니다.
AI가 프롬프트를 얼마나 엄격하게 따를지 제어합니다. 값이 낮을수록 AI가 창의성을 발휘할 여지가 커지고, 값이 높을수록 프롬프트를 더 엄격하게 따릅니다. 값이 높으면 음성이 부자연스럽거나 로봇처럼 들릴 수 있습니다. Guidance Scale이 낮을 때는 더 길고 자세한 프롬프트를 사용하는 것이 좋습니다.
Determines whether the Text to Voice previews should be included in the response. If true, only the generated IDs will be returned which can then be streamed via the /v1/text-to-voice/:generated_voice_id/stream endpoint.
AI를 사용해 음성 설명에 더 많은 세부 정보를 추가하고 음성 생성 품질을 개선할지 여부입니다. 활성화하면 시스템이 간단한 프롬프트를 더 상세한 음성 설명으로 자동 확장합니다. 기본값은 False입니다.
리믹싱 세션 ID입니다.
이러한 생성을 첨부할 리믹싱 세션 반복의 ID입니다. 제공하지 않으면 새 반복이 생성됩니다.
품질이 높을수록 음성 출력은 향상되지만 다양성은 줄어듭니다.
음성 생성에 사용할 참조 오디오입니다. 오디오는 base64로 인코딩해야 합니다. eleven_ttv_v3 모델을 사용할 때만 지원됩니다.
음성 샘플 생성 시 프롬프트와 참조 오디오 간의 균형을 제어합니다. 0은 프롬프트 영향이 거의 없음을, 1은 참조 오디오 영향이 거의 없음을 의미합니다. eleven_ttv_v3 모델 사용 시에만 지원됩니다.
응답
성공 응답
생성된 음성의 미리보기입니다.
음성을 미리 듣는 데 사용되는 텍스트입니다.