음성 생성

선택한 음성으로 텍스트를 음성으로 변환하고 오디오를 반환합니다.

경로 매개변수

voice_idstring필수

사용할 음성의 ID입니다. 음성 가져오기 엔드포인트를 사용하여 사용 가능한 모든 음성을 나열할 수 있습니다.

헤더

xi-api-keystring선택 사항

쿼리 매개변수

enable_loggingboolean선택 사항기본값 true

enable_logging을 false로 설정하면 요청에 제로 보존 모드가 사용됩니다. 이 경우 요청 연결을 포함한 기록 기능을 이 요청에서 사용할 수 없습니다. 제로 보존 모드는 엔터프라이즈 고객만 사용할 수 있습니다.

optimize_streaming_latencyinteger or null선택 사항Deprecated
품질을 일부 희생하여 지연 시간 최적화를 켤 수 있습니다. 달성 가능한 최종 지연 시간은 모델마다 다릅니다. 가능한 값은 다음과 같습니다. 0 - 기본 모드(지연 시간 최적화 없음) 1 - 일반 지연 시간 최적화(옵션 3으로 가능한 지연 시간 개선의 약 50%) 2 - 강력한 지연 시간 최적화(옵션 3으로 가능한 지연 시간 개선의 약 75%) 3 - 최대 지연 시간 최적화 4 - 최대 지연 시간 최적화와 함께 텍스트 정규화기도 꺼서 지연 시간을 더욱 절감합니다(최상의 지연 시간이지만 숫자나 날짜 등을 잘못 발음할 수 있음). 기본값은 None입니다.
output_formatenum선택 사항기본값 mp3_44100_128
생성된 오디오의 출력 형식입니다. codec_sample_rate_bitrate 형식으로 지정합니다. 예를 들어 샘플링 레이트가 22.05kHz이고 32kbps인 mp3는 mp3_22050_32로 표현됩니다. 비트레이트가 192kbps인 MP3를 사용하려면 크리에이터 이상의 요금제에 가입해야 합니다. 샘플링 레이트가 44.1kHz인 PCM 및 WAV 형식을 사용하려면 프로 이상의 요금제에 가입해야 합니다. μ-law 형식(mu-law로 표기되기도 하며 흔히 u-law로 근사 표기됨)은 Twilio 오디오 입력에 일반적으로 사용됩니다.

요청

This endpoint expects an object.
textstring필수

음성으로 변환할 텍스트입니다.

model_idstring선택 사항기본값 eleven_multilingual_v2

사용할 모델의 식별자입니다. GET /v1/models를 사용하여 조회할 수 있습니다. 모델은 텍스트 음성 변환을 지원해야 하며, can_do_text_to_speech 속성으로 확인할 수 있습니다.

language_codestring or null선택 사항

모델 및 텍스트 정규화에 언어를 적용하는 데 사용되는 언어 코드(ISO 639-1)입니다. 모델이 제공된 언어 코드를 지원하지 않으면 무시됩니다. 이 매개변수는 multilingual_v2 모델에서 지원되지 않습니다.

voice_settingsobject or null선택 사항

지정된 음성에 저장된 설정을 재정의하는 음성 설정입니다. 지정된 요청에만 적용됩니다.

pronunciation_dictionary_locatorslist of objects or null선택 사항

텍스트에 적용할 발음 사전 로케이터(id, version_id) 목록입니다. 지정된 순서대로 적용됩니다. 요청당 최대 3개의 로케이터를 사용할 수 있습니다.

seedinteger or null선택 사항

지정하면 시스템은 결정론적으로 샘플링하기 위해 최선을 다하므로, 동일한 시드와 매개변수로 반복 요청하면 동일한 결과가 반환됩니다. 결정론적 결과는 보장되지 않습니다. 0에서 4294967295 사이의 정수여야 합니다.

previous_textstring or null선택 사항

현재 요청 텍스트 앞에 오는 텍스트입니다. 여러 생성 결과를 연결할 때 음성의 연속성을 개선하거나 현재 생성에서 음성의 연속성에 영향을 주는 데 사용할 수 있습니다.

next_textstring or null선택 사항

현재 요청 텍스트 뒤에 오는 텍스트입니다. 여러 생성 결과를 연결할 때 음성의 연속성을 개선하거나 현재 생성에서 음성의 연속성에 영향을 주는 데 사용할 수 있습니다.

previous_request_idslist of strings or null선택 사항

A list of request_id of the samples that were generated before this generation. Can be used to improve the speech’s continuity when splitting up a large task into multiple requests. The results will be best when the same model is used across the generations. In case both previous_text and previous_request_ids is send, previous_text will be ignored. A maximum of 3 request_ids can be send.

next_request_idslist of strings or null선택 사항

A list of request_id of the samples that come after this generation. next_request_ids is especially useful for maintaining the speech’s continuity when regenerating a sample that has had some audio quality issues. For example, if you have generated 3 speech clips, and you want to improve clip 2, passing the request id of clip 3 as a next_request_id (and that of clip 1 as a previous_request_id) will help maintain natural flow in the combined speech. The results will be best when the same model is used across the generations. In case both next_text and next_request_ids is send, next_text will be ignored. A maximum of 3 request_ids can be send.

use_pvc_as_ivcboolean선택 사항기본값 false

프로페셔널 음성의 IVC 버전을 사용할지 여부입니다. 표현력이 향상되고 지연 시간이 줄어들 수 있습니다.

apply_text_normalizationenum선택 사항기본값 auto

이 매개변수는 ‘auto’, ‘on’, ‘off’의 세 가지 모드로 텍스트 정규화를 제어합니다. ‘auto’로 설정하면 시스템이 텍스트 정규화 적용 여부를 자동으로 결정합니다(예: 숫자를 풀어서 읽기). ‘on’에서는 텍스트 정규화가 항상 적용되며, ‘off’에서는 건너뜁니다.

허용된 값:
apply_language_text_normalizationboolean선택 사항기본값 false

이 매개변수는 언어 텍스트 정규화를 제어합니다. 일부 지원 언어에서 텍스트를 올바르게 발음하는 데 도움이 됩니다. 경고: 이 매개변수는 요청 지연 시간을 크게 늘릴 수 있습니다. 현재 일본어만 지원합니다.

응답

생성된 오디오 파일

오류

422
Unprocessable Entity Error