대화 생성

텍스트와 음성 ID 쌍 목록을 음성(대화)으로 변환하고 오디오를 반환합니다.

헤더

xi-api-keystring선택 사항

쿼리 매개변수

output_formatenum선택 사항기본값 mp3_44100_128
생성된 오디오의 출력 형식입니다. codec_sample_rate_bitrate 형식으로 지정합니다. 예를 들어 샘플링 레이트가 22.05kHz이고 32kbps인 mp3는 mp3_22050_32로 표현됩니다. 비트레이트가 192kbps인 MP3를 사용하려면 크리에이터 이상의 요금제에 가입해야 합니다. 샘플링 레이트가 44.1kHz인 PCM 및 WAV 형식을 사용하려면 프로 이상의 요금제에 가입해야 합니다. μ-law 형식(mu-law로 표기되기도 하며 흔히 u-law로 근사 표기됨)은 Twilio 오디오 입력에 일반적으로 사용됩니다.
enable_loggingboolean선택 사항기본값 true

enable_logging을 false로 설정하면 요청에 제로 보존 모드가 사용됩니다. 이 경우 요청 연결을 포함한 기록 기능을 이 요청에서 사용할 수 없습니다. 제로 보존 모드는 엔터프라이즈 고객만 사용할 수 있습니다.

요청

This endpoint expects an object.
inputslist of objects필수

각 항목에 텍스트와 음성으로 변환할 음성 ID가 포함된 대화 입력 목록입니다. 고유 음성 ID는 최대 10개입니다. 안정적인 생성을 위해 모든 inputs[].text 값의 총 글자 수를 요청당 2,000자 이하로 유지하세요. 더 긴 요청은 스트리밍 응답에서 조기에 종료되거나 유효성 검사 오류를 반환할 수 있습니다.

model_idstring선택 사항기본값 eleven_v3

사용할 모델의 식별자입니다. GET /v1/models를 사용하여 조회할 수 있습니다. 모델은 텍스트 음성 변환을 지원해야 하며, can_do_text_to_speech 속성으로 확인할 수 있습니다.

language_codestring or null선택 사항

모델 및 텍스트 정규화에 언어를 적용하는 데 사용되는 언어 코드(ISO 639-1)입니다. 모델이 제공된 언어 코드를 지원하지 않으면 무시됩니다. 이 매개변수는 multilingual_v2 모델에서 지원되지 않습니다.

settingsobject or null선택 사항

대화 생성 제어 설정입니다.

previous_textstring or null선택 사항<=100 characters

이 생성 결과 바로 앞에 오는 텍스트로, 운율 연속성을 위해 모델을 조건화하는 데 사용됩니다. 최대 100자를 전송할 수 있습니다. 모든 모델에서 지원되지는 않습니다.

future_textstring or null선택 사항<=100 characters

이 생성 결과 바로 뒤에 오는 텍스트로, 운율 연속성을 위해 모델을 조건화하는 데 사용됩니다. 최대 100자를 전송할 수 있습니다. 모든 모델에서 지원되지는 않습니다.

pronunciation_dictionary_locatorslist of objects or null선택 사항

텍스트에 적용할 발음 사전 로케이터(id, version_id) 목록입니다. 지정된 순서대로 적용됩니다. 요청당 최대 3개의 로케이터를 사용할 수 있습니다.

seedinteger or null선택 사항

지정하면 시스템은 결정론적으로 샘플링하기 위해 최선을 다하므로, 동일한 시드와 매개변수로 반복 요청하면 동일한 결과가 반환됩니다. 결정론적 결과는 보장되지 않습니다. 0에서 4294967295 사이의 정수여야 합니다.

apply_text_normalizationenum선택 사항기본값 auto

이 매개변수는 ‘auto’, ‘on’, ‘off’의 세 가지 모드로 텍스트 정규화를 제어합니다. ‘auto’로 설정하면 시스템이 텍스트 정규화 적용 여부를 자동으로 결정합니다(예: 숫자를 풀어서 읽기). ‘on’에서는 텍스트 정규화가 항상 적용되며, ‘off’에서는 건너뜁니다.

허용된 값:
use_pvc_as_ivcboolean선택 사항기본값 false

프로페셔널 음성의 IVC 버전을 사용할지 여부입니다. 표현력이 향상되고 지연 시간이 줄어들 수 있습니다.

previous_request_idslist of strings or null선택 사항

A list of request_ids of dialogue generations that came before this one. Used to condition the model for continuity when splitting a large task into multiple requests. A maximum of 3 request_ids can be sent. The last request_id is the audio which is closest to the current request. Not supported by every model.

next_request_idslist of strings or null선택 사항

A list of request_ids of dialogue generations that come after this one. Useful for maintaining continuity when regenerating a clip in the middle of a sequence. A maximum of 3 request_ids can be sent. The first request_id is the audio which is closest to the current request. Not supported by every model.

응답

생성된 오디오 파일

오류

422
Unprocessable Entity Error