대화 생성
대화 생성
텍스트와 음성 ID 쌍 목록을 음성(대화)으로 변환하고 오디오를 반환합니다.
헤더
쿼리 매개변수
enable_logging을 false로 설정하면 요청에 제로 보존 모드가 사용됩니다. 이 경우 요청 연결을 포함한 기록 기능을 이 요청에서 사용할 수 없습니다. 제로 보존 모드는 엔터프라이즈 고객만 사용할 수 있습니다.
요청
각 항목에 텍스트와 음성으로 변환할 음성 ID가 포함된 대화 입력 목록입니다. 고유 음성 ID는 최대 10개입니다. 안정적인 생성을 위해 모든 inputs[].text 값의 총 글자 수를 요청당 2,000자 이하로 유지하세요. 더 긴 요청은 스트리밍 응답에서 조기에 종료되거나 유효성 검사 오류를 반환할 수 있습니다.
사용할 모델의 식별자입니다. GET /v1/models를 사용하여 조회할 수 있습니다. 모델은 텍스트 음성 변환을 지원해야 하며, can_do_text_to_speech 속성으로 확인할 수 있습니다.
모델 및 텍스트 정규화에 언어를 적용하는 데 사용되는 언어 코드(ISO 639-1)입니다. 모델이 제공된 언어 코드를 지원하지 않으면 무시됩니다. 이 매개변수는 multilingual_v2 모델에서 지원되지 않습니다.
대화 생성 제어 설정입니다.
이 생성 결과 바로 앞에 오는 텍스트로, 운율 연속성을 위해 모델을 조건화하는 데 사용됩니다. 최대 100자를 전송할 수 있습니다. 모든 모델에서 지원되지는 않습니다.
이 생성 결과 바로 뒤에 오는 텍스트로, 운율 연속성을 위해 모델을 조건화하는 데 사용됩니다. 최대 100자를 전송할 수 있습니다. 모든 모델에서 지원되지는 않습니다.
텍스트에 적용할 발음 사전 로케이터(id, version_id) 목록입니다. 지정된 순서대로 적용됩니다. 요청당 최대 3개의 로케이터를 사용할 수 있습니다.
지정하면 시스템은 결정론적으로 샘플링하기 위해 최선을 다하므로, 동일한 시드와 매개변수로 반복 요청하면 동일한 결과가 반환됩니다. 결정론적 결과는 보장되지 않습니다. 0에서 4294967295 사이의 정수여야 합니다.
이 매개변수는 ‘auto’, ‘on’, ‘off’의 세 가지 모드로 텍스트 정규화를 제어합니다. ‘auto’로 설정하면 시스템이 텍스트 정규화 적용 여부를 자동으로 결정합니다(예: 숫자를 풀어서 읽기). ‘on’에서는 텍스트 정규화가 항상 적용되며, ‘off’에서는 건너뜁니다.
프로페셔널 음성의 IVC 버전을 사용할지 여부입니다. 표현력이 향상되고 지연 시간이 줄어들 수 있습니다.
A list of request_ids of dialogue generations that came before this one. Used to condition the model for continuity when splitting a large task into multiple requests. A maximum of 3 request_ids can be sent. The last request_id is the audio which is closest to the current request. Not supported by every model.
A list of request_ids of dialogue generations that come after this one. Useful for maintaining continuity when regenerating a clip in the middle of a sequence. A maximum of 3 request_ids can be sent. The first request_id is the audio which is closest to the current request. Not supported by every model.
응답
생성된 오디오 파일