음성 생성
음성 생성
선택한 음성으로 텍스트를 음성으로 변환하고 오디오를 반환합니다.
경로 매개변수
사용할 음성의 ID입니다. 음성 가져오기 엔드포인트를 사용하여 사용 가능한 모든 음성을 나열할 수 있습니다.
헤더
쿼리 매개변수
enable_logging을 false로 설정하면 요청에 제로 보존 모드가 사용됩니다. 이 경우 요청 연결을 포함한 기록 기능을 이 요청에서 사용할 수 없습니다. 제로 보존 모드는 엔터프라이즈 고객만 사용할 수 있습니다.
요청
음성으로 변환할 텍스트입니다.
사용할 모델의 식별자입니다. GET /v1/models를 사용하여 조회할 수 있습니다. 모델은 텍스트 음성 변환을 지원해야 하며, can_do_text_to_speech 속성으로 확인할 수 있습니다.
모델 및 텍스트 정규화에 언어를 적용하는 데 사용되는 언어 코드(ISO 639-1)입니다. 모델이 제공된 언어 코드를 지원하지 않으면 무시됩니다. 이 매개변수는 multilingual_v2 모델에서 지원되지 않습니다.
지정된 음성에 저장된 설정을 재정의하는 음성 설정입니다. 지정된 요청에만 적용됩니다.
텍스트에 적용할 발음 사전 로케이터(id, version_id) 목록입니다. 지정된 순서대로 적용됩니다. 요청당 최대 3개의 로케이터를 사용할 수 있습니다.
지정하면 시스템은 결정론적으로 샘플링하기 위해 최선을 다하므로, 동일한 시드와 매개변수로 반복 요청하면 동일한 결과가 반환됩니다. 결정론적 결과는 보장되지 않습니다. 0에서 4294967295 사이의 정수여야 합니다.
현재 요청 텍스트 앞에 오는 텍스트입니다. 여러 생성 결과를 연결할 때 음성의 연속성을 개선하거나 현재 생성에서 음성의 연속성에 영향을 주는 데 사용할 수 있습니다.
현재 요청 텍스트 뒤에 오는 텍스트입니다. 여러 생성 결과를 연결할 때 음성의 연속성을 개선하거나 현재 생성에서 음성의 연속성에 영향을 주는 데 사용할 수 있습니다.
A list of request_id of the samples that were generated before this generation. Can be used to improve the speech’s continuity when splitting up a large task into multiple requests. The results will be best when the same model is used across the generations. In case both previous_text and previous_request_ids is send, previous_text will be ignored. A maximum of 3 request_ids can be send.
A list of request_id of the samples that come after this generation. next_request_ids is especially useful for maintaining the speech’s continuity when regenerating a sample that has had some audio quality issues. For example, if you have generated 3 speech clips, and you want to improve clip 2, passing the request id of clip 3 as a next_request_id (and that of clip 1 as a previous_request_id) will help maintain natural flow in the combined speech. The results will be best when the same model is used across the generations. In case both next_text and next_request_ids is send, next_text will be ignored. A maximum of 3 request_ids can be send.
프로페셔널 음성의 IVC 버전을 사용할지 여부입니다. 표현력이 향상되고 지연 시간이 줄어들 수 있습니다.
이 매개변수는 ‘auto’, ‘on’, ‘off’의 세 가지 모드로 텍스트 정규화를 제어합니다. ‘auto’로 설정하면 시스템이 텍스트 정규화 적용 여부를 자동으로 결정합니다(예: 숫자를 풀어서 읽기). ‘on’에서는 텍스트 정규화가 항상 적용되며, ‘off’에서는 건너뜁니다.
이 매개변수는 언어 텍스트 정규화를 제어합니다. 일부 지원 언어에서 텍스트를 올바르게 발음하는 데 도움이 됩니다. 경고: 이 매개변수는 요청 지연 시간을 크게 늘릴 수 있습니다. 현재 일본어만 지원합니다.
응답
생성된 오디오 파일