보이스 체인저 스트리밍

한 음성에서 다른 음성으로 오디오를 스트리밍합니다. 감정, 타이밍, 전달 방식까지 완벽하게 제어할 수 있습니다.

경로 매개변수

voice_idstring필수

사용할 음성의 ID입니다. 음성 가져오기 엔드포인트를 사용하여 사용 가능한 모든 음성을 나열할 수 있습니다.

헤더

xi-api-keystring선택 사항

쿼리 매개변수

enable_loggingboolean선택 사항기본값 true

enable_logging을 false로 설정하면 요청에 제로 보존 모드가 사용됩니다. 이 경우 요청 연결을 포함한 기록 기능을 이 요청에서 사용할 수 없습니다. 제로 보존 모드는 엔터프라이즈 고객만 사용할 수 있습니다.

optimize_streaming_latencyinteger or null선택 사항Deprecated
품질을 일부 희생하여 지연 시간 최적화를 켤 수 있습니다. 달성 가능한 최종 지연 시간은 모델마다 다릅니다. 가능한 값은 다음과 같습니다. 0 - 기본 모드(지연 시간 최적화 없음) 1 - 일반 지연 시간 최적화(옵션 3으로 가능한 지연 시간 개선의 약 50%) 2 - 강력한 지연 시간 최적화(옵션 3으로 가능한 지연 시간 개선의 약 75%) 3 - 최대 지연 시간 최적화 4 - 최대 지연 시간 최적화와 함께 텍스트 정규화기도 꺼서 지연 시간을 더욱 절감합니다(최상의 지연 시간이지만 숫자나 날짜 등을 잘못 발음할 수 있음). 기본값은 None입니다.
output_formatenum선택 사항기본값 mp3_44100_128
생성된 오디오의 출력 형식입니다. codec_sample_rate_bitrate 형식으로 지정합니다. 예를 들어 샘플링 레이트가 22.05kHz이고 32kbps인 mp3는 mp3_22050_32로 표현됩니다. 비트레이트가 192kbps인 MP3를 사용하려면 크리에이터 이상의 요금제에 가입해야 합니다. 샘플링 레이트가 44.1kHz인 PCM 형식을 사용하려면 프로 이상의 요금제에 가입해야 합니다. μ-law 형식(mu-law로 표기되기도 하며 흔히 u-law로 근사 표기됨)은 Twilio 오디오 입력에 일반적으로 사용됩니다.

요청

This endpoint expects a multipart form containing a file.
audiofile필수

생성된 음성을 제어할 콘텐츠와 감정이 담긴 오디오 파일입니다.

model_idstring선택 사항기본값 eleven_english_sts_v2

사용할 모델의 식별자입니다. GET /v1/models를 사용하여 조회할 수 있습니다. 모델은 음성 변환을 지원해야 하며, can_do_voice_conversion 속성으로 확인할 수 있습니다.

voice_settingsstring or null선택 사항

지정된 음성에 저장된 설정을 재정의하는 음성 설정입니다. 지정된 요청에만 적용됩니다. JSON으로 인코딩된 문자열로 전송해야 합니다.

seedinteger or null선택 사항

지정하면 시스템은 결정론적으로 샘플링하기 위해 최선을 다하므로, 동일한 시드와 매개변수로 반복 요청하면 동일한 결과가 반환됩니다. 결정론적 결과는 보장되지 않습니다. 0에서 4294967295 사이의 정수여야 합니다.

remove_background_noiseboolean선택 사항기본값 false

설정하면 오디오 아이솔레이션 모델을 사용하여 오디오 입력에서 배경 소음을 제거합니다. 보이스 체인저에만 적용됩니다.

file_formatenum or null선택 사항기본값 other
입력 오디오 형식입니다. 옵션은 'pcm_s16le_16' 또는 'other'입니다. `pcm_s16le_16`의 경우 입력 오디오는 16kHz 샘플 레이트, 단일 채널(모노), 리틀 엔디언 바이트 순서의 16비트 PCM이어야 합니다. 인코딩된 파형을 전달하는 것보다 지연 시간이 더 낮습니다.
허용된 값:

응답

스트리밍 오디오 데이터

오류

422
Unprocessable Entity Error