프로페셔널 음성 복제(PVC)
- PVC API: 프로페셔널 음성 복제(PVC)를 관리할 수 있는 종합적인 API 엔드포인트 모음을 도입했습니다. 이제 프로그래밍 방식으로 음성을 만들고, 오디오 샘플을 추가/관리/삭제하며, 오디오/파형을 가져오고, 화자 분리를 관리하고, 인증을 처리하고, 학습을 시작할 수 있습니다. 새 엔드포인트의 전체 목록은 아래 API 변경 사항 요약을 확인하거나 PVC API 레퍼런스를 여기에서 읽어보세요.
음성 텍스트 변환
- 향상된 내보내기 옵션: API를 통해 세그먼트 JSON 형식으로 음성 텍스트 변환 결과를 내보낼 때 타임스탬프와 화자 ID를 포함하거나 제외하는 옵션을 추가했습니다.
Agents Platform
- 새 LLM 모델: 새 GPT-4.1 모델
gpt-4.1,gpt-4.1-mini,gpt-4.1-nano를 지원합니다. 자세히 보기 - VAD 점수: VAD 점수를 클라이언트로 전송하는 새 클라이언트 이벤트를 추가했습니다. 레퍼런스는 여기에서 확인하세요.
API
API 변경 사항 보기
새 엔드포인트
- 새 엔드포인트 16개를 추가했습니다.
- PVC 음성 생성 - 새 PVC 음성을 생성합니다.
- PVC 음성 편집 - PVC 음성 메타데이터를 편집합니다.
- PVC 음성에 샘플 추가 - PVC 음성에 오디오 샘플을 추가합니다.
- PVC 음성 샘플 업데이트 - PVC 음성 샘플을 업데이트합니다(노이즈 제거, 화자 선택, 트리밍).
- PVC 음성 샘플 삭제 - PVC 음성에서 샘플을 삭제합니다.
- 음성 샘플 오디오 가져오기 - PVC 음성 샘플의 오디오를 가져옵니다.
- 음성 샘플 시각적 파형 가져오기 - PVC 음성 샘플의 시각적 파형을 가져옵니다.
- 화자 분리 상태 가져오기 - 샘플의 화자 분리 상태를 가져옵니다.
- 화자 분리 시작 - 샘플의 화자 분리를 시작합니다.
- 분리된 화자 오디오 가져오기 - 특정 분리 화자의 오디오를 가져옵니다.
- PVC 음성 Captcha 가져오기 - PVC 음성 인증용 captcha를 가져옵니다.
- PVC 음성 Captcha 인증 - PVC 음성의 captcha 인증을 제출합니다.
- PVC 학습 실행 - PVC 음성의 학습 프로세스를 시작합니다.
- 수동 인증 요청 - PVC 음성의 수동 인증을 요청합니다.
업데이트된 엔드포인트
음성 텍스트 변환
- 변경 사항이 있는 엔드포인트:
- 강제 정렬 작업 생성 - 대용량 파일 스트리밍을 허용하는
enabled_spooled_file파라미터를 추가했습니다(POST /v1/forced-alignment).
- 강제 정렬 작업 생성 - 대용량 파일 스트리밍을 허용하는
스키마 변경 사항
Agents Platform
GET conversation details:has_audio,has_user_audio,has_response_audio불리언 필드를 추가했습니다. 자세히 보기
더빙
GET dubbing resource: 각 렌더링에status필드를 추가했습니다. 자세히 보기