프로페셔널 음성 복제(PVC)

  • PVC API: 프로페셔널 음성 복제(PVC)를 관리할 수 있는 종합적인 API 엔드포인트 모음을 도입했습니다. 이제 프로그래밍 방식으로 음성을 만들고, 오디오 샘플을 추가/관리/삭제하며, 오디오/파형을 가져오고, 화자 분리를 관리하고, 인증을 처리하고, 학습을 시작할 수 있습니다. 새 엔드포인트의 전체 목록은 아래 API 변경 사항 요약을 확인하거나 PVC API 레퍼런스를 여기에서 읽어보세요.

음성 텍스트 변환

  • 향상된 내보내기 옵션: API를 통해 세그먼트 JSON 형식으로 음성 텍스트 변환 결과를 내보낼 때 타임스탬프와 화자 ID를 포함하거나 제외하는 옵션을 추가했습니다.

Agents Platform

  • 새 LLM 모델: 새 GPT-4.1 모델 gpt-4.1, gpt-4.1-mini, gpt-4.1-nano를 지원합니다. 자세히 보기
  • VAD 점수: VAD 점수를 클라이언트로 전송하는 새 클라이언트 이벤트를 추가했습니다. 레퍼런스는 여기에서 확인하세요.

API

새 엔드포인트

업데이트된 엔드포인트

음성 텍스트 변환

  • 변경 사항이 있는 엔드포인트:
    • 강제 정렬 작업 생성 - 대용량 파일 스트리밍을 허용하는 enabled_spooled_file 파라미터를 추가했습니다(POST /v1/forced-alignment).

스키마 변경 사항

Agents Platform

  • GET conversation details: has_audio, has_user_audio, has_response_audio 불리언 필드를 추가했습니다. 자세히 보기

더빙

  • GET dubbing resource : 각 렌더링에 status 필드를 추가했습니다. 자세히 보기