Scribe v2 Realtime
가장 빠르고 정확한 실시간 음성 인식 모델인 Scribe v2 Realtime이 공식 출시되었습니다. 92개 이상의 언어에서 최첨단 수준의 정확도를 제공하며, 지연 시간은 150ms에 불과합니다. 자세히 보기.
Agents 플랫폼
- 위젯 통화 종료 피드백: 이제 위젯에서 선택적 평점 및 댓글 필드가 포함된 맞춤형 통화 종료 피드백 수집을 지원하므로, 에이전트 대화 내에서 직접 사용자 피드백을 수집할 수 있습니다.
- 소프트 타임아웃 구성: 에이전트가 대화 중 침묵을 처리하는 방식을 제어할 수 있는 포괄적인 소프트 타임아웃 설정을 추가했습니다. 턴 및 대화 수준에서 프롬프트와 동작을 구성할 수 있습니다.
- 고급 대화 필터링: 이제 대화 엔드포인트에서 통화 시간 범위, 평가 매개변수, 데이터 수집 매개변수, 특정 도구 이름으로 필터링할 수 있습니다.
- 향상된 대화 피드백: 평점과 댓글을 포함한 구조화된 피드백 유형으로 대화 피드백 시스템을 업데이트하여 사용자 경험을 더 효과적으로 추적할 수 있습니다.
ElevenCreative Studio
- 확장된 프로젝트 메타데이터: 이제 프로젝트에 비디오 썸네일, 외부 오디오 참조, 오디오 길이를 포함한 향상된 스냅샷 정보 등 포괄적인 에셋 추적 기능이 포함됩니다.
결제
- 향상된 인보이스 세부 정보: 이제 인보이스 응답에 새로운
discounts배열을 통한 상세 할인 정보가 포함되며, 더 이상 사용되지 않는discount_percent_off및discount_amount_off필드를 대체합니다.subtotal_cents및tax_cents필드는 더 명확한 인보이스 내역을 제공합니다.
Music API
- 스템 분리 지연 시간 개선: 오디오 파일을 더 효과적으로 처리하고 요청 처리 시 더 예측 가능한 지연 시간을 제공하도록 스템 분리 엔드포인트를 업데이트했습니다.
SDK 릴리스
JavaScript SDK
- v2.23.0 - 개발자 경험을 개선하기 위해 Speech to Text(Scribe) 엔드포인트를
scribe_realtime으로 업데이트하고 추가 TypeScript 타입을 내보냈습니다. - v2.22.0 - 대화 필터링, 소프트 타임아웃 구성, 위젯 피드백 기능을 포함한 최신 API 스키마 변경 사항을 반영했습니다.
Python SDK
- v2.22.1 - 안정성을 개선하기 위해 Speech to Text(Scribe) 엔드포인트를
scribe_realtime으로 업데이트하고 순환 import 문제를 수정했습니다. - v2.22.0 - 대화 필터링, 소프트 타임아웃 구성, 위젯 피드백 기능을 포함한 최신 API 스키마 변경 사항을 반영했습니다.
Agents 패키지
- @elevenlabs/client@0.10.0 - 실시간 엔드포인트 구성을 업데이트하고 문서를 개선했습니다.
- @elevenlabs/react@0.10.0 - 실시간 엔드포인트 구성을 업데이트하고 문서를 개선했습니다.
- @elevenlabs/types@0.2.0 - 최신 API 스키마 변경 사항에 맞춰 타입 정의를 업데이트했습니다.
- @elevenlabs/react@0.9.2 - 사소한 버그를 수정하고 안정성을 개선했습니다.
- @elevenlabs/convai-widget-embed@0.5.1 - 통화 종료 피드백을 지원하도록 위젯 임베드 기능을 업데이트했습니다.
- @elevenlabs/convai-widget-core@0.5.1 - 위젯 코어에 통화 종료 피드백 구성을 추가했습니다.
- @elevenlabs/convai-widget-embed@0.5.0 - 맞춤형 통화 종료 피드백 수집을 지원합니다.
- @elevenlabs/convai-widget-core@0.5.0 - 피드백 처리를 위해
WidgetEndFeedbackConfig및WidgetEndFeedbackType을 도입했습니다. - @elevenlabs/client@0.9.2 - 최신 API 변경 사항으로 클라이언트 구성을 업데이트했습니다.
Android SDK
- v0.5.0 - 프로그래밍 방식의 오디오 제어를 위한
setVolume및getVolume함수를 추가했으며, 샘플 앱에 볼륨 탐색 바를 포함한 예제 구현을 제공합니다.
API
API 변경 사항 보기
업데이트된 엔드포인트
Agents 플랫폼
대화 관리
-
- 최소 통화 시간으로 대화를 필터링하는
call_duration_min_secs쿼리 매개변수(정수)를 추가했습니다. - 최대 통화 시간으로 대화를 필터링하는
call_duration_max_secs쿼리 매개변수(정수)를 추가했습니다. - 평가 기준으로 필터링하는
evaluation_params쿼리 매개변수(문자열 배열)를 추가했습니다. - 데이터 수집 매개변수로 필터링하는
data_collection_params쿼리 매개변수(문자열 배열)를 추가했습니다. - 특정 도구를 사용한 대화를 필터링하는
tool_names쿼리 매개변수(문자열 배열)를 추가했습니다.
- 최소 통화 시간으로 대화를 필터링하는
-
- 이제 구조화된 피드백 유형을 포함하는
ConversationFeedbackRequestModel을 사용합니다. - 피드백 카테고리를 지정하는
type필드를 추가했습니다. - 숫자 피드백을 위한
rating필드를 추가했습니다. - 텍스트 피드백을 위한
comment필드를 추가했습니다.
- 이제 구조화된 피드백 유형을 포함하는
에이전트 구성
- 에이전트 위젯 가져오기
- 통화 종료 피드백 수집을 구성하기 위한
WidgetEndFeedbackConfig가 포함된end_feedback필드를 추가했습니다. - 피드백 양식에서 선택적 평점 및 댓글 필드를 지원합니다.
- 통화 종료 피드백 수집을 구성하기 위한
- 에이전트 가져오기 & 에이전트 업데이트
- 새 플랫폼 구성 옵션을 포함하도록 응답 스키마를 업데이트했습니다.
- 추가 설정 필드로 요청 스키마를 개선했습니다.
턴 및 대화 구성
-
에이전트 생성, 대화 시뮬레이션, 대화 스트림 시뮬레이션
- 대화 중 침묵 동작을 제어하는
soft_timeout_config필드를 추가했습니다. TurnConfigOverride및TurnConfigOverrideConfig를 통한turn구성 재정의를 추가했습니다.- 초기 응답 타이밍을 제어하는
TurnConfig의initial_wait_time을 추가했습니다. - 대화 및 워크플로 재정의 수준에서 구성을 사용할 수 있습니다.
- 대화 중 침묵 동작을 제어하는
테스트
-
- 워크플로 표현식 지원을 위해 요청 스키마를 개선했습니다.
- 추가 테스트 결과 필드로 응답 스키마를 업데이트했습니다.
-
- 응답에 향상된 테스트 결과 데이터가 포함됩니다.
- 워크플로 표현식 결과 스키마를 업데이트했습니다.
ElevenCreative Studio
-
- 비디오 및 외부 오디오 참조를 포함하는 필수
assets필드를 추가했습니다. - 비디오 에셋 메타데이터를 위한
ProjectVideoResponseModel을 도입했습니다. - 외부 오디오 추적을 위한
ProjectExternalAudioResponseModel을 도입했습니다. - 비디오 썸네일을 위한
ProjectVideoThumbnailSheetResponseModel을 도입했습니다.
- 비디오 및 외부 오디오 참조를 포함하는 필수
-
- 새
ProjectSnapshotExtendedResponseModel로 응답을 재구성했습니다. - 스냅샷 데이터에 필수
audio_duration_secs필드를 추가했습니다. ProjectSnapshotResponseModel에서character_alignments를 제거했습니다.- 스냅샷 컬렉션을 위한
ProjectSnapshotsResponseModel을 도입했습니다.
- 새
결제
- 구독 가져오기
DiscountResponseModel항목이 포함된 필수discounts배열을 추가했습니다.discount_percent_off필드를 더 이상 사용하지 않음으로 표시했습니다(계속 사용 가능하지만 제거 예정).discount_amount_off필드를 더 이상 사용하지 않음으로 표시했습니다(계속 사용 가능하지만 제거 예정).- 세전 인보이스 합계를 위한
subtotal_cents필드(정수, null 허용)를 추가했습니다. - 세액을 위한
tax_cents필드(정수, null 허용)를 추가했습니다. - 새 할인 및 합계 필드를 포함하도록 인보이스 예시를 업데이트했습니다.
음성 인식
- 오디오 전사
- 향상된 전사 데이터로 응답 스키마를 업데이트했습니다.
텍스트 음성 변환
-
타임스탬프와 함께 텍스트를 음성으로 변환 & 타임스탬프와 함께 텍스트 음성 변환 스트리밍
- 향상된 타임스탬프 데이터로 응답 스키마를 업데이트했습니다.
-
타임스탬프와 함께 텍스트를 대화로 변환 & 타임스탬프와 함께 텍스트 대화 스트리밍
- 향상된 타임스탬프 및 음성 세그먼트 데이터로 응답 스키마를 업데이트했습니다.
음성 관리
-
음성 가져오기, 음성 설정 가져오기, 기본 음성 설정 가져오기
- 새 음성 메타데이터 및 구성 필드로 응답 스키마를 업데이트했습니다.
-
- 음성 설정 수정을 위해 요청 스키마를 업데이트했습니다.
-
- 새 음성 생성 데이터로 응답 스키마를 업데이트했습니다.
프로페셔널 음성 복제(PVC)
- PVC 샘플 오디오 가져오기 & PVC 분리 화자 오디오 가져오기
- 오디오 샘플 검색을 위해 응답 스키마를 업데이트했습니다.
언어 프리셋
- 이제 언어 프리셋 모델에 현지화된 소프트 타임아웃 메시지를 위한
soft_timeout_translation필드가 포함됩니다.
API 통합 트리거
- 새 API 컬렉션
convai_api_integration_trigger_connections을 등록했습니다.
지원 중단
- 인보이스 필드
discount_percent_off및discount_amount_off는 더 이상 사용되지 않습니다. 대신discounts배열을 사용하세요.