콘텐츠로 건너뛰기

Dust, ElevenLabs를 활용해 AI 기반 엔터프라이즈 워크플로에 다국어 음성 기능 추가

게시일

듣기이 글 오디오로 듣기

Dust는 AI 네이티브 기업을 위한 운영 체제로, 이제 ElevenLabs 기반의 다국어 음성 입력과 출력을 제공합니다. 모델을 일상 업무에 통합하도록 설계된 Dust에는 낮은 지연 시간과 높은 사실감을 갖추고, 언어·기기·상황 전반에서 작동하는 음성 기능이 필요했습니다.

이는 탐색적인 시도가 아니었습니다. 반복된 고객 요청에 따라 음성은 제품의 우선순위가 되었습니다. 그 결과, 출퇴근 중 핸즈프리 에이전트 상호작용, 글로벌 팀 간 다국어 협업, 비동기 워크플로를 위한 전문적인 오디오 출력을 지원하는 시스템이 탄생했습니다.

엔터프라이즈에서 음성이 중요한 이유

Dust는 업무 환경에서 음성에 필요한 4가지 핵심 요건을 파악했습니다:

  • 검증을 견디는 자연스러운 품질: 음성 출력은 전문적이고 사람처럼 들려야 하며, 고객 이메일, 팟캐스트 또는 제품 데모에서 공유하기에 적합해야 합니다.
  • 기본으로 제공되는 다국어 지원: 팀은 전 세계의 사무소와 여러 언어에 걸쳐 운영됩니다. 하나의 세션에서 프랑스어, 영어, 독일어를 전환하는 일은 예외적인 사례가 아니어야 합니다.
  • 낮은 지연 시간: 입력과 출력 모두 응답 속도가 사고와 대화의 흐름에 맞아야 합니다.
  • 엔터프라이즈급 데이터 처리: 데이터 미보존, 지역 기반 라우팅, SOC2 및 GDPR 준수는 타협할 수 없는 요건이었습니다.

Dust가 ElevenLabs를 선택한 이유

Dust는 OpenAI, Google, Deepgram, AssemblyAI를 포함한 여러 제공업체를 평가한 뒤, 뛰어난 품질과 배포 준비성을 갖춘 ElevenLabs를 선택했습니다:

  • 텍스트 음성 변환 음성은 폭넓은 감정 표현과 함께 일관되게 높은 사실감을 제공했으며, 이는 Dust의 Speech Generator 및 Sound Studio 도구에 매우 중요했습니다.
  • 음성 텍스트 변환은 99개 전사 언어를 지원하며, 언어 간에도 높은 정확성을 제공했습니다.
  • 데이터 미보존 및 다중 리전 라우팅으로 별도 설정 없이 엔터프라이즈 규정 준수를 보장했습니다.
  • 프로덕션급 SDK 및 API는 신속한 통합과 플랫폼 전반에서 일관된 성능을 가능하게 했습니다.

Dust가 음성을 통합한 방식

Dust는 2가지 핵심 워크플로에 음성 지원을 구축했습니다:

1. 음성 입력: 에이전트에게 말하기

ElevenLabs의 scribe_v1 모델을 사용해 이제 마이크로 에이전트와 대화할 수 있습니다. 시스템은 음성 언어를 자동으로 감지하고 전사한 뒤 요청을 համապատասխան하게 라우팅하며, 자연스러운 음성에서 에이전트 이름까지 추론합니다.

음성 입력은 모바일에서 사용할 수 있어, 타이핑이 가장 불편한 순간에 맞춰 활용할 수 있습니다.

2. 음성 출력: 에이전트가 생성하는 오디오

Speech Generator를 통해 Dust 에이전트는 ElevenLabs의 eleven_multilingual_v2 및 eleven_v3 모델을 사용해 오디오 콘텐츠를 만들 수 있습니다. 출력에는 팟캐스트, 브리핑, 내러티브 오디오 콘텐츠가 포함되며, 내부 활용과 외부 공유 모두에 사용됩니다.

Sound Studio는 음향 효과 생성을 기반으로 하며, 교육 및 콘텐츠 사용 사례에 비언어적 오디오 레이어를 추가합니다.

Dust가 얻은 인사이트

  • 리전 라우팅의 중요성: EU/US 리전 선택 기능을 지원해 지연 시간을 줄이고 규정 준수 관련 논의를 수월하게 했습니다.
  • 많음보다 엄선된 선택: 엄선한 12개의 음성으로 모든 핵심 요구를 충족하면서 선택 피로를 줄일 수 있습니다.
  • 품질 > 속도: 더 빠른 모델도 उपलब्ध했지만, 사용자는 프로덕션 콘텐츠에 더 높은 충실도의 음성을 꾸준히 선택했습니다.

이를 통해 가능한 것

  • 모바일 우선 생산성: 이동 중에도 생각을 기록하고 협업하세요.
  • 다국어 협업: 자신의 언어로 자연스럽게 말하면 나머지는 에이전트가 처리합니다.
    접근성 높은 비동기 워크플로: 리서치를 오디오로 전환하고 입력 장벽을 낮추며, 다양한 업무 방식을 지원합니다.

다음 단계

Dust는 실시간 대화형 음성 에이전트, 전사를 넘어선 심층적인 오디오 이해, 회의 및 프레젠테이션 같은 장문 입력 지원을 탐색하고 있습니다. ElevenLabs를 통합함으로써 Dust는 음성을 엔터프라이즈 AI의 자연스러운 일부로 만들고 있습니다.

유사한 기사

최고 품질의 AI 오디오로 창작하세요