Dust adiciona voz multilíngue a workflows empresariais com IA usando a ElevenLabs
- Escrito por
- Nicolò Scribani Rossi
- Publicado
OuvirOuça este artigo
Dust, o sistema operacional para empresas nativas em IA, agora inclui entrada e saída de voz multilíngue — com tecnologia da ElevenLabs. Criada para integrar modelos ao trabalho diário, a Dust precisava de recursos de voz que funcionassem em diferentes idiomas, dispositivos e contextos, com baixa latência e alto realismo.
Isso não foi apenas uma exploração. A voz se tornou uma prioridade de produto após pedidos recorrentes dos clientes. O resultado é um sistema que permite interação sem as mãos com agentes durante deslocamentos, colaboração multilíngue entre equipes globais e resultados de áudio profissionais para workflows assíncronos.
Por que a voz é importante nas empresas
A Dust identificou quatro requisitos essenciais para a voz em um contexto de trabalho:
- Qualidade natural que resiste a avaliações criteriosas: A saída de voz precisa soar profissional e humana — adequada para compartilhar em e-mails para clientes, podcasts ou demonstrações de produto.
- Multilíngue por padrão: As equipes trabalham em escritórios e idiomas do mundo todo. Alternar entre francês, inglês e alemão em uma única sessão não deveria ser uma exceção.
- Baixa latência: Tanto na entrada quanto na saída, a velocidade de resposta precisa acompanhar o ritmo do pensamento e da conversa.
- Tratamento de dados de nível empresarial: Sem retenção de dados, roteamento por região e conformidade com SOC2 e LGPD eram requisitos inegociáveis.
Por que a Dust escolheu a ElevenLabs
Depois de avaliar fornecedores como OpenAI, Google, Deepgram e AssemblyAI, a Dust selecionou a ElevenLabs pela qualidade superior e por estar pronta para implantação:
- Text to Speech oferece vozes com alto realismo consistente e ampla gama emocional — algo essencial para as ferramentas Speech Generator e Sound Studio da Dust.
- Speech to Text oferece suporte a 99 idiomas de transcrição, com alta fidelidade entre idiomas.
- Zero Data Retention e o roteamento multirregional garantiram conformidade empresarial desde o início.
- SDKs e APIs prontos para produção permitiram integração rápida e desempenho consistente em todas as plataformas.
Como a Dust integrou a voz
A Dust desenvolveu suporte de voz para dois workflows principais:
1. Entrada de voz: falar com agentes
Usando o modelo scribe_v1 da ElevenLabs, os usuários agora podem falar com agentes pelo microfone. O sistema detecta automaticamente o idioma falado, faz a transcrição e encaminha a solicitação como necessário, inclusive inferindo nomes de agentes a partir da fala natural.
A entrada de voz está disponível em dispositivos móveis, atendendo aos momentos em que digitar é menos conveniente.
2. Saída de voz: áudio gerado por agentes
Com o Speech Generator, os agentes da Dust podem criar conteúdo de áudio usando os modelos eleven_multilingual_v2 e eleven_v3 da ElevenLabs. A saída inclui podcasts, briefings e conteúdos de áudio narrativos, usados tanto internamente quanto para compartilhamento externo.
O Sound Studio, com tecnologia de Efeitos Sonoros, adiciona camadas de áudio não verbal para casos de uso de treinamento e conteúdo.
O que a Dust aprendeu
- O roteamento regional importa: Habilitar a seleção de região entre UE/EUA reduziu a latência e facilitou conversas sobre conformidade.
- Curadoria supera abundância: Um conjunto selecionado de 12 vozes reduz a fadiga de decisão e atende a todas as necessidades principais.
- Qualidade > velocidade: Apesar de haver modelos mais rápidos disponíveis, os usuários escolheram consistentemente vozes com maior fidelidade para conteúdo de produção.
O que isso possibilita
- Produtividade em dispositivos móveis: Registre ideias e colabore onde estiver.
- Colaboração multilíngue: Fale naturalmente no seu próprio idioma — os agentes cuidam do resto.
Workflows acessíveis e assíncronos: Transforme pesquisas em áudio, reduza as barreiras de entrada e ofereça suporte a diferentes estilos de trabalho.
O que vem a seguir
A Dust está explorando agentes de voz conversacionais em tempo real, uma compreensão mais profunda de áudio que vai além da transcrição e suporte para conteúdos longos, como reuniões e apresentações. Ao integrar a ElevenLabs, a Dust torna a voz uma parte integrada da IA empresarial.
.png&w=3840&q=80)



