Apresentando o Modificador de Voz IA
- Publicado
OuvirOuça este artigo
O Voice Changer era originalmente chamado de speech-to-speech. No contexto de agentes de voz com IA, "speech-to-speech" também se refere a arquiteturas fusionadas, nas quais um único modelo processa diretamente a entrada e a saída de áudio. A ElevenAgents usa uma arquitetura em cascata avançada em sua plataforma. Saiba mais: Modelos em cascata vs. fusionados.
Modificador de Voz IA
Adicionamos o Modificador de Voz IA ao Speech Synthesis. O Voice Changer é uma ferramenta de conversão de voz que recebe a gravação de uma voz e faz com que ela soe como se fosse falada por outra, preservando a interpretação original. Isso significa que as emoções, a duração, o ritmo e a pronúncia que você coloca na gravação são transferidos para a voz de saída.
Isso dá a você um nível de controle que os comandos de Text to Speech por si só nem sempre conseguem oferecer. Há duas formas principais de usar esse recurso.
Extraia mais emoção de uma voz. Nem todas as vozes respondem da mesma forma a instruções emocionais em comandos de Text to Speech. O Voice Changer permite gravar ou enviar falas muito expressivas e reproduzir essa variedade emocional em uma voz diferente. Se você precisa que um narrador profissional soe mais acolhedor ou que um personagem de livro infantil soe mais brincalhão, pode interpretar a fala você mesmo e usar o Voice Changer para transferi-la para a voz desejada.
Ajuste a interpretação da fala. Nossos modelos de Text to Speech normalmente lidam bem com a entonação desde o início. Mas, quando você precisa de controle preciso sobre como uma frase específica é dita — onde fica a ênfase, como uma pausa soa, qual é a cadência —, o Voice Changer permite demonstrar isso com sua própria voz e aplicar essa interpretação à voz que você escolher. Isso será ainda mais útil quando integrarmos o Voice Changer diretamente ao Estúdio, mas o objetivo é o mesmo: dar a você controle preciso sobre o resultado.
Confira um passo a passo de um membro da nossa comunidade:
Pesquisa
Para converter a fala de origem em fala de destino, precisamos expressar o conteúdo da fala de origem com as características da fala de destino. Uma analogia útil é a troca de rostos: aplicativos que pegam dois rostos e os combinam, renderizando os traços de uma pessoa dentro da estrutura mapeada de outra.
Para isso, pegamos a imagem de um rosto e mapeamos seus atributos. Os marcadores do exemplo abaixo fazem exatamente isso: eles definem os limites dentro dos quais o outro rosto seria renderizado.
O segredo da conversão de voz é renderizar o conteúdo da fala de origem usando os fonemas da fala de destino. Mas há uma troca aqui, assim como no exemplo de troca de rostos: quanto mais marcadores você usa para mapear os atributos de um rosto, mais restrições impõe ao rosto mapeado dentro deles. Menos marcadores significam menos restrições.
O mesmo vale para a conversão de voz. Quanto mais priorizamos a fala de destino, maior o risco de ela ficar fora de sincronia com a fala de origem. Mas, se não dermos prioridade suficiente a ela, corremos o risco de perder grande parte do que torna essa fala característica. Por exemplo, se renderizássemos a gravação de alguém gritando com raiva em uma voz sussurrada, teríamos um problema. Dar preferência demais às emoções da fala de origem faz com que percamos a impressão de que é uma voz sussurrada falando. Dar ênfase demais ao padrão de fala sussurrado faz com que percamos a carga emocional da fala de origem.
Produto e atualizações recentes
Mudanças nas vozes prontas
Estamos fazendo mudanças nas vozes padrão disponíveis no Speech Synthesis. Vamos descontinuar algumas vozes e substituí-las por novas, com mais de 20 adições planejadas para as próximas semanas.
Também começaremos a fornecer informações na interface sobre por quanto tempo cada voz deve continuar disponível. Ao longo de dezembro, vamos reformular nossos recursos de compartilhamento de voz e compensação pelo uso para ampliar a variedade de vozes. Em breve, mais detalhes.
Eleven Turbo v2 e formato uLaw 8 kHz
O Turbo v2 é resultado de meses de pesquisa da nossa equipe. Ele foi desenvolvido para interações em tempo real, mas funciona para qualquer caso de uso. Também oferece suporte ao formato padrão (m)uLaw de 8 kHz para sistemas de IVR.
Normalização e metadados no Estúdio
O Estúdio agora oferece suporte a diretrizes padrão do setor para envio de audiolivros, incluindo ajuste de ganho e compressão dinâmica. Você também pode incorporar metadados (ISBN, autor e título) diretamente ao seu projeto no Estúdio.
Dicionário de pronúncia
Este era um dos recursos mais solicitados por nossos usuários. No mês passado, adicionamos suporte a tags SSML para especificar a pronúncia usando os dicionários IPA e CMU com nossos modelos em inglês. Agora, lançamos o suporte a dicionários de pronúncia na interface do Estúdio, permitindo enviar um arquivo que especifique a pronúncia usando IPA, CMU ou substituições de palavras (aliases). Os arquivos de dicionário usam o padrão aberto .PLS do setor, o formato de arquivo de léxico.
IPA e CMU são atualmente compatíveis com o Turbo v2 em inglês. As substituições de palavras são compatíveis com todos os modelos e idiomas. A documentação completa está disponível aqui.
Se tiver algum comentário, fale com a gente no Discord!
Experimente o Voice Changer
Diga do seu jeito e ouça em uma voz completamente diferente, com controle total sobre a interpretação. Capture sussurros, risadas, sotaques e nuances emocionais sutis.
Fale do seu jeito e ouça sua mensagem em uma voz totalmente diferente, com controle total sobre a performance. Capte sussurros, risadas, sotaques e nuances emocionais sutis.




