Apresentando o Modificador de Voz IA
- Publicado
OuvirOuça este artigo
O Modificador de Voz IA era originalmente chamado de speech-to-speech. No contexto de agentes de voz com IA, "speech-to-speech" também se refere a arquiteturas integradas, em que um único modelo processa diretamente a entrada e a saída de áudio. O ElevenAgents usa uma arquitetura em cascata avançada em sua plataforma. Saiba mais: Modelos em cascata vs. integrados.
Modificador de Voz IA
Adicionamos o Modificador de Voz IA à Síntese de Fala. O Modificador de Voz IA é uma ferramenta de conversão de voz que recebe a gravação de uma voz e faz com que ela soe como se fosse falada por outra, preservando a interpretação original. Isso significa que as emoções, o timing, o ritmo e a pronúncia que você coloca na gravação são transferidos para a voz de saída.
Isso oferece um nível de controle que apenas prompts de Text to Speech nem sempre conseguem alcançar. Há duas formas principais de usá-lo.
Extraia mais emoção de uma voz. Nem todas as vozes respondem igualmente bem a orientações emocionais em prompts de Text to Speech. O Modificador de Voz IA permite gravar ou enviar uma fala altamente expressiva e reproduzir essa amplitude emocional em outra voz. Se você precisa que um narrador profissional soe mais acolhedor ou que um personagem de livro infantil soe mais brincalhão, pode interpretar a fala você mesmo e pedir ao Modificador de Voz IA que a transfira para a voz desejada.
Ajuste a interpretação da fala. Nossos modelos de Text to Speech geralmente lidam bem com a entonação de forma automática. Mas, quando você precisa de controle preciso sobre como uma frase específica é falada — onde fica a ênfase, como uma pausa soa, qual é a cadência —, o Modificador de Voz IA permite demonstrar isso com sua própria voz e aplicar essa interpretação a qualquer voz que você escolher. Isso será ainda mais útil quando integrarmos o Modificador de Voz IA diretamente ao Estúdio, mas o objetivo é o mesmo: dar a você controle preciso sobre o resultado.
Veja um passo a passo feito por um membro da nossa comunidade:
Pesquisa
Para converter a fala de origem em fala de destino, precisamos expressar o conteúdo da fala de origem com as características da fala de destino. Uma analogia útil é a troca de rostos: apps que pegam dois rostos e os combinam, inserindo os traços de uma pessoa na estrutura mapeada de outra.
Para isso, pegamos a imagem de um rosto e mapeamos seus atributos. Os marcadores no exemplo abaixo fazem exatamente isso: eles são os limites dentro dos quais o outro rosto seria inserido.
O segredo da conversão de voz é reproduzir o conteúdo da fala de origem usando os fonemas da fala de destino. Mas há uma troca aqui, assim como no exemplo de troca de rostos: quanto mais marcadores você usa para mapear os atributos de um rosto, mais restrições impõe ao rosto que mapeia dentro deles. Menos marcadores significam menos restrições.
O mesmo vale para a conversão de voz. Quanto mais priorizamos a fala de destino, maior o risco de ela ficar dessincronizada da fala de origem. Mas, se não a priorizarmos o suficiente, corremos o risco de perder muito do que torna essa fala característica. Por exemplo, se reproduzíssemos a gravação de alguém gritando com raiva em uma voz sussurrada, teríamos um problema. Dar preferência demais às emoções da fala de origem tem o custo de perder a impressão de que se trata de uma voz sussurrada. Dar ênfase demais ao padrão de fala sussurrado faz com que percamos a carga emocional da fala de origem.
Produto e atualizações recentes
Alterações nas vozes predefinidas
Estamos fazendo alterações nas vozes padrão disponíveis na Síntese de Fala. Vamos descontinuar algumas vozes e substituí-las por novas, com mais de 20 adições previstas para as próximas semanas.
Também começaremos a fornecer informações na interface sobre por quanto tempo cada voz deve permanecer disponível. Ao longo de dezembro, vamos reformular nossos recursos de compartilhamento de voz e remuneração pelo uso para ampliar a variedade de vozes. Em breve, mais detalhes.
Eleven Turbo v2 e formato uLaw 8 kHz
O Turbo v2 é resultado de meses de pesquisa da nossa equipe. Ele foi desenvolvido para interações em tempo real, mas funciona para qualquer caso de uso. Também é compatível com o formato padrão (m)uLaw de 8 kHz para sistemas de IVR.
Normalização e metadados com o Estúdio
O Estúdio agora oferece suporte às diretrizes padrão do setor para envio de audiolivros, incluindo ajuste de ganho e compressão dinâmica. Você também pode incorporar metadados (ISBN, autor e título) diretamente no seu projeto do Estúdio.
Dicionário de pronúncia
Este tem sido um dos nossos recursos mais solicitados. No mês passado, adicionamos suporte a tags SSML para especificar a pronúncia usando os dicionários IPA e CMU com nossos modelos em inglês. Agora lançamos o suporte a dicionário de pronúncia na interface do Estúdio, permitindo que você envie um arquivo que especifique a pronúncia usando IPA, CMU ou substituições de palavras (aliases). Os arquivos de dicionário usam o padrão aberto do setor .PLS de formato de arquivo de léxico.
IPA e CMU são atualmente compatíveis com o Turbo v2 em inglês. As substituições de palavras são compatíveis com todos os modelos e idiomas. A documentação completa está disponível aqui.
Se tiver algum feedback, não hesite em entrar em contato conosco no Discord!
Experimente o Modificador de Voz IA
Fale como quiser e ouça sua fala em uma voz completamente diferente, com controle total sobre a interpretação. Capture sussurros, risadas, sotaques e nuances emocionais sutis.
Fale do seu jeito e ouça sua mensagem em uma voz totalmente diferente, com controle total sobre a performance. Capte sussurros, risadas, sotaques e nuances emocionais sutis.




