Apresentamos o Eleven v4Conheça o Eleven v4, nosso modelo mais expressivo até agora. Com 3x mais créditos incluídos no Creator+ até 12 de outubro

Pular para o conteúdo

Apresentando o Modificador de Voz IA

Publicado

OuvirOuça este artigo

O Modificador de Voz IA era originalmente chamado de speech-to-speech. No contexto de agentes de voz com IA, "speech-to-speech" também se refere a arquiteturas integradas, em que um único modelo processa diretamente a entrada e a saída de áudio. O ElevenAgents usa uma arquitetura em cascata avançada em sua plataforma. Saiba mais: Modelos em cascata vs. integrados.

Modificador de Voz IA

Adicionamos o Modificador de Voz IA à Síntese de Fala. O Modificador de Voz IA é uma ferramenta de conversão de voz que recebe a gravação de uma voz e faz com que ela soe como se fosse falada por outra, preservando a interpretação original. Isso significa que as emoções, o timing, o ritmo e a pronúncia que você coloca na gravação são transferidos para a voz de saída.

Isso oferece um nível de controle que apenas prompts de Text to Speech nem sempre conseguem alcançar. Há duas formas principais de usá-lo.

Extraia mais emoção de uma voz. Nem todas as vozes respondem igualmente bem a orientações emocionais em prompts de Text to Speech. O Modificador de Voz IA permite gravar ou enviar uma fala altamente expressiva e reproduzir essa amplitude emocional em outra voz. Se você precisa que um narrador profissional soe mais acolhedor ou que um personagem de livro infantil soe mais brincalhão, pode interpretar a fala você mesmo e pedir ao Modificador de Voz IA que a transfira para a voz desejada.

Ajuste a interpretação da fala. Nossos modelos de Text to Speech geralmente lidam bem com a entonação de forma automática. Mas, quando você precisa de controle preciso sobre como uma frase específica é falada — onde fica a ênfase, como uma pausa soa, qual é a cadência —, o Modificador de Voz IA permite demonstrar isso com sua própria voz e aplicar essa interpretação a qualquer voz que você escolher. Isso será ainda mais útil quando integrarmos o Modificador de Voz IA diretamente ao Estúdio, mas o objetivo é o mesmo: dar a você controle preciso sobre o resultado.

Veja um passo a passo feito por um membro da nossa comunidade:

Pesquisa

Para converter a fala de origem em fala de destino, precisamos expressar o conteúdo da fala de origem com as características da fala de destino. Uma analogia útil é a troca de rostos: apps que pegam dois rostos e os combinam, inserindo os traços de uma pessoa na estrutura mapeada de outra.

Para isso, pegamos a imagem de um rosto e mapeamos seus atributos. Os marcadores no exemplo abaixo fazem exatamente isso: eles são os limites dentro dos quais o outro rosto seria inserido.

Comparison of facial recognition and facial mapping technology.
Audio waveform with a corresponding speech transcription in a visual format.

O segredo da conversão de voz é reproduzir o conteúdo da fala de origem usando os fonemas da fala de destino. Mas há uma troca aqui, assim como no exemplo de troca de rostos: quanto mais marcadores você usa para mapear os atributos de um rosto, mais restrições impõe ao rosto que mapeia dentro deles. Menos marcadores significam menos restrições.

O mesmo vale para a conversão de voz. Quanto mais priorizamos a fala de destino, maior o risco de ela ficar dessincronizada da fala de origem. Mas, se não a priorizarmos o suficiente, corremos o risco de perder muito do que torna essa fala característica. Por exemplo, se reproduzíssemos a gravação de alguém gritando com raiva em uma voz sussurrada, teríamos um problema. Dar preferência demais às emoções da fala de origem tem o custo de perder a impressão de que se trata de uma voz sussurrada. Dar ênfase demais ao padrão de fala sussurrado faz com que percamos a carga emocional da fala de origem.

Produto e atualizações recentes

Alterações nas vozes predefinidas

Estamos fazendo alterações nas vozes padrão disponíveis na Síntese de Fala. Vamos descontinuar algumas vozes e substituí-las por novas, com mais de 20 adições previstas para as próximas semanas.

Também começaremos a fornecer informações na interface sobre por quanto tempo cada voz deve permanecer disponível. Ao longo de dezembro, vamos reformular nossos recursos de compartilhamento de voz e remuneração pelo uso para ampliar a variedade de vozes. Em breve, mais detalhes.

Eleven Turbo v2 e formato uLaw 8 kHz

O Turbo v2 é resultado de meses de pesquisa da nossa equipe. Ele foi desenvolvido para interações em tempo real, mas funciona para qualquer caso de uso. Também é compatível com o formato padrão (m)uLaw de 8 kHz para sistemas de IVR.

Normalização e metadados com o Estúdio

O Estúdio agora oferece suporte às diretrizes padrão do setor para envio de audiolivros, incluindo ajuste de ganho e compressão dinâmica. Você também pode incorporar metadados (ISBN, autor e título) diretamente no seu projeto do Estúdio.

Dicionário de pronúncia

Este tem sido um dos nossos recursos mais solicitados. No mês passado, adicionamos suporte a tags SSML para especificar a pronúncia usando os dicionários IPA e CMU com nossos modelos em inglês. Agora lançamos o suporte a dicionário de pronúncia na interface do Estúdio, permitindo que você envie um arquivo que especifique a pronúncia usando IPA, CMU ou substituições de palavras (aliases). Os arquivos de dicionário usam o padrão aberto do setor .PLS de formato de arquivo de léxico.

IPA e CMU são atualmente compatíveis com o Turbo v2 em inglês. As substituições de palavras são compatíveis com todos os modelos e idiomas. A documentação completa está disponível aqui.

Upload area for a Lexicon file with instructions to click or drag and drop a .pls/.txt/.xml file, size limit 1.5MB.
Pronunciation diary

Se tiver algum feedback, não hesite em entrar em contato conosco no Discord!

Experimente o Modificador de Voz IA

Fale como quiser e ouça sua fala em uma voz completamente diferente, com controle total sobre a interpretação. Capture sussurros, risadas, sotaques e nuances emocionais sutis.

Fale do seu jeito e ouça sua mensagem em uma voz totalmente diferente, com controle total sobre a performance. Capte sussurros, risadas, sotaques e nuances emocionais sutis.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade