Modificador de voz

Um guia sobre como transformar áudios entre vozes, preservando a emoção e a interpretação.

Visão geral

O Modificador de Voz (anteriormente Speech-to-Speech) permite converter uma voz (voz de origem) em outra (voz clonada), preservando o tom e a interpretação da voz original.

O Modificador de Voz pode ser usado para complementar o Text to Speech (TTS), corrigindo erros de pronúncia ou adicionando aquela performance especial que você quer transmitir. O Modificador de Voz é especialmente útil para reproduzir aquelas características sutis e particulares da voz que dão um toque mais emotivo e humano. Alguns recursos principais incluem:

  • Maior precisão com sussurros
  • Capacidade de criar suspiros, risadas ou choros audíveis
  • Detecção de tom e emoção muito aprimorada
  • Segue com precisão a cadência da fala de entrada
  • Preservação de idioma/sotaque

Guia

Demonstração do Modificador de Voz

O áudio pode ser enviado diretamente por meio de um arquivo de áudio ou gravado ao vivo usando um microfone. O arquivo de áudio deve ter menos de 50 MB, e tanto o arquivo de áudio quanto a gravação ao vivo não podem exceder 5 minutos de duração.

Se você tiver material com mais de 5 minutos, recomendamos dividi-lo em seções menores e gerá-las separadamente. Além disso, se o tamanho do arquivo for muito grande, talvez seja necessário compactá-lo ou convertê-lo para MP3.

Arquivo de áudio existente

Para enviar um arquivo de áudio existente, clique na caixa de áudio ou arraste e solte o arquivo diretamente nela.

Gravar ao vivo

Pressione o botão Gravar áudio na caixa de áudio e, quando estiver pronto para iniciar a gravação, pressione o botão Microfone. Quando terminar de gravar, pressione o botão Parar.

Em seguida, você verá o arquivo de áudio dessa gravação e poderá reproduzi-lo para ouvir — isso ajuda a determinar se está satisfeito com sua performance/gravação. O custo em caracteres será exibido no canto inferior esquerdo, e você não consumirá essa cota ao gravar — somente ao pressionar “Gerar”.

O custo de uma geração com o Modificador de Voz é baseado exclusivamente na duração, a 1.000 caracteres por minuto.

Configurações

Configurações do Modificador de Voz

Saiba mais sobre as diferentes configurações de voz aqui.

O Modificador de Voz adiciona uma configuração extra para remover automaticamente o ruído de fundo da sua gravação.

Idiomas compatíveis

eleven_english_sts_v2

Nossos modelos multilíngues v2 oferecem suporte a 29 idiomas:

Inglês (EUA, Reino Unido, Austrália, Canadá), Japonês, Chinês, Alemão, Hindi, Francês (França, Canadá), Coreano, Português (Brasil, Portugal), Italiano, Espanhol (Espanha, México), Indonésio, Holandês, Turco, Filipino, Polonês, Sueco, Búlgaro, Romeno, Árabe (Arábia Saudita, Emirados Árabes Unidos), Tcheco, Grego, Finlandês, Croata, Malaio, Eslovaco, Dinamarquês, Tâmil, Ucraniano e Russo.

O modelo eleven_english_sts_v2 é compatível apenas com inglês.

Saiba mais sobre os modelos

Boas práticas

O Modificador de Voz se destaca por preservar sotaques e cadências naturais de fala em diversas vozes de saída. Por exemplo, se você enviar uma amostra de áudio com sotaque português, a saída manterá esse idioma e sotaque. A amostra de entrada é essencial, pois determina as características da saída. Se você selecionar uma voz britânica como “George”, mas gravar com sotaque americano, o resultado será a voz de George com sotaque americano.

  • Expressão: Seja expressivo em suas gravações. Seja gritando, chorando ou rindo, o Modificador de Voz reproduzirá sua performance com precisão. Essa ferramenta foi criada para aprimorar o realismo da IA e permitir expressão criativa.
  • Ganho do microfone: Garanta que o ganho de entrada esteja adequado. Uma gravação baixa pode dificultar o reconhecimento pela IA, enquanto uma muito alta pode causar clipping no áudio.
  • Ruído de fundo: Ative a opção Remover ruído de fundo para remover automaticamente o ruído de fundo da sua gravação.

Perguntas frequentes

O Modificador de Voz IA, antes conhecido como Speech to Speech, permite converter uma voz (voz de origem) em outra (voz clonada), preservando o tom e a interpretação da voz original.

As possibilidades são infinitas. Ele pode complementar o Text to Speech, corrigindo pronúncias ou incorporando aquela interpretação especial que você procura. Também pode ajudar a ampliar a versatilidade de dubladores, dando acesso a uma ampla seleção de vozes e tons diferentes. Oferecemos uma solução completa de dublagem, mas, se você ainda quiser dublar da forma tradicional, pode usar o modificador de voz para encontrar a voz certa para seu projeto.

A duração máxima do áudio que pode ser convertido é de 5 minutos. Para ver os preços atuais, consulte ElevenCreative e ElevenAPI.

Para mais informações, consulte nosso guia.

O preço do Modificador de Voz IA, anteriormente conhecido como Speech to Speech, depende de você gerar pelo site ou pela API.

Para consultar os preços atuais, acesse ElevenCreative e ElevenAPI.

A duração máxima atual de entrada ao usar o Modificador de Voz IA, antes conhecido como Speech to Speech, é de 300 segundos ou 5 minutos de áudio. Isso é igual em todas as assinaturas.

Os seguintes formatos de arquivo podem ser usados como áudio de entrada para o Modificador de Voz IA.

Áudio:

  • MP3
  • M4A
  • FLAC
  • OGA
  • OGG
  • WAV

Vídeo:

  • MKV
  • WEBM
  • MP4
  • MOV

Você pode baixar os arquivos gerados de duas formas:

Você pode baixar um arquivo gerado imediatamente clicando no botão de download no canto inferior direito depois de gerar o conteúdo.

Arquivos gerados anteriormente podem ser baixados no seu histórico. Para acessar seu histórico, entre na sua conta e selecione Modificador de Voz IA na barra lateral. Em seguida, clique na aba Histórico no painel do lado direito da tela. 

Você pode clicar no botão de download para baixar qualquer arquivo do seu histórico como MP3 ou WAV. Para opções adicionais de download, clique em Avançado.

No results