Alinhamento forçado
Alinhamento forçado
Saiba como transformar áudio falado e texto em uma transcrição alinhada no tempo com a ElevenLabs.
Visão geral
A API de Alinhamento forçado da ElevenLabs transforma áudio falado e texto em uma transcrição alinhada no tempo. Isso é útil quando você tem uma gravação de áudio e uma transcrição, mas precisa de timestamps exatos para cada palavra ou frase da transcrição. Ela pode ser usada para:
- Sincronizar legendas com uma gravação de vídeo
- Gerar marcações de tempo para a gravação de um audiolivro a partir de um ebook
Uso
A API de Alinhamento forçado pode ser usada por meio da integração direta com a API da ElevenLabs.
Idiomas compatíveis
Nossos modelos multilíngues v2 oferecem suporte a 29 idiomas:
Inglês (EUA, Reino Unido, Austrália, Canadá), Japonês, Chinês, Alemão, Hindi, Francês (França, Canadá), Coreano, Português (Brasil, Portugal), Italiano, Espanhol (Espanha, México), Indonésio, Holandês, Turco, Filipino, Polonês, Sueco, Búlgaro, Romeno, Árabe (Arábia Saudita, Emirados Árabes Unidos), Tcheco, Grego, Finlandês, Croata, Malaio, Eslovaco, Dinamarquês, Tâmil, Ucraniano e Russo.
Informações importantes
- Formato do texto de entrada: Apenas string simples — não envolva o texto de entrada em JSON ou qualquer outra estrutura
- Diarização: Não é compatível; fornecer texto diarizado produzirá resultados inesperados
- Preços: Mesmo valor da API de Speech to Text
- Tamanho máximo do arquivo: 3 GB
- Duração máxima do áudio: 10 horas
- Tamanho máximo do texto: 675.000 caracteres