强制对齐

了解如何通过 ElevenLabs 将语音音频和文本转换为时间对齐的转录文本。

概述

ElevenLabs 强制对齐 API 可将语音音频和文本转换为时间对齐的转录文本。适用于已有音频录音和转录文本,但需要获得转录文本中每个词或短语精确时间戳的场景。可用于:

  • 将字幕与视频录制内容匹配
  • 为电子书的有声书录音生成时间信息

使用方式

可直接调用 ElevenLabs API 来使用强制对齐 API。

支持的语言

多语言 v2 模型支持 29 种语言:

英语(美国、英国、澳大利亚、加拿大)、日语、中文、德语、印地语、法语(法国、加拿大)、韩语、葡萄牙语(巴西、葡萄牙)、意大利语、西班牙语(西班牙、墨西哥)、印尼语、荷兰语、土耳其语、菲律宾语、波兰语、瑞典语、保加利亚语、罗马尼亚语、阿拉伯语(沙特阿拉伯、阿联酋)、捷克语、希腊语、芬兰语、克罗地亚语、马来语、斯洛伐克语、丹麦语、泰米尔语、乌克兰语和俄语。

重要说明

  • 输入文本格式:仅支持纯字符串,不要将输入文本包装为 JSON 或其他结构
  • 说话人分离:不支持;提供已分离说话人的文本会产生意外结果
  • 定价:与语音转文本 API费率相同
  • 最大文件大小:3 GB
  • 最长音频时长:10 小时
  • 最大文本长度:675,000 个字符