强制对齐
强制对齐
了解如何通过 ElevenLabs 将语音音频和文本转换为时间对齐的转录文本。
概述
ElevenLabs 强制对齐 API 可将语音音频和文本转换为时间对齐的转录文本。适用于已有音频录音和转录文本,但需要获得转录文本中每个词或短语精确时间戳的场景。可用于:
- 将字幕与视频录制内容匹配
- 为电子书的有声书录音生成时间信息
使用方式
可直接调用 ElevenLabs API 来使用强制对齐 API。
支持的语言
多语言 v2 模型支持 29 种语言:
英语(美国、英国、澳大利亚、加拿大)、日语、中文、德语、印地语、法语(法国、加拿大)、韩语、葡萄牙语(巴西、葡萄牙)、意大利语、西班牙语(西班牙、墨西哥)、印尼语、荷兰语、土耳其语、菲律宾语、波兰语、瑞典语、保加利亚语、罗马尼亚语、阿拉伯语(沙特阿拉伯、阿联酋)、捷克语、希腊语、芬兰语、克罗地亚语、马来语、斯洛伐克语、丹麦语、泰米尔语、乌克兰语和俄语。
重要说明
- 输入文本格式:仅支持纯字符串,不要将输入文本包装为 JSON 或其他结构
- 说话人分离:不支持;提供已分离说话人的文本会产生意外结果
- 定价:与语音转文本 API费率相同
- 最大文件大小:3 GB
- 最长音频时长:10 小时
- 最大文本长度:675,000 个字符