语音转文本

了解如何使用 ElevenLabs 转录音频

文本转语音产品功能

概述

使用语音转文本,你可以以先进的准确度将语音音频转录为文本。借助自动语言检测,可转录多种语言的音频。

创建转录文本

1

上传音频

在 ElevenLabs 控制台中,前往语音转文本页面,然后点击“转录文件”按钮。在弹窗中,可上传要转录的音频或视频文件。

语音转文本上传

2

选择选项

  • 如果知道音频的主要语言,请选择该语言。也可保留为“检测”,系统会自动检测音频中的所有语言。

  • 使用“标记音频事件”开关,选择是否标记笑声或掌声等音频事件。

  • 关键词提示可让你添加最多 1000 个词或短语,使模型更倾向于转录这些内容。这对于转录音频中不常见的特定词语或句子很有帮助,例如产品名称、姓名或其他专用术语。

准备好后,点击“上传文件”按钮提交。

3

查看结果

点击中间面板中上传的音频文件名查看结果。点击某个词即可从该位置开始播放音频。

点击右上角的“导出”按钮,可下载多种格式的结果。

转录文本编辑器

创建转录文本后,可在转录文本编辑器中进行编辑。请在本指南中了解更多。

常见问题

可以,该工具支持上传音频和视频文件。两者的最大文件大小均为 3GB。

重命名说话人

可以,点击“说话人”标签旁的“编辑”按钮即可重命名说话人。

文本转语音可将语音音频转换为书面文本。在 ElevenLabs,我们的文本转语音模型是 Scribe。它支持准确转录超过 90 种语言的语音,轻松将音频变成可读、可搜索的文本。

Scribe 的主要功能

  • 行业领先的准确率:英语、法语、意大利语、葡萄牙语、西班牙语和德语等主要语言的准确率达 98%。
  • 精确到单词级别的时间戳,可查看每个词的具体说话时间。
  • 智能说话人分离,可自动识别并区分不同说话人。
  • 动态音频标签,可检测非语音声音。
  • 最多支持 32 位说话人,同时保持高准确率。

Scribe v2 的新功能

Scribe v2 在核心模型基础上增加了更多功能,适用于要求更高的使用场景。

  • 关键词提示。最多可提供 100 个单词或短语,引导模型 正确转录重要术语。使用关键词提示会使费用增加 20%。
  • 实体检测。可选择要在转录文本中检测的特定信息类别, 例如信用卡号、姓名或医疗状况。实体检测 仅可通过 API 使用,费用会增加 30%。
  • 智能多语言支持。可提交包含多种语言的音频, Scribe v2 会自动检测并正确转录每种语言。
  • 稳定性提升。Scribe v2 可处理停顿、语调变化和长时间静默, 不会中断或降低准确率。

该使用哪个版本?

需要高准确率转录时,建议使用 Scribe v2。可通过我们的网站和 API 使用。通过网站使用文本转语音时,Scribe v2 是默认模型。

对于医疗和临床音频,请通过同一 API 使用 Scribe v2 Medical(scribe_v2_medical)。其计费标准与 Scribe v2 相同。

对于实时场景,建议使用 Scribe v2 Realtime,可通过 ElevenAgents 和 API 使用。

更多详情,请参阅文本转语音文档。

文本转语音支持超过 90 种语言。 

如需查看完整的支持语言列表,请参阅文本转语音文档中的语言支持部分。

并发限制(并行运行的并发请求)取决于订阅方案,以及使用的是语音转文本还是实时语音转文本。

以下是当前语音转文本的并发限制。

方案语音转文本并发限制实时语音转文本并发限制
免费版86
Starter129
Creator2015
Pro4030
Scale6045
商业版6045
企业版更高更高

如需更多并发请求,请通过此网页直接联系企业版团队。我们很乐意讨论满足具体需求的定制方案。

No results