什么是文本转语音?

文本转语音可将语音音频转换为书面文本。在 ElevenLabs,我们的文本转语音模型是 Scribe。它支持准确转录超过 90 种语言的语音,轻松将音频变成可读、可搜索的文本。

Scribe 的主要功能

  • 行业领先的准确率:英语、法语、意大利语、葡萄牙语、西班牙语和德语等主要语言的准确率达 98%。
  • 精确到单词级别的时间戳,可查看每个词的具体说话时间。
  • 智能说话人分离,可自动识别并区分不同说话人。
  • 动态音频标签,可检测非语音声音。
  • 最多支持 32 位说话人,同时保持高准确率。

Scribe v2 的新功能

Scribe v2 在核心模型基础上增加了更多功能,适用于要求更高的使用场景。

  • 关键词提示。最多可提供 100 个单词或短语,引导模型 正确转录重要术语。使用关键词提示会使费用增加 20%。
  • 实体检测。可选择要在转录文本中检测的特定信息类别, 例如信用卡号、姓名或医疗状况。实体检测 仅可通过 API 使用,费用会增加 30%。
  • 智能多语言支持。可提交包含多种语言的音频, Scribe v2 会自动检测并正确转录每种语言。
  • 稳定性提升。Scribe v2 可处理停顿、语调变化和长时间静默, 不会中断或降低准确率。

该使用哪个版本?

需要高准确率转录时,建议使用 Scribe v2。可通过我们的网站和 API 使用。通过网站使用文本转语音时,Scribe v2 是默认模型。

对于医疗和临床音频,请通过同一 API 使用 Scribe v2 Medical(scribe_v2_medical)。其计费标准与 Scribe v2 相同。

对于实时场景,建议使用 Scribe v2 Realtime,可通过 ElevenAgents 和 API 使用。

更多详情,请参阅文本转语音文档。