语音转文本
语音转文本
了解如何使用 ElevenLabs 将语音音频转为文本。
概览
ElevenLabs 语音转文本(STT)API 可将语音音频以业界领先的准确度转换为文本。我们的 Scribe v2 模型 能适应超过 90 种语言和多种语音风格中的文本线索。如需体验实时演示,请访问 语音转文本 展示页面。
需要符合 HIPAA 要求的公司必须联系 ElevenLabs 销售团队,签署商业伙伴协议(BAA)。 在进行任何与 HIPAA 相关的集成或部署前,请确保已完成此步骤。
模型
API 响应示例
以下示例展示了使用 Scribe v2 模型处理示例音频文件时,语音转文本 API 的输出。
查看完整 JSON 响应
输出分为以下 3 种类别:
word:音频所用语言中的单词spacing:单词之间的空格,不适用于日语、普通话、泰语、老挝语、缅甸语和粤语等不使用空格的语言audio_event:笑声或掌声等非语音声音
并发与优先级
并发是指可同时处理的请求数量。
对于语音转文本,时长超过 8 分钟的文件会在内部并行转录,以加快处理速度。音频会被分成 4 个片段并发转录。
可按以下公式计算并发限制:
例如,15 分钟的音频文件将以 2 的并发数转录,而 120 分钟的音频文件将以 4 的并发数转录。
以上计算仅适用于 Scribe v2 和 Scribe v2 Medical。对于 Scribe v2 Realtime,请参阅并发限制图表。
高级功能
关键词提示和转录文本编辑需额外付费。详细定价信息请参阅 API 定价 页面。
关键词提示
Scribe v2、Scribe v2 Medical(批处理)和 Scribe v2 Realtime 支持关键词提示。
突出显示单词或短语,让模型更倾向于转录它们。这对于转录音频中不常见的特定单词或句子非常有用,例如产品名称、人名或其他特定术语。关键词比其他模型提供的偏置关键词或自定义词汇更强大,因为它会依靠上下文判断是否应转录该术语。批处理最多支持 1000 个关键词(每个 50 个字符),实时模式最多支持 50 个关键词(每个 20 个字符)。
如需了解如何使用关键词提示,请参阅关键词提示文档。
非逐字模式
Scribe v2、Scribe v2 Medical(批处理)和 Scribe v2 Realtime 支持非逐字模式。
启用 no_verbatim 后,模型会从转录文本中移除填充词、错误起句和不流畅表达。这样可生成更整洁的输出,适用于字幕、摘要或任何重视可读性胜过逐字记录的场景。
实体检测
批处理模型和 Scribe v2 Realtime 可检测转录文本中的多类实体,并提供精确时间戳。这对于突出显示信用卡号、姓名、疾病或社会保障号非常有用。
完整的支持实体列表请参阅实体检测文档。
转录文本编辑
转录文本编辑是一项实验性功能,所有批处理模型和 Scribe v2 Realtime 均可使用。
通过 transcript_edit 参数传入自然语言指令,系统会将其应用于完成的转录文本。编辑后的文本会与原始转录文本一同在 edited_transcript 中返回,因此时间戳和说话人标签会保持不变。该功能适合统一日期、时间或单位的写法、应用不同风格,或通过一次请求重写转录文本。
如需了解更多,请参阅转录文本编辑文档和实时转录文本编辑指南。
支持的语言
Scribe v2 支持 90+ 种语言,包括:
南非荷兰语(afr)、阿姆哈拉语(amh)、阿拉伯语(ara)、亚美尼亚语(hye)、阿萨姆语(asm)、阿斯图里亚斯语(ast)、阿塞拜疆语(aze)、白俄罗斯语(bel)、孟加拉语(ben)、波斯尼亚语(bos)、保加利亚语(bul)、缅甸语(mya)、粤语(yue)、加泰罗尼亚语(cat)、宿务语(ceb)、齐切瓦语(nya)、克罗地亚语(hrv)、捷克语(ces)、丹麦语(dan)、荷兰语(nld)、英语(eng)、爱沙尼亚语(est)、菲律宾语(fil)、芬兰语(fin)、法语(fra)、富拉语(ful)、加利西亚语(glg)、干达语(lug)、格鲁吉亚语(kat)、德语(deu)、希腊语(ell)、古吉拉特语(guj)、豪萨语(hau)、希伯来语(heb)、印地语(hin)、匈牙利语(hun)、冰岛语(isl)、伊博语(ibo)、印尼语(ind)、爱尔兰语(gle)、意大利语(ita)、日语(jpn)、爪哇语(jav)、佛得角克里奥尔语(kea)、卡纳达语(kan)、哈萨克语(kaz)、高棉语(khm)、韩语(kor)、库尔德语(kur)、吉尔吉斯语(kir)、老挝语(lao)、拉脱维亚语(lav)、林加拉语(lin)、立陶宛语(lit)、卢奥语(luo)、卢森堡语(ltz)、马其顿语(mkd)、马来语(msa)、马拉雅拉姆语(mal)、马耳他语(mlt)、普通话(zho)、毛利语(mri)、马拉地语(mar)、蒙古语(mon)、尼泊尔语(nep)、北索托语(nso)、挪威语(nor)、奥克语(oci)、奥里亚语(ori)、普什图语(pus)、波斯语(fas)、波兰语(pol)、葡萄牙语(por)、旁遮普语(pan)、罗马尼亚语(ron)、俄语(rus)、塞尔维亚语(srp)、绍纳语(sna)、信德语(snd)、僧伽罗语(sin)、斯洛伐克语(slk)、斯洛文尼亚语(slv)、索马里语(som)、西班牙语(spa)、斯瓦希里语(swa)、瑞典语(swe)、泰米尔语(tam)、塔吉克语(tgk)、泰卢固语(tel)、泰语(tha)、土耳其语(tur)、乌克兰语(ukr)、翁本杜语(umb)、乌尔都语(urd)、乌兹别克语(uzb)、越南语(vie)、威尔士语(cym)、沃洛夫语(wol)、科萨语(xho)和祖鲁语(zul)。
语言支持详情
词错误率(WER)是评估转录系统准确度的关键指标。它衡量转录文本与参考文本相比存在多少错误。以下是 Scribe v2 支持的各语言 WER 详情。
优秀(≤ 5% WER)
白俄罗斯语(bel)、波斯尼亚语(bos)、保加利亚语(bul)、加泰罗尼亚语(cat)、克罗地亚语(hrv)、捷克语(ces)、 丹麦语(dan)、荷兰语(nld)、英语(eng)、爱沙尼亚语(est)、芬兰语(fin)、法语(fra)、加利西亚语 (glg)、德语(deu)、希腊语(ell)、匈牙利语(hun)、冰岛语(isl)、印尼语(ind)、意大利语 (ita)、日语(jpn)、卡纳达语(kan)、拉脱维亚语(lav)、马其顿语(mkd)、马来语(msa)、马拉雅拉姆语 (mal)、挪威语(nor)、波兰语(pol)、葡萄牙语(por)、罗马尼亚语(ron)、俄语(rus)、斯洛伐克语 (slk)、西班牙语(spa)、瑞典语(swe)、土耳其语(tur)、乌克兰语(ukr)和越南语(vie)。
高准确度(>5% 至 ≤10% WER)
亚美尼亚语(hye)、阿塞拜疆语(aze)、孟加拉语(ben)、粤语(yue)、菲律宾语(fil)、格鲁吉亚语 (kat)、古吉拉特语(guj)、印地语(hin)、哈萨克语(kaz)、立陶宛语(lit)、马耳他语(mlt)、普通话 (cmn)、马拉地语(mar)、尼泊尔语(nep)、奥里亚语(ori)、波斯语(fas)、塞尔维亚语(srp)、斯洛文尼亚语(slv)、 斯瓦希里语(swa)、泰米尔语(tam)和泰卢固语(tel)
良好(>10% 至 ≤20% WER)
南非荷兰语(afr)、阿拉伯语(ara)、阿萨姆语(asm)、阿斯图里亚斯语(ast)、缅甸语(mya)、豪萨语(hau)、 希伯来语(heb)、爪哇语(jav)、韩语(kor)、吉尔吉斯语(kir)、卢森堡语(ltz)、毛利语(mri)、 奥克语(oci)、旁遮普语(pan)、塔吉克语(tgk)、泰语(tha)、乌兹别克语(uzb)和威尔士语(cym)。
中等(>25% 至 ≤50% WER)
阿姆哈拉语(amh)、干达语(lug)、伊博语(ibo)、爱尔兰语(gle)、高棉语(khm)、库尔德语(kur)、老挝语(lao)、 蒙古语(mon)、北索托语(nso)、普什图语(pus)、绍纳语(sna)、信德语(snd)、僧伽罗语(sin)、 索马里语(som)、乌尔都语(urd)、沃洛夫语(wol)、科萨语(xho)、约鲁巴语(yor)和祖鲁语(zul)。
常见问题
可以将语音转文本 API 用于视频文件吗?
可以,API 支持上传音频和视频文件进行转录。
语音转文本 API 对文件大小和时长有哪些限制?
支持最大 3 GB 的文件。时长限制取决于转录模式:
- 标准模式(
use_multi_channel=false):最长 10 小时 - 多声道模式(
use_multi_channel=true):所有声道的总时长必须少于 10 小时
API 支持哪些音频和视频格式?
API 支持以下音频和视频格式:
- audio/aac
- audio/x-aac
- audio/x-aiff
- audio/ogg
- audio/mpeg
- audio/mp3
- audio/mpeg3
- audio/x-mpeg-3
- audio/opus
- audio/wav
- audio/x-wav
- audio/webm
- audio/flac
- audio/x-flac
- audio/mp4
- audio/aiff
- audio/x-m4a
支持的视频格式包括:
- video/mp4
- video/x-msvideo
- video/x-matroska
- video/quicktime
- video/x-ms-wmv
- video/x-flv
- video/webm
- video/mpeg
- video/3gpp
何时会支持更多语言?
ElevenLabs 持续扩展模型支持的语言数量。请经常回来查看更新。
语音转文本 API 支持 webhook 吗?
可以,异步转录结果可发送至在 UI 的 webhook 设置中配置的 webhook。详情请参阅 webhook 指南。
语音转文本 API 如何计费?
ElevenLabs 根据提交转录的音频时长收取语音转文本费用。费用按每小时音频计算,费率因套餐和模型而异。详细定价信息请参阅 API 定价页面。
重要信息
- 支持的输入:接受音频和视频文件
- 最大文件大小:3 GB
- 最长时长:10 小时(标准模式)、1 小时(多声道模式)
- 多声道模式:最多 5 个声道;每个声道独立处理,并按声道编号分配说话人 ID
- Webhook:异步转录结果可发送至 webhook,在工作区设置中配置
- 支持的音频格式:AAC、AIFF、OGG、MP3、OPUS、WAV、FLAC、M4A、WebM
- 支持的视频格式:MP4、AVI、MKV、MOV、WMV、FLV、WebM、MPEG、3GPP