4.7 星
5 万+ 评价
100 万+ 用户
信赖 ElevenLabs
99+
语言
不仅仅是转写,为视频而生。
ElevenLabs 视频转文本可识别说话人、发言时间及周围环境,每次都能输出结构化、可用的转写文本。
行业领先准确率
Scribe 在准确率基准测试中领先竞品模型,可直接从现场录音、多人讨论和手持拍摄的视频博客素材中提取引文,无需后期清理。
编辑转写文本
可直接在转写稿中修改词语、拆分片段或重新分配说话人。词级时间戳可将每项修改精确锁定到对应画面帧。


99+ 种语言和口音
Scribe 可自动检测语言,并转写超过 90 种语言,包括马拉雅拉姆语、粤语和塞尔维亚语,让多语种纪录片素材始终在同一 workflow 中处理。
支持多种视频格式
上传 MP4、MOV、AVI 或 MKV 视频,也可上传 WAV、MP3 等音频。导出 TXT、DOCX 或 PDF 供审核,导出 SRT 或 VTT 用于字幕。
音频事件标记
笑声、掌声和环境氛围变化都会在相应位置标记,可直接从页面查看网络研讨会中的观众反应,或纪录片中的情绪变化。
说话人时间戳
最多 32 个说话人标签和词级时间戳,可将多人讨论录音转为易读的脚本,每一行都对应素材中的准确时间点。
只需 3 步,从原始素材到文本剪辑稿
上传视频
将相机存储卡、硬盘或云端中的 MP4、MOV、AVI 或 MKV 直接拖入即可。无需先创建代理文件、重新编码或转换格式。
Scribe 自动处理
Scribe 可为最多 32 位说话人添加词级时间戳。超过 8 分钟的文件会并行处理,因此 90 分钟的网络研讨会也能快速完成。
下载结构化文本
搜索转写稿可跳转到任意时间点,标记精选片段制作文本剪辑稿,并导出与剪辑时间轴同步的 SRT 或 VTT 字幕。
已转写数百万词,持续增长中
“我主要用 ElevenLabs 转写音频消息,准确率非常突出。即使说话人是刚学会阅读的小学生,也能精准分析阅读流利度,这对了解每个学生的进步很关键。”

Pedro A.
技术负责人
“非常适合访谈转写,准备演讲时语音质量也很棒。”

Izabela M.
客户体验研究员
“ElevenLabs Scribe v2 推理速度极快,转写几乎实时,远超我们用过的其他模型。”

Vedaswaroop I.
创始人
视频转文本,零成本起步
常见问题
支持 MP4、MOV、AVI 和 MKV,也支持 MP3、WAV、FLAC 等音频格式,方便单独转写音轨。可直接上传相机导出的文件或导出队列中的文件,无需先转换格式、创建代理文件或重新编码。
AI 秒级处理视频文件,长片也快。Scribe 可极速输出高精度、带说话人标签的转写文本。
可直接在转写编辑器中修改词语、拆分或合并片段,或重新分配说话人。词级时间戳可将每项修改精确锁定到对应画面帧,让文本与素材保持同步。编辑后的转写稿可直接导出为字幕或文本剪辑稿,无需再次清理。
Scribe 的词错误率准确度处于领先水平,提供的不只是文字:最多 32 个说话人标签、词级时间戳,以及笑声、掌声等音频事件标签。借助这些结构化信息,可在 2 小时录音中搜索某句引文、直接从页面制作文本剪辑稿,并导出与剪辑时间轴同步的字幕,支持超过 90 种语言。
可导出已设置时间轴的 SRT 或 VTT 文件,直接上传至 YouTube 或 Vimeo,或导入 Premiere Pro、Final Cut Pro 或 DaVinci Resolve。脚本、节目说明和归档文件可下载为 TXT、DOCX、PDF、JSON 或 HTML。所有格式都会保留必要的说话人标签和时间戳。





