- Lovable
- Veed model
- Synthesia
- Stripe
- Perplexity
- Twilio
出色的转录准确率
Scribe v2 提供行业领先的转录准确率,即使面对复杂音频环境或多样口音,也能生成清晰、可编辑的文本。
适用于各种场景
即使在嘈杂环境、有背景音乐、口音浓重或音频质量较低时,也能准确转录。
精细控制时间、说话人和非语音事件
ElevenLabs 转录 API 可检测笑声、情绪和音效。通过关键术语提示,引导模型识别特定领域术语。
转录音频和视频
上传 MP3、MP4、WAV、MOV 等常见格式。Scribe 支持最长 10 小时的文件,并可通过异步处理和 webhook 通知处理大批量任务。
.webp&w=3840&q=95)
清晰、可编辑的转录文本
获取标点规范、段落清晰的文本,可直接编辑、发布或用于后续处理,无需额外清理。
.webp&w=3840&q=95)
关键术语提示
最多可提升 100 个特定领域术语的识别准确率。产品名称、技术术语和专业词汇首次转录即可准确识别。

动态音频标签
捕捉笑声、掌声、音乐和背景噪音等非语音事件。转录文本保留完整音频上下文,不只是文字内容。
智能说话人分离
自动识别并标记最多 48 位说话人,清晰区分每句话由谁说出,生成易读的转录文本。
实体检测
自动识别并标记转录文本中的 56 类实体,包括姓名、日期、地点和组织。
使用 Scribe v2 Medical 转录临床音频
专为医学转录和临床 workflow 优化的文本转语音模型,可增强识别药品名称、解剖学和病理学术语。

转录临床语音
将医患对话、医生口述和患者接诊信息转为精准文本,方便临床医生审核,并用于病历记录、编码及后续文档 workflow。

减少医学术语错误
在 Eka Medical ASR 测试集上,Scribe v2 Medical 的术语词错率比 Scribe v2 低 15%,能更准确识别临床词汇中的医学语音。
转录超过 90 种语言和多种口音的语音
在各种口音、方言和录音条件下均具备出色准确率。
更改 languageCode 预览语言
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";
const elevenlabs = new ElevenLabsClient({
apiKey: "<your_api_key>"
});
const response = await fetch(
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });
const transcription = await elevenlabs
.speechToText.convert({
file: audioBlob,
modelId: "scribe_v2",
tagAudioEvents: true,
languageCode: , // 设置语言
diarize: true
});
console.log(transcription);英语
中文
西班牙语
法语
葡萄牙语
德语
日语
意大利语
印地语
英语点击试听





