跳至内容

语音转文本 API

使用 ElevenLabs Scribe v2 转录语音

批量应用场景下的最高准确率语音转文本。可识别重音和音效,并支持通过关键词提示优化转写。

Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!

  • Lovable
  • Veed model
  • Synthesia
  • Stripe
  • Perplexity
  • Twilio

批量处理场景下最精准的语音转文本 API

通过 API,为播客、视频、访谈等录音内容生成字幕、编辑文本和可编辑转录稿,行业领先的准确率。

Scribe v2 提供行业领先的转录准确率,即使面对复杂音频环境或多样口音,也能生成清晰、可编辑的文本。

出色的转录准确率

Scribe v2 提供行业领先的转录准确率,即使面对复杂音频环境或多样口音,也能生成清晰、可编辑的文本。

Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!

适用于各种场景

即使在嘈杂环境、有背景音乐、口音浓重或音频质量较低时,也能准确转录。

精细控制时间、说话人和非语音事件

ElevenLabs 转录 API 可检测笑声、情绪和音效。通过关键术语提示,引导模型识别特定领域术语。

转录音频和视频

上传 MP3、MP4、WAV、MOV 等常见格式。Scribe 支持最长 10 小时的文件,并可通过异步处理和 webhook 通知处理大批量任务。
Transcription Formats

清晰、可编辑的转录文本

获取标点规范、段落清晰的文本,可直接编辑、发布或用于后续处理,无需额外清理。
Editable transcripts

关键术语提示

最多可提升 100 个特定领域术语的识别准确率。产品名称、技术术语和专业词汇首次转录即可准确识别。
Keyterm Prompting

动态音频标签

捕捉笑声、掌声、音乐和背景噪音等非语音事件。转录文本保留完整音频上下文,不只是文字内容。

智能说话人分离

自动识别并标记最多 48 位说话人,清晰区分每句话由谁说出,生成易读的转录文本。

实体检测

自动识别并标记转录文本中的 56 类实体,包括姓名、日期、地点和组织。

使用 Scribe v2 Medical 转录临床音频

专为医学转录和临床 workflow 优化的文本转语音模型,可增强识别药品名称、解剖学和病理学术语。

Medication renewal message flags metformin 500mg and asks about continued levothyroxine.

转录临床语音

将医患对话、医生口述和患者接诊信息转为精准文本,方便临床医生审核,并用于病历记录、编码及后续文档 workflow。

减少医学术语错误

在 Eka Medical ASR 测试集上,Scribe v2 Medical 的术语词错率比 Scribe v2 低 15%,能更准确识别临床词汇中的医学语音。

Abstract gray textured background with soft diagonal light and dark bands.

Scribe v2

准确率最高,专为批量任务设计。

  • 准确率超过 95%
  • 90+ 种语言
  • 非语音事件检测
  • 实体检测
  • 关键术语提示
Abstract grayscale bands of soft light and shadow sweeping diagonally.

Scribe v2 Realtime

延迟最低,适合实时任务。

  • 延迟低于 150 ms
  • 90+ 种语言
  • 流式转录
  • 语音活动检测
  • 自动语言识别
Abstract grayscale texture with diagonal streaks and a soft gradient from dark to light.

Scribe v2 Medical

医学 Finetune,适用于临床转录。

  • 医学词汇调优
  • 支持 90+ 种语言转录
  • 日常语音表现与 Scribe v2 相当
  • 提升药品名称识别能力
  • 企业版客户可符合 HIPAA 要求

转录超过 90 种语言和多种口音的语音

在各种口音、方言和录音条件下均具备出色准确率。

更改 languageCode 预览语言

import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({
	apiKey: "<your_api_key>"
});
const response = await fetch(
  "https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });

const transcription = await	elevenlabs
	.speechToText.convert({
	  file: audioBlob,
	  modelId: "scribe_v2",
	  tagAudioEvents: true,
	  languageCode: 
, // 设置语言 diarize: true }); console.log(transcription);
Flag for en
英语
Flag for zh
中文
Flag for es
西班牙语
Flag for fr
法语
Flag for pt
葡萄牙语
Flag for de
德语
Flag for ja
日语
Flag for it
意大利语
Flag for hi
印地语
Flag for en
英语点击试听

为全球领先企业和品牌提供支持

  • 从为 Reels 制作本地语言配音,到为 Horizon 生成音乐和角色声音,ElevenLabs 平台让全球创作者、企业和组织能够大规模构建语音、音乐和声音体验。
    Meta Color Logo
  • Scribe 在众多语言中具备无与伦比的准确率,让 Fieldy 能理解每天的每一段对话,并轻松拓展至不同大洲。迁移至 ElevenLabs Scribe 后,Fieldy 的用户留存率提升了 50%。
    Fieldy logo
  • ElevenLabs 让我们能轻松快速地将强大的文本转语音功能引入 SDK,使智能体能以富有表现力的声音实时回答用户问题,或针对其所见内容提供反馈。
    Stream Color Logo
  • Twilio 已将 ElevenLabs 的生成式 AI 语音技术集成到其 CPaaS 中,增强了 ConversationRelay。这项集成让企业和开发者可直接通过 Twilio CPaaS 平台,创建听起来自然、富有表现力且能实时响应的对话式 AI 语音交互。ElevenLabs 很高兴 Twilio 选择我们,以目前最具表现力、最接近真人的语音增强 ConversationRelay。
    Twilio logo

专为生产环境打造的 API

Enterprise data protection developers

数据在传输和静态存储时均经过加密,支持符合 SOC 2、HIPAA 和 GDPR 要求。还提供欧盟数据驻留和零保留模式,实现更严格的数据控制。

数据在传输和静态存储时均经过加密,支持符合 SOC 2、HIPAA 和 GDPR 要求。还提供欧盟数据驻留和零保留模式,实现更严格的数据控制。

SDKs

官方 Python 和 TypeScript SDK,支持类型安全、流式传输,并提供清晰示例。

团队将确保顺利上线并稳定运行,为你提供一致的性能和安心保障。

常见问题

最新动态

    最逼真的音频 AI 平台