文本转语音 API
转录
音乐
音效
语音引擎
在古老的埃尔多利亚大地上,天空闪烁着光芒,森林向风儿低语着秘密,住着一条名叫Zephyros的龙。[sarcastically] 不是那种“烧光一切”的龙……[giggles] 但他温柔、智慧,眼睛像古老的星辰。[whispers] 连鸟儿经过时也会沉默。
- Lovable
- Synthesia
- Stripe
- Perplexity
- Twilio
为全球领先企业和品牌赋能
“从本地语言配音 Reels,到在 Horizon 生成音乐和角色声音,ElevenLabs 平台让全球创作者、企业和机构都能大规模使用语音、音乐和音效。”
“每天有数百万人在 YouTube 和 Twitch 上向 Hikaru、Levy、Magnus 等创作者学习国际象棋。现在,在 Chess.com 也能以沉浸、个性化且富有特色的方式向他们学习。我们的目标是打造一位能因材施教、欢迎各水平玩家、让国际象棋变得易懂又有趣的教练。有了 ElevenLabs 和这些全新声音,我们离这个目标更近了一步。”
“我们选择 ElevenLabs 做语音转录,是因为他们的模型非常精准”
“Twilio 已将 ElevenLabs 的生成式 AI 语音技术集成到其 CPaaS,增强了 ConversationRelay。该集成让企业和开发者可直接在 Twilio CPaaS 平台创建拟人、富有表现力、实时响应的对话式 AI 语音交互。ElevenLabs 很高兴被 Twilio 选中,用最具表现力、最自然的声音提升 ConversationRelay。”
为生产环境打造的 API

常见问题
ElevenLabs API 为语音、音乐、音效、配音和转录等 AI 模型提供编程访问。可将这些能力直接集成到应用、工作流和生产流程中。
文本转语音(TTS):将文本转为富有细腻语调、节奏和情感的自然音频。
语音转文本(转录):以业界领先的准确率将语音音频转为文本。
音乐:根据文本生成音乐。
Studio:通过 API 管理 ElevenLabs Studio 项目。
文本转对话:将文本生成自然对话。
变声器:将一种声音替换为另一种。
人声分离(音频分离):从音频中分离人声。
配音:为音频和视频无缝配音(支持翻译和多语言旁白)。
音效:根据文本描述生成电影级音效。
声音设计:当库中没有所需声音时,可用提示词自定义 AI 声音。
声音混音:变换和增强现有声音(调整音色或风格)。
强制对齐:将文本与音频对齐(获取音频和转录的精确词级时间戳)。
发音词典:自定义 TTS 模型对特定词语或短语的发音(上传词典文件控制发音)。
Audio Native:可嵌入的音频播放器,自动用 ElevenLabs TTS 服务朗读网页内容。
智能体平台(语音智能体):部署交互式语音智能体。支持构建、发布和管理 AI 驱动的语音智能体(包含对话、知识库、电话集成等组件)。
常见场景包括内容本地化流程、自动化视频制作、对话界面、无障碍工具和培训内容生成。API 支持实时和批量处理。
所有 API 请求都需在 xi-api-key 头中传递 API 密钥。密钥可在账户设置中生成,并可限定到指定工作区。
使用限制因套餐和接口不同而异。从 Starter 套餐及以上支持按量计费。
有。官方 SDK 支持 Python 和 JavaScript/TypeScript,Agents 平台还支持 Flutter、Swift、Kotlin 等。
文本转语音按字符计费。语音转文本按音频分钟计费。音乐和音效按生成次数计费。配音按源音频分钟计费。
可以。可通过 ID 调用声音库中的任意声音,包括专业声音、克隆声音和自定义声音。
可以。通过 ElevenLabs 模型 API 生成的内容均可商用。音乐用于广告、影视、游戏和企业分发需额外授权。
文本转语音流式响应通常低于 500 毫秒。语音转文本处理速度为音频时长的 20-50 倍,具体取决于文件大小。配音和音乐为批量处理,耗时与内容长度成正比。
支持。文本转语音和语音转文本均支持流式输出,可用于实时应用。
API 返回标准 HTTP 状态码。限流错误返回 429,无效请求返回 400 并附错误详情,认证失败返回 401。
完整 API 参考、代码示例和集成指南请访问 elevenlabs.io/docs/api-reference
有。企业套餐包含专属支持、SLA、定制限额、SSO、SOC 2 合规和 MSA。






