什么是音位?定义及英语中的 44 个音位
- 发布时间
- 最近更新
音位是语言中能够改变词义的最小语音单位。替换一个音位,就可能形成一个完全不同的词。/p/ 和 /b/ 与 /æt/ 组合后,分别构成“pat”和“bat”——两个含义完全不同的词。
在英语中,音位正是拼写与发音经常不一致的原因。例如,“fox”由 4 个不同音位构成(/f/ /ɒ/ /k/ /s/),却只有 3 个字母;而“ship”有 4 个字母,却只有 3 个音位(/ʃ/ /ɪ/ /p/)。理解音位对语言学习,以及理解现代文本转语音系统如何将书面文字转为自然语音至关重要。
本文将通过示例说明音位的定义,提供完整的 44 个英语音位表,并介绍 AI 语音技术如何通过音位级控制确保发音准确。
摘要:
- 音位是口语中能够改变词义的最小语音单位。
- 大多数语言学家认为英语有 44 个音位,包括 24 个辅音和 20 个元音。
- 音位描述语音;字位则是书面中表示音位的字母或字母组合。
- 国际音标(IPA)统一了表示音位的符号,确保这些声音的发音方式保持一致。
- 文本转语音工具会先将字位转换为音位,再生成音频文件。
什么是音位?
音位是能够区分不同词语的最小语音单位。语言学家通过寻找仅相差一个声音的两个词来识别音位,这类词称为最小对立对,例如:
- Pat / bat:/p/ 和 /b/ 是这组最小对立对中不同的音位。
- Ship / sheep:/ɪ/ 和 /iː/ 是使这两个词产生区别的音位。
- Bat / bad:/t/ 和 /d/ 是区分这两个词的不同音位。
如果一个词只改变一个声音就会形成新词,那么这两个声音在该语言中就是不同音位。如果只是让同一个词的发音略有不同,它们只是同一音位的变体。
“phoneme”一词源自希腊语 phōnēma,意为“发声”或“产生的声音”。定义音位时,这一点值得记住:音位是语音单位,不是拼写信息。正如接下来会看到的,音位不只是单个字母,而是完整的听觉声音。
英语有多少个音位?
英语通常有 44 个音位,包括 24 个辅音音位和 20 个元音音位。不过这只是一般说法。具体数量取决于口音以及语言学家如何界定不同声音;有人认为只有 42 个,也有人认为多达 45 个。例如,通用美式英语会发出“car”中的 /r/,而标准英式发音(Received Pronunciation)不会,因此两种口音的音位总数不同。
其他口音可能会合并元音,从总数中减少音位。例如,一些美国人将“cot”和“caught”发音相同的元音合并现象,会影响语言学家对总数的判断。某些边缘声音也会影响计数,例如双元音被视为组合而非单一音位时。比如,有些体系将 /ʍ/(“which”开头的带气声)算作独立音位,另一些则将其视为 /h/ 和 /w/ 的组合。
标准计数采用 44 音位模型,具体包括 24 个辅音、12 个单元音和 8 个双元音。这是英国语音教学和 ESL 教学使用的标准。
英语的 44 个音位:含示例的完整表格
辅音音位(24 个)
元音音位(12 个单元音 + 8 个双元音 = 共 20 个)
符号采用大多数自然拼读课程使用的英式英语(RP)体系;通用美式英语对卷舌元音的分析略有不同。
音位和字位有什么区别?
音位是声音,字位则是该声音的书面表示。一个字位可以是 1 个字母(c-a-t)、2 个字母(字母组合,如 sh 或 ea)、3 个字母(“night”中的 igh),或 4 个字母(“though”中的 ough)。
音位与字位的不匹配,正是英语拼写出了名困难的原因。例如:
- 一个音位,多个字位:/iː/ 音可以拼写为 ee(sheep)、ea(leaf)、e(be)、ey(key)、ie(chief)或 ei(ceiling)。
- 一个字位,多个音位:字母组合 ough 在“through”(/uː/)、“though”(/əʊ/)、“tough”(/ʌf/)和“thought”(/ɔː/)中代表不同音位。
英语虽然有 44 个音位,却有超过 200 个字位来拼写它们。与西班牙语这类字位和发音几乎一一对应的语言相比,英语的发音和转写都极其复杂。这也是文本转语音模型无法只按字母直接朗读的原因,稍后会进一步说明。

音位与同位异音
同位异音是同一音位的不同发音变体,不会改变词义。如果不存在一个音位能构成两个不同词的最小对立对,那么它就是同位异音。
例如,“pat”中的 /p/ 与“spat”中不送气的 /p/ 听起来不同。它们是不同的声音,但英语中没有仅凭送气差异就能区分的词对,因此英语母语者会将它们视为本质相同的声音。在泰语等其他语言中,送气与不送气的 /p/ 会构成不同音位,从而完全区分词义。
这意味着,什么算作音位完全取决于具体语言。关键在于声音对词义的作用,而不仅是声学特征。
音位如何驱动文本转语音
每个文本转语音系统都要解决与人脑朗读时相同的问题:先将字位转换为音位,再发声。字位到音位(G2P)转换非常困难,许多基础 TTS 系统也常在此出错。
文本可能存在歧义。同一个词“read”在现在时中可读作 /riːd/,在过去时中则读作 /red/。品牌名或技术术语等专有名词,可能完全不遵循标准拼写规则。Eleven v3 等现代 AI 模型会利用上下文解决大多数这类问题,但你也可以更细致地控制音位,以确保发音准确:
- 发音词典:定义整个项目中每个词的发音方式。尤其适合反复出现的品牌名、角色名、医学术语或公司专用词汇。
- SSML 音位标签和 IPA:在 v2 模型中,可通过 SSML 音位标签逐词控制发音;也可以直接使用 Eleven v3 音频标签来书写词语。
同一音位层也会反向发挥作用。对于语音转文本,模型需要学习声学模式,将音位序列映射出来,再组合成词。音位理解能力让模型能够转写可能从未见过的词。

如何利用音位学习语言
普通用户想进一步了解音位的主要原因之一,是它对语言学习非常有用。儿童在早期听辨或识别单个音位的能力会直接影响其后续语音知识的习得以及整个青春期的语言表达。
学习一门新语言时,大脑必须识别耳朵从未受过训练去听辨的音位。以下是几个利用音位提升语言学习效果的实用方法:
- 学习 IPA 符号:词典中的国际音标会展示每个词的发音。学会 IPA 后,即使第一次看到某个词,也知道该如何读。
- 聆听并模仿音位:放慢语速,识别语言中的每个音位并加以模仿。这有助于理解每个声音的正确发音方式,比学习语言时反复练习整句更有效。
- 用最小对立对精细练习:最小对立对之间只相差一个音位。反复练习这些示例,能训练舌头和耳朵识别并复现不同语言间哪怕很细微的差异。
AI 语音工具也让语言学习变得轻松许多。借助文本转语音生成器,你可以用数十种语言和多种地区口音的母语般声音,听到任意词语或短语。
使用 ElevenLabs 体验音位级文本转语音
无论是在学习新语言的语音学,还是在打磨母语表达,扎实理解音位都是掌握清晰、有效表达的关键。但人类学习语言并不只靠语言学理论,也通过聆听和模仿来学习。
文本转语音生成工具对于培养音位意识、建立对语音单位、完整词语及口语交流中自然包含的其他不同声音的直觉理解非常有价值。
立即使用 ElevenLabs 强大的 文本转语音技术,或了解更多我们的 创意工具套件。



