什么是音位?定义及英语中的 44 个音位
- 发布时间
- 最近更新
音位是语言中能够改变词义的最小语音单位。替换一个音位,就可能变成完全不同的词。/p/ 和 /b/ 与 /æt/ 组合后,分别构成 “pat” 和 “bat” 两个含义完全不同的词。
在英语中,音位正是拼写与发音经常不一致的原因。例如,“fox” 由 4 个不同的音位组成(/f/ /ɒ/ /k/ /s/),却只有 3 个字母;而 “ship” 有 4 个字母,却只有 3 个音位(/ʃ/ /ɪ/ /p/)。理解音位对于语言学习,以及了解现代文本转语音系统如何将书面文字转化为自然流畅的语音至关重要。
本文将通过示例说明音位的定义,提供完整的英语 44 个音位表,并介绍 AI 语音技术如何通过音位级控制来确保发音准确。
摘要:
- 音位是口语中能够改变词义的最小语音单位。
- 大多数语言学家认为英语有 44 个音位,包括 24 个辅音和 20 个元音。
- 音位描述语音,字位则是书面中表示音位的字母或字母组合。
- 国际音标(IPA)规范了表示音位的符号,确保这些语音的发音一致。
- 文本转语音工具会先将字位转换为音位,再生成音频文件。
什么是音位?
音位是能将一个词与另一个词区分开的最小语音单位。语言学家通过寻找仅相差一个语音的两个词来识别音位,这类词称为最小对立体,例如:
- Pat / bat:/p/ 和 /b/ 是这组最小对立体中不同的音位。
- Ship / sheep:/ɪ/ 和 /iː/ 是让这两个词产生变化的音位。
- Bat / bad:/t/ 和 /d/ 是区分这两个词的不同音位。
如果一个词只改变一个语音就变成新词,那么这两个语音在该语言中就是独立音位。如果只是让同一个词的发音略有不同,它们就只是同一音位的变体。
“phoneme” 一词源于希腊语 phōnēma,意为“发声”或“声音”。这一点有助于理解音位的定义:音位是语音单位,而非拼写信息。正如接下来会看到的,音位不只是单个字母,还涵盖完整的听觉语音。
英语有多少个音位?
英语通常有 44 个音位,包括 24 个辅音音位和 20 个元音音位。但这只是大致统计。具体数量会因口音以及语言学家对不同语音的划分方式而异,有人认为最少为 42 个,最多为 45 个。例如,通用美式英语会发出 “car” 中的 /r/,而标准英式发音(Received Pronunciation)不会,因此两种口音的总数不同。
其他口音可能会合并元音,从而减少音位总数。例如,一些美国人将 “cot” 和 “caught” 发成相同的音,这会影响语言学家对总数的判断。一些边缘语音也会影响统计,例如将双元音视为组合而非单一音位。比如,有些体系将 /ʍ/(“which” 开头带气息的声音)视为独立音位,另一些则将其视为 /h/ 和 /w/ 的组合。
标准统计采用 44 音位模型,具体包括 24 个辅音、12 个单元音和 8 个双元音。这是英国语音教学和 ESL 教学中使用的标准。
英语中的 44 个音位:含示例的完整表格
辅音音位(24 个)
元音音位(12 个单元音 + 8 个双元音 = 共 20 个)
符号采用大多数自然拼读课程使用的英式英语(RP)体系;通用美式英语对卷舌元音的分析略有不同。
音位和字位有什么区别?
音位是语音,字位则是该语音的书面表示。一个字位可以是 1 个字母(c-a-t)、2 个字母(双字母组合,如 sh 或 ea)、3 个字母(如 “night” 中的 igh),或 4 个字母(如 “though” 中的 ough)。
音位和字位的不对应,正是英语拼写出了名难学的原因。例如:
- 一个音位,多个字位:/iː/ 可以拼写为 ee(sheep)、ea(leaf)、e(be)、ey(key)、ie(chief)或 ei(ceiling)。
- 一个字位,多个音位:字母组合 ough 在 “through”(/uː/)、“though”(/əʊ/)、“tough”(/ʌf/)和 “thought”(/ɔː/)中表示不同的音位。
英语虽然有 44 个音位,却有超过 200 个字位来拼写它们。相比西班牙语这类字母与发音几乎一一对应的语言,英语的口语和转写都极为复杂。这也是文本转语音模型不能只按字母直接朗读的原因,稍后会进一步说明。

音位与音位变体
音位变体是同一音位的不同发音,不会改变词义。如果不存在某个最小对立体能让一个音位形成两个不同的词,那么它就是音位变体。
例如,“pat” 中的 /p/ 与 “spat” 中不送气的 /p/ 听起来不同。它们是不同的语音,但英语中没有任何一对词仅凭送气与否来区分,因此英语母语者会将它们视为本质上相同的声音。在泰语等语言中,送气与不送气的 /p/ 则构成不同音位,能完全区分词义。
这说明什么算作音位完全取决于具体语言。关键在于语音如何影响词义,而不只是声学差异。
音位如何驱动文本转语音
每个文本转语音系统都需要解决与大脑朗读时相同的问题:在发声前将字位转换为音位。字位到音位(G2P)的转换非常困难,许多基础 TTS 系统正是在这里出错。
文本可能存在歧义。同一个词 “read” 在现在时可读作 /riːd/,过去时则读作 /red/。品牌名或专业术语等专有名词可能完全不遵循标准拼写规则。Eleven v3 等现代 AI 模型会利用上下文处理大多数情况,但你也可以更细致地控制音位,确保发音准确:
- 发音词典:为整个项目中的每个词定义读法。适合反复出现的品牌名、角色名、医学术语或公司专用词汇。
- SSML 音位标签和 IPA:在 v2 模型中,可通过 SSML 音位标签逐词控制发音;也可以直接使用 Eleven v3 音频标签来书写单词。
同一音位层也能反向运作。对于语音转文字,模型需要学习声学模式,以便先映射音位序列,再将其组合成词。借助对音位的理解,模型能够转写此前可能从未见过的词。

如何利用音位学习语言
普通用户想进一步了解音位的一个主要原因,是它对语言学习非常有帮助。儿童在早期听辨或识别单个音位的能力,会直接影响其后续习得更多语音知识,以及青少年时期的语言表达。
学习新语言时,大脑需要处理耳朵从未受过训练去辨别的音位。以下是一些利用音位提升语言学习效果的实用方法:
- 学习 IPA 符号:国际音标会在词典中标示每个词的发音。学习 IPA 后,即使第一次见到某个词,也知道该怎么读。
- 聆听并模仿音位:放慢语速,识别语言中的每个音位并加以模仿。这有助于理解每个声音的正确发音方式,比学习语言时反复练习整句更有效。
- 通过最小对立体精进发音:最小对立体之间只相差一个音位。反复练习这类例子,有助于训练舌头和耳朵识别并复现不同语言之间的细微差异。
AI 语音工具也让语言学习变得容易得多。借助文本转语音生成器,你可以用数十种语言和多种地区口音的自然语音,听到任意词语或短语。
试用 ElevenLabs 的音位级文本转语音
无论是在探索新语言的语音体系,还是打磨母语表达,扎实理解音位都是实现清晰有效表达的关键。不过,人类学习语言并不只依赖语言学知识,也会通过聆听和模仿来学习。
文本转语音生成工具有助于培养音位意识,并建立对语音单位、完整词语及口语交流中自然包含的各种声音的直观理解。
立即使用 ElevenLabs 强大的 文本转语音技术,或了解更多我们的 创意工具套件。




