O que é um fonema? Definição e os 44 fonemas do inglês
- Escrito por
- Jack Limebear
- Publicado
- Última atualização
OuvirOuça este artigo
Um fonema é a menor unidade sonora de um idioma capaz de mudar o significado de uma palavra. Ao trocar um único fonema, você pode criar uma palavra completamente diferente. /p/ e /b/, combinados com /æt/, formam “pat” e “bat”, duas palavras totalmente diferentes.
No inglês, especificamente, os fonemas explicam por que a grafia e o som muitas vezes não correspondem. Uma palavra como “fox” é formada por quatro fonemas distintos (/f/ /ɒ/ /k/ /s/), mas tem apenas três letras, enquanto “ship” tem quatro letras, mas apenas três fonemas (/ʃ/ /ɪ/ /p/). Entender os fonemas é essencial tanto para aprender idiomas quanto para entender como os sistemas modernos de Text to Speech transformam palavras escritas em fala com som natural.
Este artigo explica exatamente o que é um fonema com exemplos, apresenta o quadro completo dos 44 fonemas do inglês e mostra como a tecnologia de voz IA usa o controle no nível dos fonemas para acertar a pronúncia.
Resumo:
- Um fonema é a menor unidade sonora de uma língua falada capaz de mudar o significado de uma palavra.
- A maioria dos linguistas considera que o inglês tem 44 fonemas: 24 sons consonantais e 20 sons vocálicos.
- Os fonemas descrevem sons, enquanto os grafemas são as letras ou combinações de letras que representam um fonema na escrita.
- O Alfabeto Fonético Internacional (IPA) padroniza os símbolos usados para representar fonemas, garantindo consistência na pronúncia desses sons.
- As ferramentas de Text to Speech convertem grafemas em fonemas antes de gerar um arquivo de áudio.
O que é um fonema?
Um fonema é a menor unidade sonora capaz de distinguir uma palavra de outra. Linguistas identificam fonemas encontrando duas palavras que diferem em exatamente um som. Essas palavras são chamadas de pares mínimos. Veja alguns exemplos:
- Pat / bat: /p/ e /b/ são os fonemas distintos neste par mínimo.
- Ship / sheep: /ɪ/ e /iː/ são os fonemas que diferenciam essas palavras.
- Bat / bad: /t/ e /d/ são os fonemas distintos que marcam a diferença entre essas palavras.
Se você encontrar uma palavra em que mudar um som produz uma nova palavra, esses dois sons são fonemas separados nesse idioma. Se isso produzir uma versão com som ligeiramente diferente da mesma palavra, eles serão apenas variantes do mesmo fonema.
A palavra “fonema” vem do grego phōnēma, que significa enunciado ou som produzido. É útil lembrar disso ao definir fonemas, pois eles são unidades de som, não informações sobre a grafia. Como veremos em breve, os fonemas vão além de letras isoladas e abrangem sons auditivos completos.
Quantos fonemas existem no inglês?
No inglês, há 44 fonemas: 24 fonemas consonantais e 20 fonemas vocálicos. Vale ressaltar que essa é apenas uma estimativa geral. Dependendo do sotaque e de como os linguistas definem os diferentes sons, alguns acreditam que há apenas 42, enquanto outros consideram que há até 45. Por exemplo, um sotaque americano geral pronuncia o /r/ em “car”, enquanto a Received Pronunciation britânica não o faz, o que resulta em uma contagem total diferente entre esses sotaques.
Outros sotaques podem unir vogais, removendo fonemas da contagem total. Fusões vocálicas, como a forma como alguns americanos pronunciam “cot” e “caught” da mesma maneira, afetam como os linguistas avaliam os números totais. Alguns sons marginais, nos quais ditongos são vistos como combinações em vez de fonemas únicos, também podem influenciar os números. Por exemplo, alguns sistemas contam /ʍ/ (o som soproso no início de “which”) como um fonema distinto, enquanto outros o tratam como uma combinação de /h/ e /w/.
A contagem padrão usa um modelo de 44 fonemas. A divisão exata é de 24 consoantes, 12 vogais monotongais e 8 ditongos, que é o padrão usado no ensino de fonética do Reino Unido e no ensino de inglês como segunda língua.
Os 44 fonemas do inglês: quadro completo com exemplos
Fonemas consonantais (24)
Fonemas vocálicos (12 monotongos + 8 ditongos = 20 no total)
Os símbolos seguem o sistema do inglês britânico (RP), usado na maioria dos currículos de fonética; as análises do inglês americano geral diferem ligeiramente quanto às vogais róticas.
Qual é a diferença entre fonema e grafema?
Um fonema é um som, enquanto um grafema é a representação escrita desse som. Um grafema pode ter uma letra (c-a-t), duas letras (um dígrafo, como sh ou ea), três (igh em “night”) ou quatro (ough em “though”).
A falta de correspondência entre fonemas e grafemas é o que torna a ortografia em inglês notoriamente difícil. Por exemplo:
- Um fonema, vários grafemas: o som /iː/ pode ser escrito como ee (sheep), ea (leaf), e (be), ey (key), ie (chief) ou ei (ceiling).
- Um grafema, vários fonemas: as letras ough representam fonemas diferentes em “through” (/uː/), “though” (/əʊ/), “tough” (/ʌf/) e “thought” (/ɔː/).
Embora o inglês tenha 44 fonemas, ele usa mais de 200 grafemas para escrevê-los. Se você pensar em um idioma mais fonético, como o espanhol, em que a correspondência é quase de um para um, o inglês se torna extremamente complexo de falar e transcrever. É também por isso que um modelo de Text to Speech não pode simplesmente ler as letras em voz alta, como veremos em breve.

Fonemas vs. alofones
Alofones são pronúncias variantes de um mesmo fonema que não alteram o significado da palavra. Se não houver um par mínimo em que um fonema crie duas palavras diferentes, trata-se de um alofone.
Por exemplo, o /p/ em “pat” soa diferente da versão não aspirada em “spat”. São sons diferentes, mas nenhum par de palavras em inglês se distingue apenas por essa aspiração, o que significa que falantes de inglês os ouvem essencialmente como o mesmo som. Em outros idiomas, como o tailandês, a diferença entre /p/ aspirado e não aspirado cria fonemas separados que distinguem completamente as palavras.
Isso significa que o que conta como fonema depende totalmente do idioma. Trata-se de como os sons afetam o significado das palavras, e não apenas da acústica.
Como os fonemas potencializam o Text to Speech
Todo sistema de Text to Speech precisa resolver o mesmo problema que o cérebro resolve ao ler em voz alta: converter grafemas em fonemas antes de falar. A conversão de grafema para fonema (G2P) é notoriamente difícil e é onde muitos sistemas básicos cometem erros com TTS.
Um texto pode ser ambíguo. A mesma palavra, “read”, pode ser /riːd/ no presente e /red/ no passado. Alguns nomes próprios, como marcas ou termos técnicos, talvez não sigam as regras padrão de ortografia. Modelos modernos de IA, como o Eleven v4 usam o contexto para resolver a maioria desses casos, mas você também pode controlar os fonemas com mais precisão para garantir a pronúncia:
- Dicionários de pronúncia: Defina como cada palavra deve ser falada em todo um projeto. É ideal para nomes de marcas, personagens, termos médicos ou vocabulário específico da empresa que aparece repetidamente.
- Tags de fonemas em SSML e IPA: Você pode controlar a pronúncia no nível da palavra com tags de fonemas SSML nos modelos v2 ou escrevendo palavras diretamente com as tags de áudio do Eleven v4.
A mesma camada fonêmica também funciona na direção oposta. Para Speech to Text, os modelos precisam aprender padrões acústicos para mapear sequências de fonemas antes de reuni-las em palavras. A compreensão fonêmica permite transcrever uma palavra que talvez nunca tenham visto antes.

Como usar fonemas para aprender idiomas
Um dos principais motivos para um usuário comum querer saber mais sobre fonemas é que eles são extremamente úteis no aprendizado de idiomas. A capacidade de uma criança de ouvir ou identificar fonemas individuais desde cedo influencia diretamente a aquisição de mais conhecimento fonológico e a produção linguística ao longo da adolescência.
Ao aprender um novo idioma, seu cérebro precisa processar fonemas que seu ouvido nunca foi treinado para ouvir. Veja algumas estratégias práticas para usar fonemas e melhorar o aprendizado de idiomas:
- Aprenda os símbolos do IPA: O Alfabeto Fonético Internacional aparece nos dicionários para mostrar como pronunciar cada palavra. Aprender IPA significa que você sempre saberá como ler uma palavra, mesmo ao vê-la pela primeira vez.
- Ouça e imite fonemas: Diminua o ritmo da fala para identificar cada fonema de um idioma e reproduzi-lo. Isso ajuda a entender como cada som deve ser pronunciado, o que é mais eficaz do que repetir frases inteiras ao aprender idiomas.
- Use pares mínimos para aprimorar a pronúncia: Pares mínimos têm apenas uma mudança de fonema entre si. Praticar exemplos deles na fala ajuda a treinar a língua e o ouvido para reconhecer e reproduzir até diferenças sutis entre idiomas.
As ferramentas de voz IA também facilitaram muito o aprendizado de idiomas. Com um gerador de Text to Speech, você pode ouvir qualquer palavra ou frase em uma voz com som nativo, em dezenas de idiomas e vários sotaques regionais.
Experimente o ElevenLabs para Text to Speech no nível dos fonemas
Quer você esteja explorando a fonética de um novo idioma ou aperfeiçoando sua língua nativa, compreender bem os fonemas é essencial para dominar a expressão clara e eficaz. Mas uma compreensão acadêmica da linguística não é a única forma de nós, humanos, adquirirmos idiomas. Também aprendemos ouvindo e imitando.
As ferramentas de geração de Text to Speech são muito valiosas para desenvolver a consciência fonêmica e construir uma compreensão intuitiva das unidades sonoras, das palavras inteiras e dos demais sons naturalmente presentes na comunicação falada.
Comece a usar uma poderosa tecnologia de Text to Speech com a ElevenLabs ou conheça mais sobre nossa suíte de ferramentas criativas hoje.
Perguntas frequentes
Jack Limebear faz parte do time de Growth, atuando como redator e estrategista de conteúdo no blog e nas páginas de insights. Antes da ElevenLabs, ele passou mais de dez anos liderando estratégias de conteúdo em organizações que vão de startups SaaS em rápido crescimento a empresas da Fortune 500. Ele é mestre em Literatura Inglesa pela Universidade de Cambridge.



