Czym jest fonem? Definicja i 44 fonemy języka angielskiego
- Autor
- Jack Limebear
- Opublikowano
- Ostatnia aktualizacja
PosłuchajPosłuchaj tego artykułu
Fonem to najmniejsza jednostka dźwiękowa języka, która może zmienić znaczenie wyrazu. Zamiana jednego fonemu może stworzyć zupełnie inne słowo. /p/ i /b/ w połączeniu z /æt/ tworzą „pat” i „bat” — dwa całkiem różne wyrazy.
W języku angielskim fonemy są powodem, dla którego pisownia często nie odpowiada brzmieniu. Słowo „fox” składa się z czterech odrębnych fonemów (/f/ /ɒ/ /k/ /s/), ale ma tylko trzy litery, a „ship” ma cztery litery, lecz tylko trzy fonemy (/ʃ/ /ɪ/ /p/). Rozumienie fonemów jest kluczowe zarówno w nauce języków, jak i w zrozumieniu, jak nowoczesne systemy Text to Speech zamieniają zapisane słowa w naturalnie brzmiącą mowę.
W tym artykule wyjaśniamy, czym jest fonem, podajemy przykłady i pełną tabelę 44 fonemów angielskich oraz opisujemy, jak technologia głosów AI wykorzystuje kontrolę na poziomie fonemów, by zapewnić poprawną wymowę.
Podsumowanie:
- Fonem to najmniejsza jednostka dźwiękowa języka mówionego, która może zmienić znaczenie wyrazu.
- Większość językoznawców wyróżnia w angielskim 44 fonemy: 24 spółgłoskowe i 20 samogłoskowych.
- Fonemy opisują dźwięki, a grafemy to litery lub ich połączenia, które zapisują fonem.
- Międzynarodowy alfabet fonetyczny (IPA) standaryzuje symbole używane do zapisu fonemów, aby ich wymowa była spójna.
- Narzędzia Text to Speech zamieniają grafemy na fonemy przed wygenerowaniem pliku audio.
Czym jest fonem?
Fonem to najmniejsza jednostka dźwiękowa, która pozwala odróżnić jedno słowo od drugiego. Językoznawcy identyfikują fonemy, szukając dwóch wyrazów różniących się dokładnie jednym dźwiękiem. Takie wyrazy nazywamy parami minimalnymi, na przykład:
- Pat / bat: /p/ i /b/ to odrębne fonemy w tej parze minimalnej.
- Ship / sheep: /ɪ/ i /iː/ to fonemy, które zmieniają te wyrazy.
- Bat / bad: /t/ i /d/ to odrębne fonemy wskazujące różnicę między tymi wyrazami.
Jeśli zmiana jednego dźwięku w słowie tworzy nowe słowo, te dwa dźwięki są w danym języku osobnymi fonemami. Jeśli powstaje tylko nieco inaczej brzmiąca wersja tego samego słowa, są to warianty jednego fonemu.
Słowo „fonem” pochodzi od greckiego phōnēma, czyli „wypowiedź” lub „wydany dźwięk”. Warto o tym pamiętać: fonemy to jednostki dźwiękowe, a nie informacje o pisowni. Jak zaraz zobaczysz, fonemy to nie tylko pojedyncze litery — obejmują całe dźwięki mowy.
Ile fonemów jest w języku angielskim?
W języku angielskim wyróżnia się 44 fonemy: 24 spółgłoskowe i 20 samogłoskowych. To jednak tylko ogólne założenie. W zależności od akcentu i sposobu definiowania dźwięków przez językoznawców ich liczba może wynosić od 42 do 45. Na przykład w ogólnym akcencie amerykańskim wymawia się /r/ w słowie „car”, podczas gdy w brytyjskiej wymowie Received Pronunciation już nie. Daje to inną łączną liczbę fonemów w tych akcentach.
W innych akcentach samogłoski mogą się zlewać, co zmniejsza liczbę fonemów. Takie zlanie samogłosek, jak identyczna wymowa „cot” i „caught” przez niektórych Amerykanów, wpływa na ich liczbę według językoznawców. Znaczenie mogą mieć też dźwięki marginalne, gdy dyftongi traktuje się jako połączenia, a nie pojedyncze fonemy. Na przykład niektóre systemy uznają /ʍ/ (tchniony dźwięk na początku słowa „which”) za odrębny fonem, a inne za połączenie /h/ i /w/.
Standardowy model obejmuje 44 fonemy. Dokładnie są to 24 spółgłoski, 12 samogłosek monoftongicznych i 8 dyftongów. To standard stosowany w nauczaniu fonetyki w Wielkiej Brytanii i na kursach ESL.
44 fonemy języka angielskiego: pełna tabela z przykładami
Fonemy spółgłoskowe (24)
Fonemy samogłoskowe (12 monoftongów + 8 dyftongów = łącznie 20)
Symbole są zgodne z brytyjskim systemem angielskim (RP), używanym w większości programów nauki foniki. Analizy ogólnego angielskiego amerykańskiego nieco różnią się w przypadku samogłosek zabarwionych przez /r/.
Czym różni się fonem od grafemu?
Fonem jest dźwiękiem, a grafem to jego zapis. Grafem może składać się z jednej litery (c-a-t), dwóch liter (dwuznaku, jak sh lub ea), trzech (igh w „night”) albo czterech (ough w „though”).
Rozbieżność między fonemami a grafemami sprawia, że angielska pisownia jest wyjątkowo trudna. Na przykład:
- Jeden fonem, wiele grafemów: dźwięk /iː/ można zapisać jako ee (sheep), ea (leaf), e (be), ey (key), ie (chief) lub ei (ceiling).
- Jeden grafem, wiele fonemów: litery ough reprezentują różne fonemy w słowach „through” (/uː/), „though” (/əʊ/), „tough” (/ʌf/) i „thought” (/ɔː/).
Choć język angielski ma 44 fonemy, do ich zapisu używa ponad 200 grafemów. W bardziej fonetycznym języku, takim jak hiszpański, przyporządkowanie jest niemal jeden do jednego. Dlatego angielski jest tak złożony w mowie i transkrypcji. Z tego samego powodu model Text to Speech nie może po prostu odczytywać liter — wrócimy do tego za chwilę.

Fonemy a alofony
Alofony to warianty wymowy tego samego fonemu, które nie zmieniają znaczenia słowa. Jeśli nie ma pary minimalnej, w której fonem tworzy dwa różne wyrazy, mamy do czynienia z alofonem.
Na przykład /p/ w „pat” brzmi inaczej niż nieprzydechowa wersja w „spat”. To różne dźwięki, lecz w angielskim nie ma pary słów odróżnianych wyłącznie tym przydechem, więc anglojęzyczni odbierają je zasadniczo jako ten sam dźwięk. W innych językach, na przykład tajskim, różnica między przydechowym a nieprzydechowym /p/ tworzy osobne fonemy, które całkowicie odróżniają słowa.
To, co uznaje się za fonem, zależy więc wyłącznie od języka. Chodzi o wpływ dźwięków na znaczenie słów, a nie tylko o ich właściwości akustyczne.
Jak fonemy działają w Text to Speech
Każdy system Text to Speech musi rozwiązać ten sam problem co mózg podczas czytania na głos: przed wypowiedzeniem słowa zamienić grafemy na fonemy. Konwersja grafemów na fonemy (G2P) jest wyjątkowo trudna i to właśnie na tym etapie wiele prostych systemów TTS popełnia błędy.
Tekst może być niejednoznaczny. To samo słowo „read” może mieć wymowę /riːd/ w czasie teraźniejszym i /red/ w przeszłym. Niektóre nazwy własne, takie jak nazwy marek czy terminy techniczne, mogą w ogóle nie stosować standardowych zasad pisowni. Nowoczesne modele AI, takie jak Eleven v3, wykorzystują kontekst, by rozwiązać większość takich przypadków, ale możesz też dokładniej kontrolować fonemy, by zapewnić poprawną wymowę:
- Słowniki wymowy: Określ, jak ma być wymawiane każde słowo w całym projekcie. To idealne rozwiązanie dla nazw marek, postaci, terminów medycznych czy słownictwa firmowego, które pojawia się wielokrotnie.
- Tagi fonemów SSML i IPA: Dzięki tagom fonemów SSML w modelach v2 możesz kontrolować wymowę na poziomie słów albo zapisywać słowa bezpośrednio za pomocą tagów audio Eleven v3.
Ta sama warstwa fonemiczna działa też w drugą stronę. W zamianie mowy na tekst modele muszą uczyć się wzorców akustycznych, aby rozpoznać sekwencje fonemów przed złożeniem ich w słowa. Dzięki rozumieniu fonemów potrafią zapisać słowo, którego mogły wcześniej nigdy nie spotkać.

Jak wykorzystać fonemy w nauce języka
Jednym z głównych powodów, dla których warto dowiedzieć się więcej o fonemach, jest ich ogromna przydatność w nauce języków. Zdolność dziecka do słyszenia i rozpoznawania pojedynczych fonemów we wczesnym wieku bezpośrednio wpływa na przyswajanie dalszej wiedzy fonologicznej oraz rozwój językowy w okresie dorastania.
Podczas nauki nowego języka mózg musi przetwarzać fonemy, których ucho nigdy nie nauczyło się słyszeć. Oto kilka praktycznych sposobów na wykorzystanie fonemów w nauce języka:
- Naucz się symboli IPA: Międzynarodowy alfabet fonetyczny pojawia się w słownikach, by pokazać wymowę każdego słowa. Znajomość IPA pozwala odczytać każde słowo, nawet gdy widzisz je pierwszy raz.
- Słuchaj i naśladuj fonemy: Zwolnij tempo mowy, aby rozpoznać każdy fonem w języku i go naśladować. Pomaga to zrozumieć, jak wymawiać każdy dźwięk, i jest skuteczniejsze w nauce języka niż powtarzanie całych zdań.
- Ćwicz na parach minimalnych: Pary minimalne różnią się tylko jednym fonemem. Ćwiczenie takich przykładów pomaga wytrenować język i słuch, aby rozpoznawać oraz odtwarzać nawet subtelne różnice między językami.
Narzędzia głosowe AI znacznie ułatwiły też naukę języków. Generator głosu pozwala usłyszeć dowolne słowo lub frazę w naturalnie brzmiącym głosie, w dziesiątkach języków i wielu regionalnych akcentach.
Wypróbuj ElevenLabs do Text to Speech na poziomie fonemów
Niezależnie od tego, czy poznajesz fonetykę nowego języka, czy doskonalisz język ojczysty, dobra znajomość fonemów pomaga mówić skutecznie i wyraźnie. Akademicka wiedza z językoznawstwa nie jest jednak jedynym sposobem przyswajania języka. Uczymy się także przez słuchanie i naśladowanie.
Narzędzia do generowania Text to Speech są nieocenione w rozwijaniu świadomości fonemicznej i intuicyjnego rozumienia jednostek dźwiękowych, całych słów oraz innych dźwięków naturalnie obecnych w mowie.
Zacznij korzystać z zaawansowanej technologii Text to Speech od ElevenLabs albo poznaj więcej naszych narzędzi kreatywnych już dziś.



