Перед вами график гласных Международного Фонетического Алфавита. Если вы когда-либо интересовались фонетикой или даже лингвистикой в целом, вы видели этот график. Его учит каждый студент-лингвист на первом курсе. Тем не менее, он неверен.

Из этой статьи вы узнаете:

  1. Как мы до этого дошли - почему ошибка из 1917-го года до сих пор воспроизводится в каждом учебнике в 2026-м

  2. Как на самом деле выглядит пространство гласных

  3. Как на самом деле связаны артикуляция и акустика гласных

  4. Как программно вычислить положение конкретного звука в пространстве гласных

  5. Как правильную теорию можно использовать для улучшения английского произношения и уменьшения акцента

Непрерывность пространства гласных

Давайте немного поэкспериментируем. Сначала скажите ииии, потом аааа, в потом попробуйте максимально плавно перевести первый звук во второй. У вас должно получиться - и примерно посередине вы при этом произнесли ээээ.

А теперь попробуйте то же самое, но с парой согласных: п и з. У вас точно не получится.

Все согласные можно разбить на совершенно несвязанные друг с другом кластеры, когда как гласные живут в едином непрерывном пространстве и их можно отобразить на едином графике.

Можно провести аналогию с цветами. Гласные, как и цвета, плавно перетекают друг в друга, разных оттенков гласных бесконечное множество. Каждый язык по своему делит пространство гласных на фонемы - точно так же как каждая культура по своему делит непрерывное цветовое пространство на базовые цвета.

История фонетики

Человеческий мозг вопринимает звуки речи категориально: он сравнивает звук с протитипами всех фонем в языке, и выбирает ту фонему, к которой звук ближе всего. Мы не воспринимаем звук как смесь фонем.

Из-за этой особенности мозга, идея непрерывности гласных неинтутивна. До конца 18-го века, все фонетические традиции описывали гласные так же дискретно как и согласные. Они все выделяли 3 крайние гласные: "и" (рот почти закрыт, губы разведены в стороны), "у" (губы трубочкой) и "a" (рот максимально раскрыт); плюс те гласные, которые присутствуют как фонемы в их языке.

Первым, кто высказал идею непрерывности в явном виде, был немецкий врач Кристоф Фридрих Хельваг. В 1781-м году он опубликовал довольно точную по современным меркам диаграмму гласных немецкого языка, при этом написав комментарий про непрерывность:

Иллюстрация Хельвага из его "Dissertatio De Formatione Loquelae"
Иллюстрация Хельвага из его "Dissertatio De Formatione Loquelae"

Между соседними гласными можно добавить бесконечное множество промежуточных звуков, используемых носителями разных языков и диалектов. Вероятно, таким образом можно математически определить вообще все гласные, доступные человеку.

В 1867 году Александр Мелвил Белл (отец того Белла, который изобрёл телефон), после долгих наблюдений за артикуляцией гласных, пришёл к выводу, что качество гласного зависит от четырёх артикуляционных параметров: положение языка в вертикальной плоскости (подъём: низкий, средний, высокий), положение языка в горизонтальной плоскости (ряд: передний, средний, задний), степень огубления (огубленный/неогубленный) и признак primary vs. wide (позднее переродился в tense/lax, не является отдельной координатой, а означает удалённость от центра). Белл ничего не говорил про непрерывность: он выделял 36 гласных, и обозначал каждую отдельным символом (внешний вид символов при этом кодировал признаки).

Иллюстрация из книги Белла “Visible speech: the science of universal alphabetics, or self-interpreting physiological letters, for the writing of all languages in one alphabet”
Иллюстрация из книги Белла “Visible speech: the science of universal alphabetics, or self-interpreting physiological letters, for the writing of all languages in one alphabet”

Вскоре после этого, Генри Свит соединил идею непрерывности и признаки Белла. Так родилась теория, которую до сих пор преподают студентам-лингвистам: пространство гласных непрерывно, и точка в пространстве гласных определяется тремя непрерывными артикуляционными координатами: высотой подъёма языка, рядом и степенью огубления.

Это выглядит логично с точки зрения физики. Язык делит ротовую полость на две части, соединенные перемычкой. От размеров этих двух частей и размера перемычки зависят частоты, на которых резонирует воздух, проходя через ротовую полость. Мы можем двигать языком взад-вперёд и вверх-вниз (причём непрерывно), и таким образом непрерывно менять качество гласных.

МРТ ротовой полости
МРТ ротовой полости

Эта теория послужила послужила толчком к развитию фонетики. Группа британских и французских учителей основала организацию Dhi Fonètik Tîtcer’z Asóciécon, позже переименованную в Международную Фонетическую Ассоциацию (МФА) и в 1888 году опубликовала первую версию Международного Фонетического Алфавита (также МФА). МФА - это единый алфавит, которым можно записать произношение любого языка. Транскрипция в учебниках английского - это запись в МФА.

В 1917 году глава отделения фонетики Университетского Колледжа Лондона Даниэль Джонс опубликовал звукозаписи "основных гласных" (cardinal vowels) и отобразил их на диаграмме положения языка:

  • [i]: Самое высокое и переднее положение языка из возможных

  • [a]: Самое низкое и переднее положение языка из возможных

  • Между [i] и [a] находятся [e] and [ɛ], разделяя пространство максимально передних гласных на 3 равные части

  • [ɑ]: Самое низкое и заднее положение языка из возможных

  • [u]: Самое высокое и заднее положение языка из возможных; при этом с максимальным огублением

  • Между [ɑ] и [u] находятся [ɔ] and [o], разделяя пространство максимально задних гласных на 3 равные части. ɔ и o тоже огублены

  • Гласные 9–16 (добавлены позже) соответствуют первым 8, но с противоположным признаком огубления

График имеет форму трапеции по анатомическим причинам: у языка внизу меньше места, чтобы ездить взад-вперёд; чем наверху.

Гласные верхнего подъёма также называют закрытыми, а гласные нижнего подъёма открытыми, потому что у человека при прижимании языка книзу, рот инстинктивно открывается шире; и наоборот.

Что у Джонса получалось лучше всего - так это распространять свои идеи (даже неправильные). Этот его график очень хорошо прижился. Перед вами современный график МФА: это то же самое, что и диаграмма Джонса, только туда за столетие понадобавляли промежуточных символов. По сути ничего не изменилось - как объяснял Джонс, так же объясняют и современные учителя.

График Джонса сегодня полностью доминирует в образовании и даже в академических работах (тех, где нет статистики). Тем не менее, в его основе лежит совершенно неверная модель.

Скелет в шкафу

Из 8-ми основных гласных, только 3 можно безупречно исполнить артикуляционно - [i], [u] и [ɑ]. Для них существует физический предел движения языка, в который можно упереться. У [а] такого предела нет, а остальные 4 вообще определены как промежуточные между первыми 4-мя.

Поэтому Джонс произнёс [i], [u] и [ɑ] в строгом соответствии в артикуляционными инструкциями, а остальные гласные подогнал на слух так, чтобы выполнялись отношения, заданные графиком.

Во время этого он просвечивал свою ротовую полость рентгеном. Он ожидал увидеть, что положение языка на рентгене будет примерно соответствовать его графику. Этого не наблюдалось даже близко. Джонс не мог объяснить несоответствие и в итоге опубликовал график, звукозаписи всех гласных, а рентгеновские снимки - только для четырёх угловых. В 1955-м году он признался Ладефогеду, что снимки для остальных гласных "людей бы только запутали".

В 1928-м году Джордж Рассел провел собственное исследование и указал на несоответствие положения языка графику. Учёные мужи в 1928-м также не смогли найти объяснения и продолжили использовать график Джонса.

Таким образом, несмотря на то, что график МФА объясняется как артикуляционный, на самом деле он скорее акустический - как сказал Рассел в 1928-м, "фонетисты мыслят акустическими фактами, а выражают их через физиологические фантазии". Большинство гласных были определены на слух, а их реальная артикуляция не сходится с моделью. IPA Handbook это тихо признаёт: "The quadrilateral must be regarded as an abstraction and not a direct mapping of tongue position". К сожалению, если кто и читает этот дисклеймер, то не понимает его реальный смысл.

Проблемы с научным методом в фонетике

График Джонса плох и как чисто акустический график. У его осей нет чётких определений, и поэтому невозможно написать программу, которая будет определять координаты произвольного гласного звука на этом графике. Из-за этого он абсолютно неюзабелен в статистической фонетике. Воистину, это график для гуманитариев.

Фонетисты рисуют точки на этом графике просто "по интуиции". Аудиодемонстрации одной и той же гласной могут кардинально отличаться в исполнении разных фонетистов. Фонетисты бесконечно спорят между собой о качестве звуков, потому что одним слышится одно, а другим другое. В общем, это вайб-фонетика.

Я лично убеждён, что сам факт доминирования графика Джонса в образовании приводит к уменьшению количества реального статистического рисёрча. Даже если студентам позже всё-таки рассказывают что-то там про форманты, ложная парадигма уже отпечаталась у них в голове. Кроме того, работает теория разбитых окон. Студент думает: если заслуженному профессору можно вайбить свои исследования, значит, и мне можно.

Асимметрия огубления

График Джонса говорит нам, что 5 основных гласных неогублены, а 3 огублены. Откуда такая асимметрия? Почему нельзя было сделать симметрично?

А всё потому что если вы посмотрите на фонетические системы реальных языков, вы увидите, что в них доминируют 8 первых основных гласных Джонса: передние и открытые гласные обычно неогублены, а задние огублены. Гласные с противоположным огублением (9-16) используются гораздо реже. Почему так? Почему человеческие языки не любят половину гласных МФА?

Загадка звуков [œ] and [ɤ]

Сравните два звука: œ и ɤ. Не знаю, как для вас, но для меня они звучат похоже. Не идентично, но похоже.

При этом, на графике Джонса они находятся очень далеко друг от друга. У них различаются все 3 параметра. Как объяснить их акустическое сходство?

Спектрограммы

Чтобы понять реальное пространство гласных, нам придётся погрузиться в акустический анализ.

В аудиофайле закодированы значения давления воздуха через малые промежутки времени - 16000 семплов в секунду и больше (это называется частотой дискретизации).

Если мы просто построим график этих значений, у нас получится осцилограмма. Однако, осцилограмма не очень подходит для акустического анализа, потому что во звуках речи намешано много разных частот. Нужно их разделить.

Осцилограмма
Осцилограмма

Для этого существует Дискретное Преобразование Фурье. Оно делает из осцилограммы спектр - выдаёт интенсивность для каждого интервала частот.

Спектр походит только для звуков, которые не меняются со временем - иначе он сольёт разные звуки, которые разнесены по времени

Спектр гласной ɪ
Спектр гласной ɪ

Для звуков, которые меняются со временем, строят спектрограммы: массив из спектров для каждого малого интервала времени (интервалы могут пересекаться). Акустический анализ - это в основном анализ спектрограмм.

Сверху: осцилограмма + громкость (синим) и высота звука (зелёным); Внизу: спектрограмма с формантами (синим)
Сверху: осцилограмма + громкость (синим) и высота звука (зелёным); Внизу: спектрограмма с формантами (синим)

Модель Источник+Фильтр

Гласные являются звонкими звуками, то есть они произносятся с вибрацией голосовых связок.

Вибрация голосовых связок порождает звук, который называется "источником". В его спектре пики находятся на равном расстоянии друг от друга. Эти пики называются гармониками. Частота самого первого пика совпадает с расстоянием между гармониками и называется фундаментальной частотой F0. Мы воспринимаем фундаментальную частоту как высоту звука. Высота звука - это главный маркер, по которому мы определяем пол говорящего: у женщин (а также у детей) F0 выше. Типичная F0 мужского голоса - 120 Гц, а женского - 220 Гц.

Звук-источник проходит через ротовую полость и преобразуется в соответствии с её формой. Эту трансформацию можно описать с помощью спектра т.н. "фильтра": звука, которой получился бы на выходе, если бы источником был полностью плоский спектр (белый шум).

Чтобы получить спектр звука-результата, нужно спектр источника умножить на частотную характеристику фильтра.

Форманты

Частоты пиков фильтра называются формантами: F1, F2, F3 и т.д.

Часто можно встретить упрощённое объяснение, что форманты - это частоты пиков результирующего спектра. Это неверно, форманты - это свойство исключительно фильтра. Форманта может лежать между двух гармоник, и не быть пиком в результирующем спектре.

Реальный спектр гласной ɪ с гармониками и формантами
Реальный спектр гласной ɪ с гармониками и формантами

Пространство гласных

Форманты - это именно то, что дифференцирует гласные. Мы слышим частоты формант, а не положение языка.

F1 и F2 играют главную роль, F3 - второстепенную. Более высокие форманты (F4 и дальше) кодируют индивидуальные особенности речи, а не фонетические контрасты.

График F1xF2 отображает реальное пространство гласных с точки зрения человеческого слуха. Если нам нужно больше точности, можно добавить F3, однако F1xF2 - это уже достаточно.

Пространство гласных для американского английского
Пространство гласных для американского английского

F1 в первом приближении соответствует "высоте языка" на графика Джонса, а

F2 - "ряду".

Традиционно, оси на графике формант ориентируют так, чтобы график напоминал график Джонса. F1 - это ось Y, и она растёт вниз; F2 - это ось X и она растёт влево.

Чтобы лучше соответствовать человеческому воприятию, шкалу частот следует трансформировать либо через ERB, либо через Bark-преобразование. Я лично применяю ERB:

F2 как шкала мягкости

В отличие от английского, в русском согласные систематически противопоставляются по твёрдости-мягкости.

С точки зрения фонетики, смягчение согласных - это дополнительная артикуляция палатализации. То есть, при их произношении, помимо основной артикуляции, язык стремится занять положение для звука [i]/[j], у которого очень высокое значение F2.

То, что мы воспринимаем как "мягкость" согласного - это на самом деле высокое значение F2.

В русском языке передние гласные (у которых высокое значение F2) - [и], [е], [я], [ю], [ё] - автоматически вызывают сильную палатализацию предыдущего согласного (в других языках это тоже происходит, но в гораздо меньшей степени). Носители большинства других языков палатализовывать согласные без специальной тренировки не умеют, поэтому когда они говорят на русском, они часто оставляют согласный твёрдым, и добавляют звук [j] уже после него. У русскоговорящих противоположная проблема - когда они говорят на английском, они слишком сильно смягчают согласные перед передними гласными.

Вычисление формант

Самый популярный способ вычисления формант - это авторегрессионный алгоритм Бурга 1967-го года. У него есть свои недостатки, но он быстр и воспроизводим.

Он реализован в библиотеке parselmouth:

import parselmouth
sound = parselmouth.Sound("audio.wav")
formants = sound.to_formant_burg()
# Extract F1, F2, F3 from the formants object...

Разумеется, можно на это дело натренировать нейронку. Я экспериментировал вот с этой моделью. Результаты по точности были лучше, чем у Бурга, но для моего юзкейса она была слишком медленной.

Нормализация формант

Для одной и той же гласной, средние значения формант зависят от индивидуальной анатомии голосового тракта. У женщин форманты в среднем на 15-25% выше, чем у мужчин (чем выше форманта, тем разница меньше). Чем выше голос - тем больше значения формант.

Есть разные способы учесть это в модели. Я использую медианную F0 (которую тоже определяю через parselmouth) для вычисления коэффициентов поправки формант.

Во всех своих вычислениях и визуализациях я использую F1', F2', F3', а не сырые значения формант.

Связь артикуляции и формант

Напомню, что F1 в первом приближении соответствует "высоте" на графике Джонса, а F2 - "ряду". Давайте разберёмся в этом более подробно.

Представим голосовой тракт как трубу длины L, закрытую со стороны голосовых связок и открытую со стороны губ. Это будет четвертьволновой резонатор, форманты которого вычисляются по формуле

где c - скорость звука

Если подставить L = 17.5см (средняя длина голосового тракта взрослого мужчины), мы получим:

  • F1​ ≈ 500 Гц

  • F2​ ≈ 1500 Гц

  • F3​ ≈ 2500 Гц

Это форманты нейтрального звука шва [ə]. Вы его издаёте, когда экаете чтобы подумать, или когда тянете предлоги: "Вася там будет сəəəə двух до трёх, а я приду кəəəə пяти". Звук шва сплошь и рядом встречается в русском в безударных слогах: например, в словах лодка, карандаш, молоко. Это вообще самый естественный для человека гласный звук: для него нужно просто пропустить воздух через голосовой тракт в дефолтной конфигурации.

Другие гласные получаются путём отклонения от дефолтной конфигурации - путём сжатия трубы в каком-то месте.

Каждой форманте соответствует т.н. "стоячая волна". При сжатии трубы частота форманты меняется по правилу:

  1. Если в месте сжатия скорость воздушного потока высокая (а давление воздуха низкое), то частота уменьшается

  2. Если в месте сжатия скорость воздушного потока низкая (а давление воздуха высокое), то частота возрастает

Таблица ниже показывает эффект изменения формант в зависимости от того, где (насколько глубоко в ротовой полости) был сжат голосовой тракт (-1 = lips = губы, 0 = hard palate = твёрдое нёбо, 0.5 = velum = мягкое нёбо, 1 = pharynx = глотка)

Эти цифры взяты не с потолка. Давление стоячих волн описывается следующими периодическими функциями (x - глубина места сжатия от -1 до 1):

Давайте посмотрим, что происходит при артикуляции некоторых конкретных гласных.

[i]
[i]

При произнесении [i] труба сжимается в районе твёрдого нёба. F1 уменьшается, F2 увеличивается.

[ɑ]
[ɑ]

При произнесении [ɑ] всё ровно наоборот: труба сжимается в районе глотки, и форманты меняются в противоположную сторону.

[u]
[u]

На [u] труба сжимается в районе мягкого нёба (когда язык высоко, он не может сжать трубу в районе гортани). Смотрим в таблицу - по ней, в этом случае форманты не меняются (то есть мы должны находиться в районе швы). Как же у нас получаются форманты звука [u]? Всё дело в огублении. Сжатие в районе губ дополнительно уменьшает обе форманты, и звук переезжает вверх и вправо на графике формант. Без помощи губ, одним только языком, звука [u] добиться невозможно.

Из этого примера можно заметить, что одному и тому же звуку может соответствовать больше одной артикуляции: [u] без огубления и шва - это разные артикуляции, а форманты у них одинаковые.

[a]
[a]

При произнесении звука [a] труба расширяется в районе твёрдого нёба и в районе губ.

При расширении эффект на форманты меняет знак.

F1 увеличивается - эффекты от мягкого нёба и от губ работают в одном направлении.

С F2 интереснее: эффект от мягкого нёба её уменьшает, а от губ - увеличивает. В итоге, губы оказываются сильнее, и F2 немного увеличивается.

Этим противостоянием губ и мягкого нёба объясняется то, что в нижней части график формант гораздо уже, чем в верхней. То есть, и график Джонса, и график формант (для английского языка) выглядят как трапеция, но по совершенно разным причинам.

Любопытный факт: график Джонса предполагает, что [a] можно огубить и получить [ɶ]. Однако, это физически невозможно - когда рот раскрыт на максимум, у вас не получится округлить губы.

F3

В вопрос влияния артикуляции на F3 мы погружаться не будем, там чёрт ногу сломит.

Почти все гласные можно отличить только по F1xF2. Однако, есть несколько исключений.

В английском, и в General American, и в Received Pronunciation, звук [ʉː] настолько уехал вперёд, что на графике F1xF2 начинает пересекаться с [iː]. Тем не менее, его несложно отличить от [iː], потому что у него F3 заметно ниже.

В американском английском есть r-colored vowels, как в словах nurse или letter. Разница между ними и соответсвующими звуками в британском произношении - в значении F3, у американцев оно гораздо ниже. Иными словами, r-окрашенность гласных уменьшает F3.

В русском языке гласных фонем намного меньше, чем в английском, и поэтому про F3 можно вообще забыть.

"Геоцентрическая" фонетика

Фонетисты рубежа 19-го и 20-го веков придумали модель, которая, будучи фундаментально неверной, до определённого момента соответствовала наблюдениям - то тех пор, пока они не решили проверить положение языка на рентгеновских снимках.

По сути, они описывали акустику гласных, то бишь форманты. Само понятие о формантах тогда уже в науке существовало, но применительно к лингвистике не использовалось. Фонетисты оперировали в терминах артикуляции.

Питер Ладефогед сравнил ранних фонетистов с астрономами до Галилея. Их геоцентрическая модель мира тоже сходилась с наблюдениями в большинстве случаев, а когда не сходилась - они её умело подгоняли.

Для меня дико, что в 2026-м году студентам-лингвистам преподают старую теорию Джонса, которую уже 60 лет как опровергли.

Что там с [œ] и [ɤ]?

Теперь мы можем ответить на вопрос, почему œ и ɤ звучат похоже.

Огубление уменьшает обе форманты (вспомните как оно у нас из швы сделало [u]).

[œ] - это огубленное [ɛ]. Огубление перемещает гласный вверх и вправо, в центр графика.

[ɤ] - это неогубленное [o]. Отсутствие огубления перемещает гласный вниз и влево, тоже в центр графика.

В итоге оба гласных оказываются в центре и звучат похоже.

Огубление

В модели Джонса огубление - это отдельная размерность пространства гласных. На самом деле, огубление перемещает гласный в пространстве F1xF2 вверх и вправо.

Для заднеязычных гласных огубление означает перенос от центра, а для переднеязычных оно означает перенос к центру. Полностью открытые гласные огубить вообще невозможно.

Теперь понятно, почему нестандартно огубленные гласные (огубленные передние и неогубленные задние) гораздо реже встречаются в реальных языках. Они все находятся близко к центру, и в большом количестве их было бы сложно различать.

Почему график Джонса всё ещё живёт

График Джонса во всех отношениях хуже, чем график формант. Он основан на неверной теории, он искажает пространство гласных, он вводит лишнюю размерность огубления. Однако, его самый главный недостаток - это то, что его оси не определены формально, поэтому он непригоден для статистической фонетики и вообще каких-либо программных измерений.

Тогда почему же его всё ещё преподают студентам-лигвистам? Ответ банальный: академическая инертность.

Только в конце 1940-х годов появились первые спектрографы. Тогда же появились первые графики формант, которые делали вручную по спектрограммам. Это было очень дорого и долго.

Правильное объяснение влияния артикуляции на акустику сложилось в 1940-е и 1950-е, а последний гвоздь в крышку гроба старой теории забил Ладефогед в 1967-м году. Тогда профессора встали перед выбором: либо полностью перестроить парадигму образования на подход с формантами, либо продолжать учить по-старому. Из-за того, что статистическая фонетика тогда находилась в зачаточном состоянии и из-за нежелания меняться, они выбрали второе.

В итоге у сегодняшних студентов-лингвистов в голове каша. Они думают, что график МФА и график формант дополняют друг друга: первый артикуляционный, а второй акустический. На самом деле, они оба акустические, просто график МФА - акустический график курильщика, а график формант - здорового человека. Будь график МФА артикуляционным, его оси были бы подписаны в миллиметрах, с помощью МРТ-сканов можно было бы точно измерить положение гласных на этом графике, и таким образом проводить статистические исследования.

Современные технологии

Сегодня можно скачать огромный датасет сырого аудио, транкрибировать его, сегментировать на фонемы, и посчитать форманты для каждой гласной - что я и сделал, чтобы получить вот этот график:

Пространство гласных для американского английского
Пространство гласных для американского английского

В статистических исследованиях почти всегда используются графики формант, а график Джонса не используется никогда.

Как правильно учиться произношению

Я уже полгода работаю над веб-приложением Language Dove для тренировки английского произношения и уменьшения акцента.

Скриншот приложения
Скриншот приложения

В приложении есть визуализация произношения пользователя на графике формант.

После небольшой практики с обратной связью через визуализацию на графике, появляется интуиция: во-первых, как сместить форманты в нужном направлении; во-вторых, как звучит каждая точка на графике. Я считаю, что это самый эффективный способ улучшать произношение.

Как правильно преподавать фонетику

Я считаю, что от графика Джонса надо полностью отказаться - надо с самого начала честно объяснять график формант.

При этом важно чётко разделять артикуляцию и акустику, чтобы они не смешивались в голове - и в идеале объяснить влияние первой на вторую.

Я слышал контраргумент, что это всё сложно, а график Джонса - он такой простой и понятный. На что я отвечаю: у меня получилось объяснить современную теорию в одной статье доступным стилем. На мой взгляд, лучше один раз понять, чем всю жизнь натыкаться на баги старой теории.

Комментарии (48)


  1. Markscheider
    25.09.2026 15:03

    Мне всегда транскрипции казались очень удобными. А почему сегодня от них (как будто) отказываются?
    Ну ладно онлайновые и компьютерные переводчики - там есть кнопка "прослушать". Но и в бумажных пособиях стали транскрипцию убирать. Сам видел в школьных учебниках современных.
    Или это ошибка наблюдения?


    1. einhorn Автор
      25.09.2026 15:03

      Здесь логика в том, что, дескать, для детей это слишком сложно - это нужно, по сути, учить ещё один язык. Я не очень разбираюсь в детской психологии, поэтому у меня нет своего мнения на этот счёт.

      Для взрослых транскрипция нужна обязательно (для английского). Аудио не подойдёт - потому что мозг будет интерпретировать английские звуки через матрицу родного языка. Например, для русского человека [iː] и [ɪ] превратятся в [и], и будет потерян важный контраст.


      1. Markscheider
        25.09.2026 15:03

        Идиотизм это, а не логика :) И не только для английского. Я за немецкий когда брался (хоть там неожиданных произношений меньше) - все равно по транскрипции скучал.

        А то что "отдельный язык" - это же шикарно: как эсперанто. Выучил и понимаешь как произносить любое слово.

        Но я не претендую на истину, т.к. может у меня деформация: наличие в анамнезе музыкального образования и желание звуки записать знаками :)


        1. DenisArd
          25.09.2026 15:03

          Я в школе немецкий учил - транскрипции по МФА не было. Наверно, потому, что немецкую фонетику русскоязычному достаточно просто объяснить на словах и примерах, произношение по орфографии восстанавливается достаточно однозначно, в отличие от английского. А вот группе, изучавшей английский без транскрипции было никуда.


          1. Tomasina
            25.09.2026 15:03

            Скрытый текст


            1. DenisArd
              25.09.2026 15:03

              Ну не используются в немецком звуки Щ и Ч, приходится выкручиваться в заимствованных словах. Тут немцу надо объяснять, что это за диковинные звуки, а мы то и так знаем, как звучит "борщ". А вот то, что широко используемая Ш пишется тройным сочетанием sch запоминается сходу. Во всяком случае, немецкая орфография с точки зрения правил чтения сильно менее заморочена, чем французская и английская.


              1. dimaviolinist
                25.09.2026 15:03

                Проще французских правил чтения вообще ничего не видел. Разве что итальянский.


            1. dimaviolinist
              25.09.2026 15:03

              Ну вот сегодня через жопу, получается, ехал))


    1. Blacpaul57
      25.09.2026 15:03

      В школах методисты просто снижают порог входа, чтобы не пугать детей дополнительными значками. Когда есть синтез речи в каждом утюге, многие считают запоминание кракозябр лишней тратой учебных часов


    1. Void-Cowboy
      25.09.2026 15:03

      я вот человек которому вообще туго идут любые человеческие языки

      и в школе все эти транскрипции были тем еще мучением, я в итоге научился только находить где ее правильно списать и заучивал по возможности произношение слов без этих непонятных пиктограм

      я если честно до сих пор вообще без понятия как читать эти иероглифы и очень рад что в наше время хватает аудио-курсов для прослушивания произношения всех слов и фраз

      как по мне нужно или отдельный курс вводить где будут обучать именно чтению и записи этих транскрипций (по типу как учат нотное письмо) или даже не начинать мучать детей непонятной мутью, пытаясь обучать двум разным языкам вперемешку и ожидать успеха в этом начинании


      1. einhorn Автор
        25.09.2026 15:03

        Проблема в том, что вы пропустили произношение слов через свой русскоязычный мозг, запомнили произношение в фонемах русского языка, и после этого будете воспроизводить слова с русским акцентом.

        Транскрипция же либо показывает, как произношение слов представляет себе в голове носитель (фонемическая/широкая транскрипция - та, что в учебниках); либо показывает объективную реальность - какие звуки там реально звучат (фонетическая/узкая транскрипция - та, что генерируется у меня на сайте)


        1. Void-Cowboy
          25.09.2026 15:03

          я понимаю и меня понимают? что еще нужно от знания языка то??

          я рад что просто научился новому языку, лично мне идеальное произношение нафиг не упало. И я не думаю что я один такой - нужно человеку идеально изучить, есть специальные лингвистические направления для этого.

          На текущий момент я вообще считаю что знание языков стремительно устаревает и перестает быть актуальным. Я не так давно у себя локально запускал реалтайм голосовой переводчик что переводит с задержкой в 0.2-0.3 сек сразу моим голосом в любой язык мира. Просто начинаешь иначе строить фразы что бы переводчик работал более чисто и все.

          И честно говоря в век поголовной грамотности голосовое общение еще больше обесценивается чем просто знание разных языков. А уж с текстом AI справляется лучше всего уже давно. Я еще до всего этого АИ-бума спокойно путешествовал зная что в случае чего я могу с телефона используя текстовый переводчик общаться с аборигенами.


          1. einhorn Автор
            25.09.2026 15:03

            Это хорошо, если вас понимают даже с русским акцентом.

            В английском языке гораздо выше порог акцента, после которого вас перестают нормально понимать (чем в русском) - из-за бедной морфологии и большого количества гласных. Даже если носитель вас в итоге понял, всё равно с акцентом он потратит на это больше усилий - а тратить усилия никто не любит.

            Плюс, у людей есть стереотипы. К говорящему без акцента всё равно немного лучше относятся.

            На интервью вы своего голосового помощника всё равно использовать не сможете.

            Еще один причина, почему заняться произношением имеет смысл - вы после этого начинаете лучше понимать английский на слух. Я до занятия фонетикой путал war ship и worship - а теперь я знаю, какие там фонемы, и всегда могу их отличить.


            1. Void-Cowboy
              25.09.2026 15:03

              как по мне с английским самые больше проблемы от носителей

              как раз толпа людей у которых английский не родной понимают друг друга гораздо лучше, чем если нужно слушать "родной американский" например.
              если у индусов просто непонятный акцент, то у носителей зачастую очень невнятная речь

              а за интервью - могу))))
              задержка в 0.3 это уже ни о чем, потому просто синхронизирую видео с переведенным голосом и хрен вы что докажете) даже если заметят лаги то "интернет плохой" и то это нужно вообще пытаться перебивать и тд что бы такое стало прям заметно.


              1. einhorn Автор
                25.09.2026 15:03

                Да, носители одного неродного акцента понимают друг друга очень хорошо (гораздо лучше, чем носители понимают их). А вот если соберутся индус, китаец и русский с акцентом - вот там начнётся жесть :)

                очень невнятная речь

                Нет, это просто так для вас звучит General American, который отличается от того английского, который у вас в голове. Ничего невнятного в General American нет, вы его просто хуже на слух понимаете, как раз из-за отсутствия глубокого понимания английской фонетики


                1. Void-Cowboy
                  25.09.2026 15:03

                  как по мне это классическая попытка натянуть баг на фичу, а неграмотность на "особенность".
                  встречал вполне нормальный академический английский от американцев да в целом еще лет 20 назад было нормальным тоном все фильмы и просто публичные речи проговаривать внятно и четко

                  "фишка английского" с расхождением устного и письменного как раз из-за того что поголовная грамотность началась относительно поздно, во второй половине 19 века, когда социальные сословия были уже давно и плотно разрушены. То есть количество заменило качество и оказалось проще принять то как говорит большинство, чем пытаться научить "чернь" правильно говорить.


                  1. notwithstanding
                    25.09.2026 15:03

                    Что-то вы выдумываете, орфография в целом зафиксировалась уже в XVII веке. А то, о чем вы говорите, в большей степени вызвано великим сдвигом гласных.


                  1. einhorn Автор
                    25.09.2026 15:03

                    Редко когда можно увидеть столько невежества в одном комментарии. Плюс, видно пещерное представление, будто какие-то акценты носителей объективно лучше, выше и понятнее других

                    встречал вполне нормальный академический английский от американцев

                    Носители всех языков в обычной жизни звучат невнятно для неносителей (кроме случаев, когда неноситель специально долго и упорно изучал фонетику и/или качал аудирование). Специально говорят более медленно и чётко только в определённых ситуациях: при разговоре с неносителями, с детьми, со слабослышащими, в публичных речах

                    еще лет 20 назад было нормальным тоном все фильмы и просто публичные речи проговаривать внятно и четко

                    Странная фраза про 20 лет. Фильмы и публичная речь 20 лет назад и сейсас с точки зрения чёткости произношения не отличаются никак.
                    В середине прошлого века был популярен Mid-Atlantic Accent - специальный элитный дикторский/сценический акцент (однако, некоторые люди и в жизни так разговаривали - например, Франклин Рузвельт). Возможно, вы под впечатлением от него. Тем, кто учил британский английский, понимать Mid-Atlantic гораздо легче, чем General American.

                    "фишка английского" с расхождением устного и письменного как раз из-за того что поголовная грамотность началась относительно поздно

                    Нет, это всё Great Vowel Shift, который произошёл гораздо раньше

                    второй половине 19 века, когда социальные сословия были уже давно и плотно разрушены

                    Как раз таки в викторианскую эпоху социальное неравество (да, на капиталистической основе, а не на феодальной, но какая разница) было очень велико, и произношение было самым главным классовым маркером. Можете посмотреть фильм 1964-го года My Fair Lady - какими словами носитель Received Pronunciation профессор-фонетист Генри Хиггинс ругает цветочницу Элизу Дулитл из-за её "низкого" произношения (фильм основан на пьесе Бернарда Шоу Пигмалион, и действие происходит где-то на рубеже веков)

                    оказалось проще принять то как говорит большинство

                    Всё ровно наоборот: в Британии до 60-х годов 20-го века Received Pronunciation - это был единственный возможный акцент для образованного джентельмена. Всё остальное - это для черни. Только с 60-х ситуация в Британии стала меняться. Сегодня Received Pronunciation - это дикторский акцент, который все понимают, но на котором реально говорит очень небольшая доля населения, и который ассоциируется с богатыми элитами (то есть, воспринимается слегка негативно).


  1. DenisArd
    25.09.2026 15:03

    Пара замечаний по терминологии:

    • "спектр фильтра" - в теории обработки сигналов это называется "частотная характеристика фильтра". У сигналов - спектры, у тракта - частотные характеристики (АЧХ, ФЧХ) или передаточные функции. У вас изображена АЧХ. В данном случае речь - сигнал, речевой аппарат - фильтр.

    • "скорость стоячей волны" - это вообще оксюморон какой-то. Скорость волны - это скорость движения её узлов и пучностей, т. е. точек с нулевой и максимальной амплитудой колебаний. У стоячей волны узлы и пучности по определению никуда не движутся, потому она и стоячая, скорость волны нулевая. Получается при наложении (интерференции) двух противоположно направленных волн, падающей и отраженной. Рассуждения о давлении, сечении трубы и скорости относятся к скорости воздушного потока, а не звуковой волны, это совсем разные вещи.


    1. einhorn Автор
      25.09.2026 15:03

      Спасибо, исправил :)


    1. Blacpaul57
      25.09.2026 15:03

      Сразу видно человека, сдававшего ТОР и сигналы в универе)


  1. Notrado
    25.09.2026 15:03

    Обратил внимание, что в половине номеров журнала в подзаголовке написано Dhi organ ov dhi fonètik tîtcer’z asóciécon (как и на Вашем скане), а в другой — Dhi organ ov dhi fonètik tîtcerz’ asóciécon. Причем они сосуществуют совместно в подшивке за год (в разных номерах).

    Забавно, но не связан ли этот разнобой с оригинальным французским названием ассоциации (основана в Париже), но в фонетической записи, как видим во французском названии журнала:

    lə mɛːtrə fɔnetik: ɔrgan də l asɔsjɑːsjɔ̃ fɔnetik de prɔfɛsœːr də lɑ̃ːg vivɑ̃ːt ( = Le Maître phonétique: organe de l’Association phonétique de professeurs de langues vivantes).


  1. black_warlock_iv
    25.09.2026 15:03

    Очень интересно, но такие статьи не на хабре надо выкладывать. Не надо превращать науку в профанацию.


    1. einhorn Автор
      25.09.2026 15:03

      Я не понимаю, что вам не нравится. Где, по вашему мнению, надо выкладывать такие статьи?

      Я планирую больше статей по фонетике, и мне нужна фундаментальная теоретическая статья, на которую я могу ссылаться с целью ликбеза. В чём здесь профанация?


      1. black_warlock_iv
        25.09.2026 15:03

        Такие статьи надо публиковать в профильных рецензируемых журналах.

        Только если статья в профильном журнале присутствует, можно писать популярную статью со ссылкой на научный оригинал. Если вы обходите эту процедуру и минуете этап с научной публикацией, это называется лженаука.


        1. einhorn Автор
          25.09.2026 15:03

          То, что здесь написано - это основы фонетики, известные уже 60 лет как. Этому место в учебниках (и на хабре), а не в профильных рецензируемых журналах. По-хорошему, это должен знать каждый лингвист (но по историческим причинам получилось иначе)


          1. black_warlock_iv
            25.09.2026 15:03

            Тогда стоило бы привести ссылки на публикации, на которых вы основываетесь. Хотя бы парочку для проформы. Но кстати, кроме собственно научных журналов и научных статей, есть и методические журналы и методические статьи. Не знаю как у вас в лингвистике, а вот “у нас” в физике хорошая методическая статья вполне может “залететь”.


            1. einhorn Автор
              25.09.2026 15:03

              Эта информация есть в тексте - Рассел 1928 и Ладефогед 1967. Этого достаточно, чтобы выйти на первоисточники: The Vowel: Its Physiological Mechanism as Shown by X-Ray и Three Areas of Experimental Phonetics

              "Для проформы" я ничего не делаю


              1. black_warlock_iv
                25.09.2026 15:03

                Это не то. Ну накарябал там Рассел что-то в 1928, что лично вам понравилось. Это заметили? Оценили? Много ссылок на эту работу? В обзоры это попало? В монографии? Сто лет как-никак прошло.

                Если нет, почему? Писать популярную статью можно и в таком случае, но надо ясно указать в таком случае: это не мейнстрим, ведущие специалисты с этим не согласны.


                1. einhorn Автор
                  25.09.2026 15:03

                  Рассел 1928 и Ладефогед 1967 - это мейнстрим в том смысле, что нет никого, кто был бы с этим не согласен.

                  Однако при этом мало кто говорит о проблемах графика МФА - видимо, многие лингвисты об этом просто не задумываются.


                  1. black_warlock_iv
                    25.09.2026 15:03

                    Понятно. Ну это такой промежуточный вариант тогда. Да, статья на хабре допустима, но лучше всё-таки методическая статья в научном журнале. Лингвисты хабр не читают, а если читают то статью всерьёз не воспримут.


                    1. einhorn Автор
                      25.09.2026 15:03

                      Целевая аудитория статьи - это не лингвисты, их всё равно на хабре очень мало.

                      Целевая аудитория - это айтишники, которых можно заинтересовать английской фонетикой.

                      Дальнейшие статьи по фонетике будут более практическими - например, подробный анализ какого-то множества похожих звуков.


                      1. inkelyad
                        25.09.2026 15:03

                        подробный анализ какого-то множества похожих звуков.

                        И как самому изобрести очередной фонетический алфавит (ну или рядом), позволяющий надиктовать последовательность букв/битов так, чтобы они в прицессе диктовки воспринялись именно так, как хотел отправитель.

                        Или что-то в духе "хорошая ли идея делать парольную фразу из специально изобретенных слогов". Опять же - чтобы не забыть, не мучаться насчет того, что именно тут было и так далее. Или все же лучше взять натуральные слова?


                      1. einhorn Автор
                        25.09.2026 15:03

                        Нет, в духе: "как уменьшить акцент в английском" и "как улучшить понимание английского на слух за счёт знания теории"


                      1. inkelyad
                        25.09.2026 15:03

                        Жалко. Статью от лингвиста "какой должна быть случайная строка, чтобы она не забылась и не перепуталась со своими собственными вариантами" - давно хочется увидеть. А то большая часть того, что видел - это приблизительно то же, что в известной картинке про "Correct horse battery staple". Тезис из которой о легкости запоминания все-таки вызывает сомнения.


                      1. black_warlock_iv
                        25.09.2026 15:03

                        В реальном языке строки состоят не из звуков, которые являются предметом исследования этой статьи, а из фонем.


                      1. notwithstanding
                        25.09.2026 15:03

                        И не из букв, которыми вы все это написали. И что?


                      1. einhorn Автор
                        25.09.2026 15:03

                        Вы неправы. Речь состоит и из звуков, и из фонем - смотря с какой стороны посмотреть.

                        Фонема - это наименьшая звуковая единица языка с точки зрения носителей. Звук (тут лучше использовать английский термин phone) - это то же самое, но только с точки зрения объективной реальности. Если для носителей два похожих звука никогда не различают смыслы (нет минимальных пар) - то они считаются аллофонами одной фонемы.

                        Распределение звуков между фонемами сильно зависит от языка. Именно поэтому словари, которые пишут фонематическую транскрипцию (что удобно для носителей, поскольку у них правильное преобразования фонемы->звуки уже встроено в мозг), плохо подходят для неносителей, которые избавляются от акцента. Использование неправильных аллофонов - это очень частая ошибка неносителей.

                        Моя статья не использует термин "фонема", потому что она говорит про все языки в целом. О фонемах говорят применительно к конкретному языку или диалекту.


    1. Liz_rd
      25.09.2026 15:03

      Научно-популярный формат является очень хорошей точкой входа для более глубокого изучения малознакомой темы. Многие именно поэтому и читают Хабр.

      Лично мне статья понравилась и подтолкнула к более детальному изучению стыка лингвистики/фонетики и анализа данных


      1. einhorn Автор
        25.09.2026 15:03

        Прекрасно, значит, я отлично справился со своей задачей.


  1. LavaLava
    25.09.2026 15:03

    Ну и мои любимые ископаемые ларингалы: их можно показать графике формант?


    1. einhorn Автор
      25.09.2026 15:03

      Показать можно, но это ничего не даст.

      Для согласных одних формант недостаточно, там всё сложнее.


  1. apayrus
    25.09.2026 15:03

    Спасибо, очень интересно. Не задумывался об этом


  1. ivanstor
    25.09.2026 15:03

    А как обстоят дела с вокодерами и синтезаторами речи? Первые известны лет 100 уже и применялись и применяются в связи. В том числе формантные вокодеры. При их разработке какая классификация применялась, на чем они были основаны? Каноническая или та, что описываете Вы. Или инженеры что-то свое придумали? Было бы очень интересно, ведь разработчикам был нужен конкретный надежный результат, а не академические упражнения. Ставки-то были немаленькие. Многие эти разработки были, фактически, стратегические (защищеная голосовая связь).


    1. einhorn Автор
      25.09.2026 15:03

      Для синтеза речи одних гласных недостаточно - нужны еще и согласные.

      Одной только теории формант недостаточно - нужно ещё, например, имитировать спектр шума для шумных согласных. А самые коварные - это аппроксиманты r и l, которые даже специалисту сложно на спектрограмме отделить от соседних гласных.

      Первые синтезаторы речи появились в конце 1930-х, и они были канальными вокодерами (то есть, они не были основаны на формантной теории из статьи - эту теорию тогда еще не разработали).


      1. ivanstor
        25.09.2026 15:03

        Это понятно. Но формантные вокодеры есть и применяются, не являясь экзотикой. И первые появились в середине прошлого века. Вот и интересно, какой теоретической базой руководствовались разработчики? Они вообще о наработках лингвистов знали? Или подошли к вопросу чисто практически, либо что-то свое придумали? Им то картинками обойтись было нельзя, нужны были цифры. (Динамических) спектров, огибающих и пр. Или вот помню, давно видел ролик: была физическая реализация синтезатора речи — модель голосового тракта в виде сложной дудки с клапанами м жуткими шевелящимися губами. Тоже ведь какая-то теория за этим стояла. И всё это мимо лингвистов прошло? Или нет?


        1. einhorn Автор
          25.09.2026 15:03

          Честно - не знаю. Никогда не изучал этот вопрос


  1. Blacpaul57
    25.09.2026 15:03

    В DSP с формантами и спектрограммами всегда было меньше шаманства, чем в академической фонетике с ее нарисованными от руки трапециями