Исходный размер 960x1200

как мозг обманывает нас при восприятии речи

Данный проект является учебной работой студента Школы дизайна или исследовательской работой преподавателя Школы дизайна. Данный проект не является коммерческим и служит образовательным целям

Голос, который я слышу, когда говорю, — это совсем не тот голос, который слышат другие. Мой собственный голос доносится до меня изнутри, из костей моего черепа, из глубин моего тела. Это самый интимный звук на свете, и именно поэтому его запись всегда кажется нам чужой

— Эдвард Йердж (Edward Yeager)

Концепция

В современном мире мы окружены цифровым звуком: общаемся голосовыми сообщениями, записываем подкасты, созваниваемся в зуме и отправляем аудиосообщения в мессенджерах. Наш голос стал главным инструментом взаимодействия с цифровой средой. Однако почти каждый человек сталкивается с удивительным парадоксом: когда мы слышим запись собственного голоса на диктофоне, мы испытываем сильный дискомфорт и отторжение. Нам кажется, что этот голос чужой, плоский, неприятный и «вообще не мой».

В психологии этот феномен даже получил официальное название — «голосовая конфронтация»

big
Исходный размер 670x377

Голосовая конфронтация — явление, при котором люди испытывают дискомфорт от звука собственного голоса.

Я выбрал тему «Как мозг обманывает нас при восприятии речи» неслучайно. Помимо учебы на саунд-дизайне, я преподаю вокал. На занятиях мои ученики постоянно сталкиваются с этой проблемой: они часто говорят, что им физически сложно воспринимать свой голос на диктофоне во время исполнения — в записи он звучит для них совсем по-другому, непривычно и часто даже отталкивающе. Наблюдая за этим изо дня в день, я решил глубоко разобраться в природе этого явления.

Как музыканту, мне важно понимать, как человек воспринимает звуки, как устроена психоакустика и почему возникает этот когнитивный диссонанс между «внутренним» и «внешним» аудиообразом. Также я захотел разобраться, как мозг обрабатывает речь и почему реальный физический звук может так сильно отличаться от наших ментальных ожиданий.

Концепция исследования заключается в том, чтобы проанализировать этот невидимый конфликт между биологическими иллюзиями нашего тела и объективной цифровой фиксацией звука.

Исходный размер 400x400

Диктофон обнажает «голосовую конфронтацию»

Введение. Архитектура синестезии: от физической волны к ментальному образу.

Чтобы понять, почему запись собственного голоса вызывает у нас когнитивный диссонанс, необходимо разрушить главный миф психоакустики: человеческое ухо — это не микрофон, а мозг — не линейный диктофон.

В физическом мире звука в привычном понимании нет. Есть лишь невидимые колебания воздуха (Стретт, 1877). А вот саму «речь» и «смысл» конструирует наш мозг. Наше восприятие работает по принципу «нисходящего процесса» (Грегори, 1970). Это значит, что мозг не просто пассивно слушает то, что приходит снаружи. Он работает как активный прогнозист: собирает звуки и накладывает на них наши ожидания, прошлый опыт и то, что мы видим глазами в этот момент.

Исходный размер 0x0

Джон Уильям Стретт — англ.физик. Он первым математически и физически описал, как звуковая волна ведёт себя в воздухе, как она огибает препятствия (например, человеческую голову) и затухает.

Исходный размер 1200x630

Ричард Грегори — британский психолог, который всю жизнь изучал иллюзии и то, как мы видим и слышим мир.

Наш мозг, словно саунд-дизайнер, постоянно занимается «апскейлингом» и чисткой звука, каждую секунду сглаживает окружающие шумы и адаптирует входящую аудиоволну под наши внутренние стандарты (создавая иллюзию идеального слуха).

Глава 1. История экранного монтажа

Эффект Мак-Гурка

Как преподаватель вокала, я постоянно повторяю ученикам, что артикуляция — это неотъемлемая часть пения. Но самое интересное начинается тогда, когда в игру вступает зрение постороннего наблюдателя. Оказывается, наши глаза могут буквально переписать то, что слышат наши уши.

В психоакустике этот феномен называется эффектом Мак-Гурка (McGurk & MacDonald, 1976).

Loading...

Эксперимент, который они провели, до гениальности прост, но его результаты сносят крышу. Испытуемому включают аудиозапись, где диктор четко произносит слог «БА-БА». Одновременно с этим на экране показывают видеоряд, где тот же диктор беззвучно артикулирует губами совершенно другой слог — «ГА-ГА».

Тут происходит магия восприятия. Мозг получает два конфликтующих сигнала: уши слышат «БА», глаза видят «ГА». Вместо того чтобы выбрать что-то одно или сойти с ума от когнитивного диссонанса, мозг мгновенно синтезирует компромисс — и человек абсолютно четко слышит третий слог: «ДА-ДА». Но стоит испытуемому закрыть глаза — он снова слышит исходное «БА-БА». Открывает — и зрение вновь диктует ушами.

Зрительная кора просто берет и перепрошивает фонетику физического звука (см. видео выше).

Эффект Кулешова

Саунд-дизайнерам и режиссерам монтажа этот баг восприятия знаком на интуитивном уровне уже очень давно. За полвека до официального открытия эффекта Мак-Гурка советские киноавангардисты во главе со Львом Кулешовым открыли фундаментальный закон кинематографа. Эффект Кулешова (1929) доказал: смысл кадра полностью меняется в зависимости от того, с каким следующим кадром он склеен (лицо актера + тарелка супа = голод; лицо актера + гроб = скорбь).

Исходный размер 1042x1280

Лев Владимирович Кулешов (1899–1970). Крёстный отец всего мирового киномонтажа.

Когда в кино пришел звук, этот принцип моментально масштабировался на аудиовизуальный ряд. Режиссер Дзига Вертов в своей работе «Человек с киноаппаратом» (1929) начал экспериментировать с радио-ухом и монтажом звука, создавая концепцию «слышу-вижу». Выяснилось, что склейка кадров способна полностью переписать интонацию, подтекст и даже само значение произнесенного на экране слова.

Исходный размер 882x1280

Реж. Дзига Вертов (1929)

Если мы видим на экране крупный план яростного, сжатого кулака, а за кадром звучит спокойный вздох — мозг считает этот вздох затаенной обидой или сдерживаемой агрессией. Но если тот же самый вздох наложить на кадр с бескрайним полем и закатом — ухо мгновенно «услышит» в нем облегчение и умиротворение. Физический аудиофайл один и тот же, но оптический контекст выступает в роли главного эквалайзера и редактора смысла.

Глава 2. Анатомический микшер

Если в первой главе мы рассматривали, как внешние медиа (киноэкран и монтажная склейка) способны подчинить себе наш слух, то во второй главе мы спустимся на уровень чистой физиологии. Самый близкий и интимный пример того, как сильно ментальный аудиообраз отличается от реальной звуковой волны, скрыт внутри нашей собственной головы.

Исходный размер 1199x768

«Наш собственный голос — единственный звук, который мы слышим одновременно изнутри и снаружи. Он укоренен в костях нашего черепа, и когда техника отделяет его от тела, мы чувствуем жуткое одиночество»

— Ги Скарпетта, французский писатель и критик

как мозг обманывает нас при восприятии речи
Проект создан 28.05.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше