Scena dźwiękowa w słuchawkach: od nieuchwytnej audiofilskiej magii do namacalnej fizyki

W szeroko pojętej publicystyce audio – ze szczególnym uwzględnieniem batalii w social mediach – niewiele jest zagadnień obrośniętych tak grubą warstwą mitologii, co „scena dźwiękowa w słuchawkach”: przestrzeń, stereofonia i lokalizacja źródeł pozornych. Przez lata utrwalił się całkiem wygodny dla recenzentów (i nie tylko) paradygmat: pasmo przenoszenia da się zmierzyć, zniekształcenia da się policzyć, ale „scena to niemierzalna dusza słuchawek”, dostępna wyłącznie subiektywnemu aparatowi poznawczemu oceniającego.

W rzeczywistości scena dźwiękowa w słuchawkach wcale nie bierze się z metafizyki, lecz jest bezpośrednią funkcją fizyki fali akustycznej, geometrii komory przetwornika oraz psychoakustyki. Choć nie istnieje jeden prosty wskaźnik laboratoryjny o nazwie „szerokość sceny w metrach”, to parametry decydujące o poprawności lokalizacji i propagacji przestrzennej są w pełni mierzalne, powtarzalne i podlegają twardym prawom inżynierii dźwięku.

I to właśnie o nich sobie tutaj szerzej opowiemy.

 

Scena dźwiękowa w słuchawkach a kolumnach: dwie różne domeny percepcji przestrzennej

Aby zrozumieć ograniczenia i specyfikę sceny słuchawkowej, należy zacząć od zestawienia jej z odsłuchem głośnikowym. W polu swobodnym lub pomieszczeniu odsłuchowym z parą monitorów stereofonia opiera się na naturalnym zjawisku przesłuchu międzyusznego (ang. crossfeed / acoustic crosstalk). Fala wyemitowana przez lewy głośnik dociera najpierw do ucha lewego, a ułamek milisekundy później – ugięta wokół głowy i przefiltrowana przez geometrię twarzoczaszki oraz małżowin – trafia do ucha prawego.

Mózg interpretuje te zjawiska dwutorowo:

  • Poprzez międzyuszną różnicę czasu (ITD – Interaural Time Difference), kluczową w zakresie niskich i średnich częstotliwości poniżej 1,5 kHz.
  • Poprzez międzyuszną różnicę poziomów (ILD – Interaural Level Difference), wynikającą z cienia akustycznego głowy dla fal o długości mniejszej niż jej szerokość (powyżej 1,5–2 kHz).

W klasycznych słuchawkach przesłuch międzyuszny w domenie akustycznej nie istnieje: lewy przetwornik gra wyłącznie do lewego kanału słuchowego, a prawy do prawego. Mózg zostaje pozbawiony naturalnych wskazówek opóźnieniowych, co prowadzi do zjawiska lateralizacji – lokalizowania pozornych źródeł dźwięku wewnątrz czaszki lub na wąskiej osi łączącej uszy.

Konstruktor słuchawek musi zatem stworzyć iluzję przestrzeni sztucznie, manipulując geometrią obudowy, kątem natarcia fali na małżowinę oraz specyficznym strojeniem pasma, które ma oszukać ludzki aparat słuchowy.

 

Demistyfikacja „niemierzalności”: co w stereofonii podlega twardej metrologii?

Twierdzenie, że sceny nie da się zweryfikować na stanowisku pomiarowym, wynika z niezrozumienia relacji między parametrami sygnału a psychoakustyką. W Audiofanatyk Lab, czy jakimkolwiek innym laboratorium elektroakustycznym, wyróżniamy cztery krytyczne składowe determinujące właściwości stereofoniczne toru słuchawkowego (nadal na przykładzie SRS-X1000):

Scena dźwiękowa w słuchawkach - symetria kanałów

1. Symetria kanałów (Channel Matching / Delta SPL): To absolutny fundament stabilności sceny. Jeżeli przetworniki wykazują rozrzut produkcyjny rzędu 2–3 dB w newralgicznym podzakresie 1–5 kHz, pozorny środek panoramy ulega rozmyciu lub dryfuje w stronę głośniejszego przetwornika. Wokalista zamiast punktowego, ostrego skupienia na środku zaczyna „pływać” w zależności od wysokości rejestru, w którym śpiewa. Stabilna, precyzyjna lokalizacja wymaga błędu średniego poniżej 1,0–1,2 dB w paśmie roboczym.

Scena dźwiękowa w słuchawkach - CSD i impuls

2. Odpowiedź impulsowa i wygaszanie energii (CSD / Cumulative Spectral Decay): Zdolność do oddania głębi i gradacji planów zależy od tego, jak szybko układ drgający przetwornika przestaje emitować energię po zaniku sygnału pobudzającego. Jeżeli membrana generuje rezonanse pasożytnicze (ringing), a komora przetwornika ma problemy z falami stojącymi, drobne sygnały pogłosowe zawarte w nagraniu – decydujące o kubaturze sali – zostają zamaskowane. Czyste tło pomiarowe na wykresie wodospadowym przekłada się bezpośrednio na separację instrumentów.

3. Zgodność fazowa i korelacja czasowa: Wszelkie zniekształcenia fazowe między lewym a prawym przetwornikiem niszczą koherencję czasową. Nawet drobne przesunięcia fazy w komorze akustycznej zaburzają interpretację pozornych przesunięć kątowych, sprawiając, że dźwięk staje się dwuwymiarowy i oderwany od naturalnej stereofonii.

Scena dźwiękowa w słuchawkach - FR

4. Kształt pasma przenoszenia (funkcja transferu HRTF): Ucho ludzkie ocenia odległość i pozycję źródła na podstawie proporcji konkretnych rejestrów częstotliwościowych:

  • 1 kHz – 4 kHz (ear gain i pasmo obecności): Kluczowy zakres definiujący bliskość pierwszego planu. Wycofanie energii w tym rejonie powoduje odsunięcie wokali w głąb sceny, natomiast zbyt agresywne podbicie okolic 3 kHz skutkuje nienaturalnym przysunięciem źródeł tuż przed twarz słuchacza, redukując percepcję dystansu.
  • 6 kHz – 10 kHz (interakcja z małżowiną / pinna activation): Pasmo wyższej góry odpowiada za rozdzielczość przestrzenną, ogniskowanie kątowe oraz czytelność transjentów.
  • Powyżej 10 kHz (pasmo powietrza / air): Skrajny sopran dostarcza informacji o wybrzmieniach w pomieszczeniu, akustyce studia i pogłosach; jego strome ścięcie eliminuje wrażenie kubatury i otwartości. 

Aktualnie każdy wygenerowany raport z procedury metrologicznej słuchawek pełnowymiarowych zawiera praktycznie wszystkie wymienione dane pomiarowe.

 

Wpływ geometrii komory i padów: fizyka zamiast mitu odległości

Popularnym błędem intuicyjnym jest przekonanie, że proste odsunięcie przetwornika od ucha grubszą poduszką automatycznie powiększa scenę o metr lub dwa. Komora uformowana między membraną a głową nie jest miniaturową salą koncertową ze swobodną propagacją fali, lecz zamkniętym lub półotwartym układem rezonansowym. Zmiana grubości lub materiału padów drastycznie modyfikuje objętość komory, przesuwa mody własne i zmienia kąt natarcia fali na małżowinę uszną (pinna).

Zastosowanie litej skóry maksymalizuje szczelność ciśnieniową (seal) i transfer basu, ale działa jak akustyczny reflektor dla wyższych częstotliwości, generując wielokrotne odbicia niszczące transjenty. Z kolei pady welurowe tłumią rezonanse komory, działając jak filtr akustyczny. W konstrukcjach wybitnych przestrzennie (jak Sennheiser HD 800 S) przetworniki umieszczane są celowo pod kątem (angled drivers), aby czoło fali trafiało na fałdy małżowiny od frontu – aktywując przednie zagłębienia małżowiny i zbliżając geometrię propagacji do odsłuchu z kolumn. Przypadkowa wymiana padów na niefabryczne zamienniki bezpowrotnie niszczy te starannie wyliczone zależności.

 

Studium przypadku: STAX SRS-X1000 jako wzorzec laboratoryjny

Zestaw elektrostatyczny STAX SRS-X1000 (słuchawki SR-X1 wraz z energizerem SRM-270S) stanowi modelowy przykład tego, jak twarde dane z protokołu metrologicznego tłumaczą się na konkretne zachowanie przestrzenne w odsłuchu.

W moich pomiarach zestaw ten wykazuje wzorową dyscyplinę:

  • Średnie odchylenie bezwzględne między kanałami w podzakresie 100 Hz – 8 kHz wynosi zaledwie 1,0 dB, a stałe przesunięcie panoramy w kluczowym przedziale 200 Hz – 2 kHz to zaledwie -0,9 dB.
  • Brak cewki i znikoma masa ultracienkiej membrany elektrostatycznej dają niemal natychmiastowe wygaszanie transjentów, bez powidoków rezonansowych typowych dla układów dynamicznych.
  • Pasmo przenoszenia cechuje wyraźny szczyt w rejonie 3 kHz (108,4 dB SPL względem 95,2 dB przy 500 Hz) oraz szybki spadek energii na skraju pasma (82,8 dB przy 15 kHz).

Zatem pytanie: jak te liczby przekładają się na odbiór stereofonii i lokalizacji?

Dzięki doskonałemu zbalansowaniu kanałów i natychmiastowej odpowiedzi impulsowej lokalizacja źródeł pozornych w SR-X1 jest bezwzględnie punktowa. Separacja warstw miksu i gradacja planów w głąb stoją na poziomie referencyjnym – żaden instrument nie zlewa się z sąsiednim, a tło pozostaje idealnie czarne.

Jednocześnie rozmiar sceny w wymiarze bezwzględnym nie jest przesadnie szeroki. Płaska, okrągła konstrukcja komory przetwornika bez nachylenia pod kątem względem małżowiny, w połączeniu z mocnym ear gainem przy 3 kHz, rysuje pierwszy plan bardzo blisko głowy, intymnie i bezpośrednio. Z kolei spadek natężenia przy 15 kHz ogranicza poczucie otwarcia najwyższego rejestru, sprawiając, że akustyka pomieszczenia wybrzmiewa krócej niż w konstrukcjach o mocniej doświetlonej skrajnej górze.

Każda z tych cech przestrzennych ma swoje bezpośrednie odzwierciedlenie w wykresach i liczbach, ale też umocowanie w walorach fizycznych techniki elektrostatycznej. Mówiąc wprost: jedno wynika z drugiego.

 

Pułapka generalizacji: indywidualne izofony, HRTF i anatomia ucha

No dobrze. Skoro mechanika sceny jest mierzalna, dlaczego opisy przestrzenne w recenzjach potrafią się diametralnie różnić między słuchaczami? Tutaj dochodzimy do największego ryzyka związanego z formułowaniem jednoznacznych wyroków: indywidualnej zmienności anatomicznej.

1. Różnice w budowie małżowiny i kanału słuchowego: Każdy człowiek posiada unikalną geometrię ucha zewnętrznego (pinna) oraz przewodu słuchowego. Oznacza to, że funkcja transferu głowy (HRTF) jest dla każdego układu słuchowego inna. Gdy fala akustyczna opuszcza przetwornik słuchawkowy, oddziałuje z fałdami małżowiny pod konkretnym kątem. To, co na sztucznej głowie pomiarowej ze standardową małżowiną daje gładkie przejście fazowe, na uchu o innej głębokości muszli może wygenerować lokalne zapadlisko lub rezonans przesuwający percepcję sceny.

2. Indywidualne krzywe jednakowej głośności (izofony): Czułość słuchu w funkcji częstotliwości różni się w zależności od wieku, stopnia zmęczenia słuchowego oraz ubytków percepcyjnych. Użytkownik ze słabszą czułością w okolicach 3–4 kHz odbierze te same słuchawki jako grające z większego dystansu niż osoba z nadwrażliwością w tym rejonie, dla której przekaz będzie agresywny, płaski i zlokalizowany tuż przed oczami.

3. Sprzężenie akustyczne i seal: W konstrukcjach nausznych i wokółusznych docisk pałąka, grubość zauszników okularów czy gęstość pianki w padach decydują o objętości poduszkowej komory akustycznej. Zmiana geometrii komory o 2–3 mm przesuwa punkty rezonansowe w rejonie 6–9 kHz, bezpośrednio wpływając na lokalizację wysokich tonów w przestrzeni.

 

Mit elektroniki: czy przetwornik R2R i „synergia toru” potrafią fizycznie powiększyć scenę?

Tematyka sceny nie obejmuje jednak tylko samych słuchawek.

W rozmowach z użytkownikami zdarzało mi się odnotowywać przekonanie, że określone implementacje współczesnych DAC-ów – w szczególności właśnie dyskretne drabinki rezystorowe R2R – posiadają unikalną zdolność manipulowania barwą dźwięku. Trochę tak, jakby rynek próbował wykreować tę architekturę na odpowiednik lamp elektronowych w świecie przetworników cyfrowo-analogowych.

Coraz częściej jednak zaczęło się to pojawiać w kontekście „otwierania sceny”, kreowania „holografii” oraz dodawania trójwymiarowości w sposób niedostępny dla nowoczesnych układów Delta-Sigma.

Z punktu widzenia analizy sygnałowej i teorii obwodów informacja przestrzenna (czasy opóźnień międzykanałowych, proporcje fazowe, transjenty i wybrzmienia pogłosowe) jest w całości zawarta w materiale źródłowym. Prawidłowo zaprojektowany, transparentny przetwornik DAC oraz wzmacniacz operują w domenie liniowej: ich jedynym zadaniem jest bezstratna konwersja i wzmocnienie napięciowe bez modyfikowania relacji czasowo-amplitudowych. Jeżeli jakiekolwiek urządzenie w torze w namacalny sposób „zmienia scenę”, nie wynika to z metafizycznej synergii, lecz z mierzalnych odstępstw od wierności sygnałowej:

1. Efekt filtracji i zniekształceń w architekturach R2R (NOS): Większość konstrukcji R2R pracujących w trybie bez oversamplingu (NOS) wykazuje zauważalny spadek energii na skraju pasma słyszalnego (tłumienie funkcją sinc – sinc roll-off sięgające 2–3 dB przy 20 kHz) oraz obecność aliasingu ponad częstotliwością Nyquista. W połączeniu z wyższym poziomem parzystych harmonicznych oraz gorszą separacją międzykanałową (przesłuch na poziomie np. -70 dB zamiast -115 dB w układach scalonych D/S) dochodzi do swoistego rozmycia krawędzi pozornych źródeł dźwięku. Mózg słuchacza odbiera zmiękczenie ostrych transjentów i utratę punktowego skupienia na środku panoramy jako „plastyczność” lub „powietrze”. W praktyce nie mamy tu do czynienia z powiększeniem kubatury nagrania, lecz ze spadkiem precyzji lokalizacyjnej, który subiektywnie maskuje agresję realizacji.

2. Dzielnik napięcia i pozorna magia adapterów impedancyjnych: Popularnym zjawiskiem w środowisku entuzjastów jest stosowanie adapterów podnoszących rezystancję wyjściową źródła w celu „poprawy przestrzeni” lub utemperowania wysokich tonów. W rzeczywistości wpięcie szeregowego opornika tworzy z przetwornikiem słuchawkowym elementarny dzielnik napięcia. Jeżeli moduł impedancji słuchawek nie jest idealnie płaski w funkcji częstotliwości (co jest normą w konstrukcjach dynamicznych z wyraźnym rezonansem ƒₛ oraz układach wieloprzetwornikowych i hybrydowych), wypadkowe pasmo przenoszenia (SPL) ulega modulacji. Wygładzenie wypiętrzenia w rejonie 6–8 kHz poprzez celowe niedopasowanie impedancyjne to nic innego jak sprzętowy, stały filtr pasywny – uzyskany jednak kosztem drastycznego spadku współczynnika tłumienia (damping factor) i pogorszenia kontroli odpowiedzi impulsowej membrany.

3. Determinizm korekcji parametrycznej (PEQ): Wszelkie modyfikacje równowagi tonalnej przypisywane „synergii klocków” – od odsunięcia wokali poprzez manipulację rejonem 2–4 kHz, po doświetlenie wybrzmień filtrem półkowym powyżej 10 kHz – są w pełni powtarzalne przy użyciu precyzyjnego toru DSP/PEQ na przezroczystym sprzęcie metrologicznym. Różnica polega na tym, że korekcja cyfrowa operuje w kontrolowanym środowisku matematycznym bez degradacji marginesu szumowego, bez podbijania zniekształceń intermodulacyjnych (IMD) i bez utraty stabilności fazowej toru.

 

Podsumowanie

Ostateczny wniosek metrologiczny jest jednoznaczny: wzmacniacz i przetwornik nie generują przestrzeni akustycznej. Mogą ją jedynie precyzyjnie przekazać, zdegradować zniekształceniami lub zafałszować zmianą charakterystyki częstotliwościowej. Prawdziwe kształtowanie sceny w 99% pozostaje domeną akustyki przetwornika słuchawkowego, geometrii jego komory oraz interakcji czoła fali z ludzką małżowiną.

Z kolei opisywanie stereofonii i lokalizacji w słuchawkach wyłącznie za pomocą poetyckich metafor o „napowietrzeniu”, „oddechu” i „magicznej aurze” jest w dłuższej perspektywie ślepą uliczką. Stereofonia jest bowiem zupełnie mierzalnym zjawiskiem fizycznym, opartym na:

  • zbieżności czasowej,
  • symetrii przetworników,
  • czystości odpowiedzi impulsowej,
  • geometrii fali docierającej do ucha.

W rzetelnej analizie nie wolno jednak zapominać o drugiej stronie medalu: punkt pomiarowy na fantomie jest znormalizowanym punktem odniesienia, podczas gdy ostateczny odsłuch odbywa się na żywym, unikalnym aparacie anatomicznym użytkownika.

Właśnie dlatego profesjonalna ocena przestrzeni słuchawkowej musi łączyć dwa filary: twardą weryfikację metrologiczną parametrów toru oraz świadomy, psychoakustyczny opis odsłuchowy, wolny od audiofilskich mitów. Na opisy sceniczności za pomocą słów nadal będziemy się natykać, nie jest to żaden problem. Natomiast nie jest prawdą, że nie da się ich wyjaśnić, a opisów scenicznych poprzeć dowodami lub zdementować na bazie powszechnej – zdawałoby się – wiedzy o tym jak nasz organizm interpretuje dźwięk.

Jakub Łopatko
Jakub Łopatko

Autor, publicysta i pasjonat metrologii elektroakustycznej z ponad kilkunastoletnim doświadczeniem w branży audio. Twórca i jedyny operator platformy Audiofanatyk™, łączący w recenzjach twardy rygor pomiarowy z analizą psychoakustyczną oraz specyficznym poczuciem logicznego humoru.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *