他用一整支片證明 YouTube 可以好聽,而 YouTube 難聽的真正原因他講錯了一半#

這支片(2026-08-18,18 分 51 秒)是店內實機示範:用同一套 StormAudio 劇院系統去聽 YouTube 上的音樂影片,過程中改 Dirac 曲線、開上混,最後導向一個主張——兩聲道和家庭劇院不必分兩套。

本站要先講清楚這支片的性質:全片拍攝於他自己的店內(片中自陳「我們那個開店」「我們每個月都有播影片的日子」),示範器材是店內系統,而結論正好是「一套高價系統可以身兼兩用」。技術過程照收並查證,「一套就夠」這種同時是結論、也是他的生意方向的判斷,本站標明立場不收為事實。


技術上,這支片有兩件他做對的事、兩件他講錯的事,而且錯的都不動搖結論。

做對的第一件:他調 Dirac 曲線時,發現人聲加厚之後高頻細節不見了,處置是把中頻拉回來,而不是再去加高頻(kp-04)。這是心理聲學上正確的方向——遮蔽是往上擴散的,被蓋住的高頻要靠移除遮蔽者來救,不是靠加大被遮蔽者。

做對的第二件:他自己標了上混的限制,「我認為還差得遠」「並不是一個穩定的東西」(kp-06)。在一支示範自家系統有多好的影片裡主動說出效果不穩定,本站記在加分欄。

講錯的第一件:他把「音場縮在喇叭中間」歸因於 YouTube 人聲厚度不夠(kp-03)。現象是真的,理由是錯的。低位元率壓縮讓音場變窄的真正機制是強度立體聲(intensity stereo)——約 2kHz 以上兩聲道被合併成單一訊號加上音量比例,原始音場愈寬、被抹得愈明顯。這跟人聲厚度是兩件事。

講錯的第二件:他說上混是把「比較偏高頻的聲音往外擴展」(kp-05)。Dolby 官方的說法是把非方向性的環境成分(原文舉例是雨聲、風聲)映到天空聲道,判準是方向性與相關性,不是頻率高低。高頻常常同時是環境音,所以他的觀察對得上結果,但講成「高頻往外丟」會讓人以為調 EQ 就能改變上混行為。

兩處都只換掉理由,不動搖他的結論:音場真的會縮、上混真的能打開。

往下讀之前先問自己 這支片最實用的部分不是「一套能不能兩用」,是他調曲線那五分鐘的思路:加了中頻、發現高頻不見、把中頻拉回去而不是加高頻。那個決定是對的,而且大多數人會做反的。至於一套兩用——他示範的是這套系統做得到,不是每套都做得到,也不是你需要。

(預設關閉:點連結跳回原片體驗較好,也把流量還給原作者)
01 他主張兩聲道與家庭劇院不必分兩套,而業界慣例是分開 value
他在哪裡講的
「他還是分成兩套嘛」
2026-08-18 一套音響,真的能同時玩好兩聲道和家庭劇院?
▶ 跳到 1035 秒聽本人講 →
機轉:為什麼會這樣
他描述現況是「大部分使用 StormAudio 的人,他還是分成兩套嘛,有一套兩聲道的,然後有一套 StormAudio 的劇院」,並指出這些人「總是認為說兩個是不能混用的」。他的反駁是整支片的示範本身:同一套系統聽 YouTube 音樂影片、調曲線、開上混,最後說「甚至可以超越我們以前的玩法」(t=1050)。他另外給了一個成本論證:「買一個 StormAudio 拿來只聽純音樂感覺好像不划算,買了 StormAudio 又只看電影,又覺得不划算」。
實證查核

這是取捨判斷,不是可證偽的技術主張,本站不做實證分級。

成本論證的部分本身是自洽的:一台高階環繞處理器若只用單一用途,其多聲道處理與空間校正能力確實閒置。這個推論不需要外部證據就成立。

而本站可以查核的是他有沒有誠實標示前提——他有。片中明講這是在他調過曲線、開過上混之後才成立的結果,不是開箱即用。

查證來源

  • 成本論證為自洽推論,不需外部證據
  • 前提(需調曲線、需開上混)由講者於片中自行標示
  • 拍攝地點與器材歸屬依片中自陳認定
要補一句

⚠️ 立場揭露:這支片拍攝於他自己的店內(片中自陳「我們那個開店」「7 月跟 8 月都貼上去了」「我們每個月都有那個播影片的日子」),示範器材為店內系統,而結論正好是「一套高價環繞處理器可以身兼兩用」——這是一個支持購買的論點。

⚠️ 更重要的是,這個結論的成立條件在片中被他自己說掉了:整套流程需要為 YouTube 另存一條 Dirac 曲線、需要判斷什麼時候開上混、需要在不同曲線之間手動切換。

也就是說「一套兩用」的代價不是錢,是操作。分兩套的人省掉的正是這件事——切到哪套就是哪套的聲音,不用想。這個成本片中沒有計入比較。

可帶走的做法
如果你正在考慮走這條路,先問自己願不願意為了聽 YouTube 多存一組曲線、並記得切換。答案是否,那分兩套對你比較便宜——因為省下的是每天的操作,不是一次的錢。
02 YouTube 的音質先天受限,是有損壓縮,而且他認為這合理不必苛責 strong
他在哪裡講的
「所以他的音質爛是正常的」
2026-08-18 一套音響,真的能同時玩好兩聲道和家庭劇院?
▶ 跳到 755 秒聽本人講 →
機轉:為什麼會這樣
他的論證走成本:「他如果每一支影片都是給你無損的聲音,他得有多大的流量」,並反問聽眾付了多少錢——「一個月幾十塊錢,你還要人家怎樣」。他同時給了 YouTube 正面評價:「我們每個月都會發現 YouTube 的格式、聲音格式在變化,他已經不斷地在努力」。結論是「但是再怎麼樣他是有損」。
實證查核

「有損」這件事沒有爭議,實際數字也對得上他的定性。

YouTube 供應的音訊是 AAC 或 Opus,兩者皆為有損編碼,從不使用無損格式。一般影片的 AAC 大約在 128kbps 等級(實測最高約 126kbps),Opus 則落在 56–165kbps 之間;YouTube Music 的預設「一般」品質為 128kbps,「高」為 256kbps。

他說「格式每個月在變」也不是誇飾:YouTube 確實持續在調整供應的音訊格式與編碼參數,Opus 的採用本身就是這個過程的一部分。

查證來源

  • YouTube 使用 AAC 與 Opus,皆為有損編碼
  • 一般影片 AAC 約 128kbps;Opus 約 56–165kbps
  • YouTube Music 預設 128kbps、高品質 256kbps
要補一句

⚠️ 他把「有損」直接等同於「音質爛」,這一步在 2026 年已經站不太住。128kbps 的 AAC 或 Opus 對絕大多數素材而言遠不是「爛」,Opus 在中低位元率的表現尤其好。

這支片真正聽得出差別的原因,反而是他自己示範的那兩首歌的錄音特性差異很大(一首吉他獨奏、一首年輕聲樂),而不是位元率把它們毀了。他把兩件事混在一起講了。

可帶走的做法
同一首歌在 YouTube 上覺得難聽時,先換一個版本(官方頻道 vs 轉載)再下結論。轉載常常是二次壓縮,那個差距比 YouTube 本身的位元率大得多。
03 他觀察到 YouTube 來源的音場會縮在兩支喇叭之間——現象成立,但他給的理由不是真正的機制 contested
他在哪裡講的
「就是他的聲音是縮在這個喇叭中間」
2026-08-18 一套音響,真的能同時玩好兩聲道和家庭劇院?
▶ 跳到 626 秒聽本人講 →
機轉:為什麼會這樣
他把音場窄縮跟前面講的「YouTube 人聲厚度會比較低一些」(t=396)連在一起講,並用 MP3 年代的經驗類比:「打開 MP3 發現超難聽,就整個音場是開不了的,細節上不去也下不去,然後音場是縮在這裡面」。也就是他把音場問題歸到「音質不好」這個籠統的類別下。
實證查核

現象本站收錄;機制本站改寫。

低位元率壓縮確實會讓音場變窄,但機制是強度立體聲(intensity stereo):編碼器把左右聲道在較高頻段合併成單一訊號+各頻段的音量比例,藉此省下位元。這在心理聲學上被認為可接受,因為人耳對約 2kHz 以上的訊號相位並不敏感。

代價正好就是音場:文獻明確指出,強度立體聲在低位元率下會抹糊立體聲像,而且原始音場愈寬、愈明顯。因為頻段劃分很寬,它無法同時表現「左聲道 10kHz、右聲道 10.1kHz」這種情形,兩者會被推到中間。

這正是他聽到的:聲音縮在兩支喇叭之間。

查證來源

  • 強度立體聲:高頻段以單一訊號+音量比例取代左右聲道
  • 心理聲學依據:人耳對約 2kHz 以上相位不敏感
  • 已知副作用:低位元率下抹糊立體聲像,原始音場愈寬愈明顯
  • AAC 與 Opus 皆自動使用聯合立體聲最佳化
要補一句

⚠️ 為什麼要糾正這條,而不是算他講對了:因為理由決定你會怎麼處理它。

如果你相信是「人聲厚度不夠」,你會去調 EQ——而 EQ 救不回已經被合併掉的聲道間資訊,那個資訊在編碼階段就不存在了。

如果你知道是聲道資訊被合併,你就會知道只有兩條路:換無損來源,或者用上混這類「重新製造空間感」的手段——而後者正是他這支片後半段真正做的事。

他的處置是對的,他對處置的解釋不是。

可帶走的做法
覺得串流音場變窄時,不要先動 EQ。先拿同一首歌的無損檔比一次——如果無損的音場是開的,那就是編碼造成的,EQ 怎麼調都補不回來。
04 他把人聲拉厚之後發現高頻細節不見了,處置是把中頻降回來而不是再加高頻 strong
他在哪裡講的
「中頻多了會蓋掉你高頻的細節」
2026-08-18 一套音響,真的能同時玩好兩聲道和家庭劇院?
▶ 跳到 474 秒聽本人講 →
機轉:為什麼會這樣
他為 YouTube 素材調的第一版曲線是「在人聲的地方把他拉高一點」加上「前面聽起來會太尖銳,那我們就把他降下來」。切歌之後發現吉他那首失去刺激感,於是判斷「這個中頻給他加太多了」,處置是把中頻從約 1.4dB 拉回「1dB 就好了,就把這個多出來的 0.4dB 把他砍掉」(t=481),高頻則「不要把他降那麼低了,稍微降一些些就好」。切換後他確認「這樣高頻的細節就回來了」(t=606)。
實證查核

這條的方向在心理聲學上是標準答案。

遮蔽(masking)指較強的聲音降低鄰近頻率較弱聲音的可聽度,而且遮蔽是不對稱的:一個 1kHz 音對高頻的遮蔽效果隨音量增加而明顯強於對低頻,這就是遮蔽的向上擴散(upward spread of masking)。

因此混音上的標準處置正是他做的那個:訊號的高頻能量其實夠,只是被較低頻的成分蓋住了;與其加高頻,不如降低造成遮蔽的低頻/中頻成分。

人耳在 2–5kHz 最敏感,這也是為什麼中頻只多了零點幾 dB 就足以蓋掉上面的細節。

查證來源

  • 遮蔽:強訊號降低鄰近頻率弱訊號的可聽度
  • 遮蔽的向上擴散:對高頻的遮蔽強於對低頻
  • 標準處置:降低遮蔽者而非提升被遮蔽者
  • 人耳最敏感區約 2–5kHz
要補一句

⚠️ 要注意他調的是 0.4dB。這個量級的差異在單獨聆聽時幾乎不可能分辨,他自己在片尾也承認需要重複聽上百次才聽得出來(kp-08)。

所以這條的可複製部分是「方向」,不是「數字」:中頻多了就砍中頻,不要加高頻。至於砍多少,他的 0.4dB 對應的是他那間店、那對喇叭、那條曲線,抄數字沒有意義。

可帶走的做法
調 EQ 時如果「加了某段之後別的地方變模糊」,先回去減你剛加的那段,不要再加第三段。連加三段的結果一定是整條曲線抬高、動態變小。
05 他解釋上混的原理是把偏高頻的聲音往環繞與天空聲道擴展——結果對,判準說錯 moderate
他在哪裡講的
「比較偏高頻的聲音把他往外擴展」
2026-08-18 一套音響,真的能同時玩好兩聲道和家庭劇院?
▶ 跳到 804 秒聽本人講 →
機轉:為什麼會這樣
他先問「什麼東西會當成殘響」(t=791),自答是「當必須從旁邊來,通常是高頻、空氣的聲音,或者是一些音效」,接著說 StormAudio「在這個運算上,他會把這個比較偏高頻的聲音把他往外擴展,把他擴展到外面去」,因此「剛剛那個音場縮在裡面的問題就會解決掉」。他實際開啟的是 Dolby Surround 上混。
實證查核

結果收錄,判準改寫。

上混器的工作是用演算法從既有訊號中萃取空間資訊,讓內容聽起來像是為多聲道混音的。而 Dolby 對天空聲道的說明是:非方向性的環境效果(原文舉例為雨聲、風聲)被映到天空聲道,處理方式與環繞聲道對環境內容的處理相似。

也就是判準是「方向性/環境性」,不是「頻率高低」。高頻成分常常同時具有環境性(空氣感、殘響尾音、細碎音效),所以他的觀察對得上結果——但這是相關,不是機制。

查證來源

  • Dolby:非方向性環境效果(雨、風)映到天空聲道
  • 上混以演算法萃取空間資訊而非依頻率分派
  • 喇叭擺位為影響上混表現的主要因素之一
  • 各系統演算法不同,同素材結果有差異
要補一句

⚠️ 這個差別會影響你怎麼用它。

如果你以為上混是「把高頻丟出去」,你會想用 EQ 去操縱它——加高頻讓環繞更多、減高頻讓它收斂。實際上不會這樣運作:一段高頻但高度相關(左右幾乎相同)的訊號會被判為前方定位,怎麼加都不會被丟到天空聲道去。

真正影響上混結果的是素材本身的聲道相關性,以及演算法與喇叭配置。外部資料也明確指出:喇叭擺位是影響上混表現最大的因素之一,而各系統演算法不同、同一素材結果會有差異。

⚠️ 附帶一個諷刺的地方:上混要靠聲道間的差異來工作,而 kp-03 的強度立體聲正好在高頻抹掉聲道間差異。用上混救有損來源的音場,本質上是用演算法重造一個被編碼器丟掉的東西,不是把它找回來。

可帶走的做法
上混效果不好時先檢查擺位與素材,不要去動 EQ。EQ 改不了聲道相關性,而上混吃的就是聲道相關性。
06 他主動說上混達不到真正的全景聲效果,而且結果不穩定 moderate
他在哪裡講的
「我認為還差得遠」
2026-08-18 一套音響,真的能同時玩好兩聲道和家庭劇院?
▶ 跳到 980 秒聽本人講 →
機轉:為什麼會這樣
在示範完上混把音場打開、並舉了〈江格爾英雄贊〉的呼麥段落當作最佳案例之後,他自己收了一句:「你說他這樣子是不是真的就可以達到全景聲效果,我認為還差得遠」,理由是「其實他並不是一個穩定的東西,就是他到底會怎麼做,完全看 StormAudio 怎麼算」。
實證查核

他說的不穩定,外部資料支持。

上混結果會因系統演算法、素材、喇叭配置而異,各家做法不同、輸出也不同;喇叭擺位與房間聲學都會影響最終的沉浸感。這正是「完全看處理器怎麼算」的具體內容。

本站要特別記這一條的原因不是它的技術含量,是它的位置:這句話出現在一支示範自家店內系統有多好的影片裡,而且是在效果最好的示範之後立刻講的。在該說服的時候主動說出限制,本站記在加分欄。

查證來源

  • 上混結果因演算法、素材、喇叭配置而異
  • 擺位與房間聲學影響沉浸感
  • 各系統演算法不同、輸出不同
要補一句

⚠️ 「差得遠」是相對於原生全景聲混音而言,不是說沒用。片中他的實際結論是相反的——他說找到了讓這些影片「一看再看」的方法。

兩句話並不矛盾,但摘出來單看會誤導:他的意思是「這是重造,不是還原」,而重造對他的用途(在店裡整天播 MV)已經夠了。

可帶走的做法
拿上混效果去評斷一台環繞處理器好壞時,記得你聽到的是那間房、那個擺位、那段素材的結果。換到你家三個變數全變。
07 他主張畫面會掩蓋音色的缺陷,但掩蓋不了音場的缺陷 value
他在哪裡講的
「你就會忘記那音色不好」
2026-08-18 一套音響,真的能同時玩好兩聲道和家庭劇院?
▶ 跳到 900 秒聽本人講 →
機轉:為什麼會這樣
他的說法是「你閉上眼睛覺得這音色挺爛的,誰會這樣聽,可是你張開眼睛的時候發現這畫面挺漂亮的,你就會忘記那音色不好」。但他緊接著切開兩者:「你看畫面挺漂亮的,但音場緊縮在這中間,這個經過你這個千錘百鍊的金耳朵,你還是會發現這聲音不行」。也就是他認為視覺對音色有補償作用、對空間感沒有。
實證查核

這是他的聆聽經驗判斷,本站不做實證分級。

但這條的分法值得記,因為它可以指導取捨:如果視覺確實對音色有補償、對音場沒有,那麼看影片的系統應該優先把預算放在空間感(擺位、聲道數、上混)而不是音染調校——而這正好解釋了他整支片的處置順序:先調曲線(音色)只花幾分鐘,最後靠上混(空間)才真正滿意。

查證來源

  • 無外部實證支持此具體不對稱主張,本站未找到可引用文獻
  • 收錄依據為可操作性,非實證強度
要補一句

⚠️ 他沒有給這條任何證據,本站也查不到直接支持它的比較研究。視聽交互作用本身有大量文獻,但「音色被補償、音場不被補償」這個具體的不對稱主張,本站未找到可引用的實證。

收錄理由是它可操作,不是它被證明。照他的講法去分配預算不會出錯,但不要把它當成已知的心理學結論去引用。

可帶走的做法
配一套主要拿來看影片的系統時,把錢先花在聲道數與擺位,再花在音色調校。順序反過來的人通常最後還是會覺得「聲音貼在畫面上出不來」。
08 他說自己判斷零點幾 dB 的差異,靠的是同一段素材重複聽上百次 value
他在哪裡講的
「你有聽 100 遍嗎?」
2026-08-18 一套音響,真的能同時玩好兩聲道和家庭劇院?
▶ 跳到 1116 秒聽本人講 →
機轉:為什麼會這樣
他自陳對示範素材「我應該至少聽 50 次以上,應該有 100 次以上,就是不斷地重聽又重聽」,並解釋原因:「有的時候在測這個音響的時候,他就是那麼一點點細微的差異,到底你說 0.1dB、0.2dB、0.3dB、0.4dB 到底差多少,就是這樣玩出來的」。他同時明講「我不是說各位應該要這麼做」。
實證查核

這是方法論自述,不是可驗證的主張,本站不做實證分級。

但它解釋了本站在 kp-04 標的那個警告:他調的 0.4dB 是在極度熟悉單一素材的條件下做的判斷。熟悉素材確實是聽力訓練的核心方法——你不是在聽器材,是在聽你已經記住的那個版本跟現在有什麼不同。

他主動說「我不是說各位應該要這麼做」,等於自己標示了這個條件不可移植。

查證來源

  • 方法論自述,講者自行標示不可移植
  • 片中切換皆為講者自行操作,非盲測
要補一句

⚠️ 重複聆聽同時也是最強的偏誤來源。聽了一百遍之後,你對「這一段應該長什麼樣」的預期會非常強,而預期正是非盲測最難排除的干擾。他在片中所有的切換都是自己操作、自己知道切到哪一邊。

本站不因此否定他的判斷——熟悉素材確實提高分辨力。但要標清楚:這是熟悉度帶來的分辨力,不是盲測驗證過的分辨力,兩者不能互相取代。

可帶走的做法
想訓練自己聽差異,選三首你已經聽到爛的曲子當固定素材,比一直換新歌有效。但要下結論的時候,找人幫你切換而且不告訴你切到哪邊。
09 八天後他把同一套調法講成了頻段:壓 1k–6k、拉 1k 以下——處方有效,但他給那段的名字對不上 contested
他在哪裡講的
「1000Hz 到 6000Hz」
2026-08-26 Hi-End音響聽YouTube超好聽!你只需做對這3件事
▶ 跳到 263 秒聽本人講 →
機轉:為什麼會這樣
同一個手法在這支片被講成三個動作:高頻修掉一些(配合來源的單薄高頻,避免刮耳)、壓掉 1000–6000Hz 的泛音(他歸因為唇齒音聽起來不舒服)、把 1000Hz 以下拉高一點點(讓人聲厚實飽滿)。他形容做出來的結果是「聲音厚厚的、飽滿的」。這是 kp-04 那套「中頻多了就砍中頻」的延續,差別在這次他給了頻段。
實證查核

操作站得住,命名對不上。齒音(sibilance)的能量集中在約 4–10kHz——男聲多在 4–6kHz、女聲常落在 7–10kHz,去齒音處理的偵測帶通常設在 5–9kHz。他點名的 1000–6000Hz,下半段(1–4kHz)並不是齒音區,而是人聲的存在感與清晰度區。

所以壓這一段確實會讓聲音變厚、變不刺耳,但原因是 kp-04 已經記錄過的遮蔽機制(降低造成向上遮蔽的中頻成分),不是「把唇齒音拿掉」。同一支片裡他把 1kHz 以下拉高、1k–6k 壓下去,本質上就是 kp-04 那個「砍中頻而不是加高頻」的動作換個講法。

查證來源

  • 齒音能量集中於約 4–10kHz,去齒音偵測帶常設於 5–9kHz
  • 男聲齒音多落在 4–6kHz,女聲多落在 7–10kHz
  • 1–4kHz 屬人聲存在感與清晰度區,與齒音區僅上緣重疊
要補一句
⚠️ 兩個都別抄:名字別抄——照「1k–6k=唇齒音」去設去齒音器會處理錯頻段;數字也別抄——這組頻段對應的是他那個空間、那對喇叭與那條校正曲線,與 kp-04 的 0.4dB 同理。可帶走的仍然是方向:要厚就砍中頻,不要加低頻;要細節就別再加高頻。
可帶走的做法
聽到「壓掉唇齒音」這種說法,先問是哪一段。真要處理齒音,對象在 5kHz 以上;想讓人聲變厚變順,動的是 1–4kHz,那是兩件事。並讀 t08-u15 kp-06——同樣是操作有效但理由只對一半的例子。 另可對照 t01-u30 kp-03:他自己說過把曲線拉成一樣、聽起來還是不一樣——連曲線都不保證音色了,抄頻段數字就更沒有意義。

來源:《一套音響,真的能同時玩好兩聲道和家庭劇院?》(2026-08-18,18:51,官方中文字幕)。本單元所有引句皆出自該片官方字幕,非轉錄稿。

立場揭露:全片拍攝於講者自己的店內(片中自陳「我們那個開店」「7 月跟 8 月都貼上去了」「我們每個月都有那個播影片的日子」「助理弟弟拿手機給我」),示範器材為店內系統(StormAudio 環繞處理器+DALI 喇叭+Dirac 空間校正)。全片的結論「一套可以兩用」是一個支持購買高階環繞處理器的論點,本站標明立場,不收為事實(kp-01)。

本站主動修正的兩處機制,兩處都不動搖結論:①音場窄縮的成因不是「YouTube 人聲厚度低」,是強度立體聲在高頻合併聲道資訊(kp-03);②上混的判準不是「頻率高低」,是方向性與聲道相關性(kp-05)。修正的理由不是挑錯,是因為錯的機制會導向錯的處置——兩處都會讓人去調 EQ,而 EQ 對這兩件事都無效。

本站記在加分欄的兩件事:①他在效果最好的示範之後立刻主動說「我認為還差得遠」「並不是一個穩定的東西」(kp-06);②他明講重複聽上百次的做法「我不是說各位應該要這麼做」,自行標示條件不可移植(kp-08)。

本站未進行的驗證:未實際重現他的 Dirac 曲線調整,也未對上混效果做任何聆聽比較。kp-04 與 kp-05 的判斷依據為公開的心理聲學與編碼原理,不作為實聽結論。

方法學說明:全片為單人自行操作的即時切換示範,無盲測、無對照組、無重複量測,講者亦未宣稱做過測試。因此本站的方法學查核僅適用於機制正確性,不適用於效果強度。 ⚠️ 2026-08-26 補充:kp-09 來自另一支公開影片(OicgcPFy41g,2026-08-26),是同一套 EQ 手法在八天後的頻段版說法,本站併入本單元而非另立新單元(題目相同)。該片同為店內示範,器材評價不採。