他用一整支片證明 YouTube 可以好聽,而 YouTube 難聽的真正原因他講錯了一半#
這支片(2026-08-18,18 分 51 秒)是店內實機示範:用同一套 StormAudio 劇院系統去聽 YouTube 上的音樂影片,過程中改 Dirac 曲線、開上混,最後導向一個主張——兩聲道和家庭劇院不必分兩套。
本站要先講清楚這支片的性質:全片拍攝於他自己的店內(片中自陳「我們那個開店」「我們每個月都有播影片的日子」),示範器材是店內系統,而結論正好是「一套高價系統可以身兼兩用」。技術過程照收並查證,「一套就夠」這種同時是結論、也是他的生意方向的判斷,本站標明立場不收為事實。
技術上,這支片有兩件他做對的事、兩件他講錯的事,而且錯的都不動搖結論。
做對的第一件:他調 Dirac 曲線時,發現人聲加厚之後高頻細節不見了,處置是把中頻拉回來,而不是再去加高頻(kp-04)。這是心理聲學上正確的方向——遮蔽是往上擴散的,被蓋住的高頻要靠移除遮蔽者來救,不是靠加大被遮蔽者。
做對的第二件:他自己標了上混的限制,「我認為還差得遠」「並不是一個穩定的東西」(kp-06)。在一支示範自家系統有多好的影片裡主動說出效果不穩定,本站記在加分欄。
講錯的第一件:他把「音場縮在喇叭中間」歸因於 YouTube 人聲厚度不夠(kp-03)。現象是真的,理由是錯的。低位元率壓縮讓音場變窄的真正機制是強度立體聲(intensity stereo)——約 2kHz 以上兩聲道被合併成單一訊號加上音量比例,原始音場愈寬、被抹得愈明顯。這跟人聲厚度是兩件事。
講錯的第二件:他說上混是把「比較偏高頻的聲音往外擴展」(kp-05)。Dolby 官方的說法是把非方向性的環境成分(原文舉例是雨聲、風聲)映到天空聲道,判準是方向性與相關性,不是頻率高低。高頻常常同時是環境音,所以他的觀察對得上結果,但講成「高頻往外丟」會讓人以為調 EQ 就能改變上混行為。
兩處都只換掉理由,不動搖他的結論:音場真的會縮、上混真的能打開。
往下讀之前先問自己 這支片最實用的部分不是「一套能不能兩用」,是他調曲線那五分鐘的思路:加了中頻、發現高頻不見、把中頻拉回去而不是加高頻。那個決定是對的,而且大多數人會做反的。至於一套兩用——他示範的是這套系統做得到,不是每套都做得到,也不是你需要。
這是取捨判斷,不是可證偽的技術主張,本站不做實證分級。
成本論證的部分本身是自洽的:一台高階環繞處理器若只用單一用途,其多聲道處理與空間校正能力確實閒置。這個推論不需要外部證據就成立。
而本站可以查核的是他有沒有誠實標示前提——他有。片中明講這是在他調過曲線、開過上混之後才成立的結果,不是開箱即用。
查證來源
- 成本論證為自洽推論,不需外部證據
- 前提(需調曲線、需開上混)由講者於片中自行標示
- 拍攝地點與器材歸屬依片中自陳認定
⚠️ 立場揭露:這支片拍攝於他自己的店內(片中自陳「我們那個開店」「7 月跟 8 月都貼上去了」「我們每個月都有那個播影片的日子」),示範器材為店內系統,而結論正好是「一套高價環繞處理器可以身兼兩用」——這是一個支持購買的論點。
⚠️ 更重要的是,這個結論的成立條件在片中被他自己說掉了:整套流程需要為 YouTube 另存一條 Dirac 曲線、需要判斷什麼時候開上混、需要在不同曲線之間手動切換。
也就是說「一套兩用」的代價不是錢,是操作。分兩套的人省掉的正是這件事——切到哪套就是哪套的聲音,不用想。這個成本片中沒有計入比較。
「有損」這件事沒有爭議,實際數字也對得上他的定性。
YouTube 供應的音訊是 AAC 或 Opus,兩者皆為有損編碼,從不使用無損格式。一般影片的 AAC 大約在 128kbps 等級(實測最高約 126kbps),Opus 則落在 56–165kbps 之間;YouTube Music 的預設「一般」品質為 128kbps,「高」為 256kbps。
他說「格式每個月在變」也不是誇飾:YouTube 確實持續在調整供應的音訊格式與編碼參數,Opus 的採用本身就是這個過程的一部分。
查證來源
- YouTube 使用 AAC 與 Opus,皆為有損編碼
- 一般影片 AAC 約 128kbps;Opus 約 56–165kbps
- YouTube Music 預設 128kbps、高品質 256kbps
⚠️ 他把「有損」直接等同於「音質爛」,這一步在 2026 年已經站不太住。128kbps 的 AAC 或 Opus 對絕大多數素材而言遠不是「爛」,Opus 在中低位元率的表現尤其好。
這支片真正聽得出差別的原因,反而是他自己示範的那兩首歌的錄音特性差異很大(一首吉他獨奏、一首年輕聲樂),而不是位元率把它們毀了。他把兩件事混在一起講了。
現象本站收錄;機制本站改寫。
低位元率壓縮確實會讓音場變窄,但機制是強度立體聲(intensity stereo):編碼器把左右聲道在較高頻段合併成單一訊號+各頻段的音量比例,藉此省下位元。這在心理聲學上被認為可接受,因為人耳對約 2kHz 以上的訊號相位並不敏感。
代價正好就是音場:文獻明確指出,強度立體聲在低位元率下會抹糊立體聲像,而且原始音場愈寬、愈明顯。因為頻段劃分很寬,它無法同時表現「左聲道 10kHz、右聲道 10.1kHz」這種情形,兩者會被推到中間。
這正是他聽到的:聲音縮在兩支喇叭之間。
查證來源
- 強度立體聲:高頻段以單一訊號+音量比例取代左右聲道
- 心理聲學依據:人耳對約 2kHz 以上相位不敏感
- 已知副作用:低位元率下抹糊立體聲像,原始音場愈寬愈明顯
- AAC 與 Opus 皆自動使用聯合立體聲最佳化
⚠️ 為什麼要糾正這條,而不是算他講對了:因為理由決定你會怎麼處理它。
如果你相信是「人聲厚度不夠」,你會去調 EQ——而 EQ 救不回已經被合併掉的聲道間資訊,那個資訊在編碼階段就不存在了。
如果你知道是聲道資訊被合併,你就會知道只有兩條路:換無損來源,或者用上混這類「重新製造空間感」的手段——而後者正是他這支片後半段真正做的事。
他的處置是對的,他對處置的解釋不是。
這條的方向在心理聲學上是標準答案。
遮蔽(masking)指較強的聲音降低鄰近頻率較弱聲音的可聽度,而且遮蔽是不對稱的:一個 1kHz 音對高頻的遮蔽效果隨音量增加而明顯強於對低頻,這就是遮蔽的向上擴散(upward spread of masking)。
因此混音上的標準處置正是他做的那個:訊號的高頻能量其實夠,只是被較低頻的成分蓋住了;與其加高頻,不如降低造成遮蔽的低頻/中頻成分。
人耳在 2–5kHz 最敏感,這也是為什麼中頻只多了零點幾 dB 就足以蓋掉上面的細節。
查證來源
- 遮蔽:強訊號降低鄰近頻率弱訊號的可聽度
- 遮蔽的向上擴散:對高頻的遮蔽強於對低頻
- 標準處置:降低遮蔽者而非提升被遮蔽者
- 人耳最敏感區約 2–5kHz
⚠️ 要注意他調的是 0.4dB。這個量級的差異在單獨聆聽時幾乎不可能分辨,他自己在片尾也承認需要重複聽上百次才聽得出來(kp-08)。
所以這條的可複製部分是「方向」,不是「數字」:中頻多了就砍中頻,不要加高頻。至於砍多少,他的 0.4dB 對應的是他那間店、那對喇叭、那條曲線,抄數字沒有意義。
結果收錄,判準改寫。
上混器的工作是用演算法從既有訊號中萃取空間資訊,讓內容聽起來像是為多聲道混音的。而 Dolby 對天空聲道的說明是:非方向性的環境效果(原文舉例為雨聲、風聲)被映到天空聲道,處理方式與環繞聲道對環境內容的處理相似。
也就是判準是「方向性/環境性」,不是「頻率高低」。高頻成分常常同時具有環境性(空氣感、殘響尾音、細碎音效),所以他的觀察對得上結果——但這是相關,不是機制。
查證來源
- Dolby:非方向性環境效果(雨、風)映到天空聲道
- 上混以演算法萃取空間資訊而非依頻率分派
- 喇叭擺位為影響上混表現的主要因素之一
- 各系統演算法不同,同素材結果有差異
⚠️ 這個差別會影響你怎麼用它。
如果你以為上混是「把高頻丟出去」,你會想用 EQ 去操縱它——加高頻讓環繞更多、減高頻讓它收斂。實際上不會這樣運作:一段高頻但高度相關(左右幾乎相同)的訊號會被判為前方定位,怎麼加都不會被丟到天空聲道去。
真正影響上混結果的是素材本身的聲道相關性,以及演算法與喇叭配置。外部資料也明確指出:喇叭擺位是影響上混表現最大的因素之一,而各系統演算法不同、同一素材結果會有差異。
⚠️ 附帶一個諷刺的地方:上混要靠聲道間的差異來工作,而 kp-03 的強度立體聲正好在高頻抹掉聲道間差異。用上混救有損來源的音場,本質上是用演算法重造一個被編碼器丟掉的東西,不是把它找回來。
他說的不穩定,外部資料支持。
上混結果會因系統演算法、素材、喇叭配置而異,各家做法不同、輸出也不同;喇叭擺位與房間聲學都會影響最終的沉浸感。這正是「完全看處理器怎麼算」的具體內容。
本站要特別記這一條的原因不是它的技術含量,是它的位置:這句話出現在一支示範自家店內系統有多好的影片裡,而且是在效果最好的示範之後立刻講的。在該說服的時候主動說出限制,本站記在加分欄。
查證來源
- 上混結果因演算法、素材、喇叭配置而異
- 擺位與房間聲學影響沉浸感
- 各系統演算法不同、輸出不同
⚠️ 「差得遠」是相對於原生全景聲混音而言,不是說沒用。片中他的實際結論是相反的——他說找到了讓這些影片「一看再看」的方法。
兩句話並不矛盾,但摘出來單看會誤導:他的意思是「這是重造,不是還原」,而重造對他的用途(在店裡整天播 MV)已經夠了。
這是他的聆聽經驗判斷,本站不做實證分級。
但這條的分法值得記,因為它可以指導取捨:如果視覺確實對音色有補償、對音場沒有,那麼看影片的系統應該優先把預算放在空間感(擺位、聲道數、上混)而不是音染調校——而這正好解釋了他整支片的處置順序:先調曲線(音色)只花幾分鐘,最後靠上混(空間)才真正滿意。
查證來源
- 無外部實證支持此具體不對稱主張,本站未找到可引用文獻
- 收錄依據為可操作性,非實證強度
⚠️ 他沒有給這條任何證據,本站也查不到直接支持它的比較研究。視聽交互作用本身有大量文獻,但「音色被補償、音場不被補償」這個具體的不對稱主張,本站未找到可引用的實證。
收錄理由是它可操作,不是它被證明。照他的講法去分配預算不會出錯,但不要把它當成已知的心理學結論去引用。
這是方法論自述,不是可驗證的主張,本站不做實證分級。
但它解釋了本站在 kp-04 標的那個警告:他調的 0.4dB 是在極度熟悉單一素材的條件下做的判斷。熟悉素材確實是聽力訓練的核心方法——你不是在聽器材,是在聽你已經記住的那個版本跟現在有什麼不同。
他主動說「我不是說各位應該要這麼做」,等於自己標示了這個條件不可移植。
查證來源
- 方法論自述,講者自行標示不可移植
- 片中切換皆為講者自行操作,非盲測
⚠️ 重複聆聽同時也是最強的偏誤來源。聽了一百遍之後,你對「這一段應該長什麼樣」的預期會非常強,而預期正是非盲測最難排除的干擾。他在片中所有的切換都是自己操作、自己知道切到哪一邊。
本站不因此否定他的判斷——熟悉素材確實提高分辨力。但要標清楚:這是熟悉度帶來的分辨力,不是盲測驗證過的分辨力,兩者不能互相取代。
操作站得住,命名對不上。齒音(sibilance)的能量集中在約 4–10kHz——男聲多在 4–6kHz、女聲常落在 7–10kHz,去齒音處理的偵測帶通常設在 5–9kHz。他點名的 1000–6000Hz,下半段(1–4kHz)並不是齒音區,而是人聲的存在感與清晰度區。
所以壓這一段確實會讓聲音變厚、變不刺耳,但原因是 kp-04 已經記錄過的遮蔽機制(降低造成向上遮蔽的中頻成分),不是「把唇齒音拿掉」。同一支片裡他把 1kHz 以下拉高、1k–6k 壓下去,本質上就是 kp-04 那個「砍中頻而不是加高頻」的動作換個講法。
查證來源
- 齒音能量集中於約 4–10kHz,去齒音偵測帶常設於 5–9kHz
- 男聲齒音多落在 4–6kHz,女聲多落在 7–10kHz
- 1–4kHz 屬人聲存在感與清晰度區,與齒音區僅上緣重疊
來源:《一套音響,真的能同時玩好兩聲道和家庭劇院?》(2026-08-18,18:51,官方中文字幕)。本單元所有引句皆出自該片官方字幕,非轉錄稿。
立場揭露:全片拍攝於講者自己的店內(片中自陳「我們那個開店」「7 月跟 8 月都貼上去了」「我們每個月都有那個播影片的日子」「助理弟弟拿手機給我」),示範器材為店內系統(StormAudio 環繞處理器+DALI 喇叭+Dirac 空間校正)。全片的結論「一套可以兩用」是一個支持購買高階環繞處理器的論點,本站標明立場,不收為事實(kp-01)。
本站主動修正的兩處機制,兩處都不動搖結論:①音場窄縮的成因不是「YouTube 人聲厚度低」,是強度立體聲在高頻合併聲道資訊(kp-03);②上混的判準不是「頻率高低」,是方向性與聲道相關性(kp-05)。修正的理由不是挑錯,是因為錯的機制會導向錯的處置——兩處都會讓人去調 EQ,而 EQ 對這兩件事都無效。
本站記在加分欄的兩件事:①他在效果最好的示範之後立刻主動說「我認為還差得遠」「並不是一個穩定的東西」(kp-06);②他明講重複聽上百次的做法「我不是說各位應該要這麼做」,自行標示條件不可移植(kp-08)。
本站未進行的驗證:未實際重現他的 Dirac 曲線調整,也未對上混效果做任何聆聽比較。kp-04 與 kp-05 的判斷依據為公開的心理聲學與編碼原理,不作為實聽結論。
方法學說明:全片為單人自行操作的即時切換示範,無盲測、無對照組、無重複量測,講者亦未宣稱做過測試。因此本站的方法學查核僅適用於機制正確性,不適用於效果強度。 ⚠️ 2026-08-26 補充:kp-09 來自另一支公開影片(OicgcPFy41g,2026-08-26),是同一套 EQ 手法在八天後的頻段版說法,本站併入本單元而非另立新單元(題目相同)。該片同為店內示範,器材評價不採。