MP3、WAV、FLAC 差在哪?數位音訊編碼、取樣理論與心理聲學文獻回顧
聲學理論
MP3、WAV、FLAC 差在哪?數位音訊編碼、取樣理論與心理聲學文獻回顧
數位音訊的儲存、傳輸與後製涉及資訊理論、取樣定理與聽覺心理聲學的多學科整合。音訊工程實務中常見的 WAV、FLAC、MP3 與 AAC 等格式,代表了不同資訊熵編碼與感知失真容限的工程權衡。本篇文獻回顧依循學術 Paper Review 規範,回顧奈奎斯特—夏農取樣定理(Nyquist-Shannon Sampling Theorem)、均勻量化動態範圍推導、臨界頻帶(Critical Bands)同時掩蔽機制,以及 MPEG 感知音訊編碼之時頻轉換拓撲,為音訊製作提供堅實的聲學理論基礎。
一、 理想數位重構理論:奈奎斯特—夏農取樣定理與量化雜訊
連續時間類比聲學訊號 x(t) 轉換為離散時間數位序列 x[n] 的理論基石源於夏農(Shannon, 1949)之資訊理論研究。取樣定理確立了若帶限訊號的最高頻率為 fmax,當取樣頻率滿足 fs ≥ 2fmax(奈奎斯特取樣率)時,連續訊號可藉由惠特克—夏農(Whittaker-Shannon)內插公式無失真還原:
- 頻率抗混疊與取樣率選擇:人類耳蝸基底膜的聽覺感知極限約為 20 kHz。CD 標準規格採用 44.1 kHz 取樣率,留有約 4.1 kHz 的過渡帶供類比抗混疊濾波器進行衰減;現代專業影音與錄音標準普遍採納 48 kHz 或 96 kHz 取樣率,進一步放寬濾波器相位線性要求並降低群延遲畸變(Pohlmann, 2010)。
- 位元深度與均勻量化雜訊比(SQNR):在線性脈衝編碼調變(Linear PCM,即標準 WAV 格式)中,每個取樣點以 N 個位元表示。假定量化誤差在 [−Δ/2, Δ/2] 區間內呈現均勻分布,其理論訊號與量化雜訊比公式推導為:
SQNR ≈ 6.02N + 1.76 dB16-bit 提供約 98 dB 之理論動態範圍;而 24-bit 規格提供高達 146 dB 的理論動態範圍,使數位量化噪聲底線遠低於現代類比前級電路的熱噪聲(Thermal Noise),為錄音與混音提供了寬廣的動態餘裕(Headroom)。
二、 心理聲學感知編碼架構:聽覺掩蔽效應之文獻評述
與 WAV 記錄完整取樣數值不同,有損壓縮編碼(如 MP3、AAC)之核心並非單純降低取樣率,而是建構於心理聲學模型(Psychoacoustic Models)之上(Painter & Spanias, 2000)。
- 頻率同時掩蔽(Simultaneous Masking):Egan & Hake(1950)與 Zwicker & Fastl(2013)的實驗表明,當一個強能量音訊分量(掩蔽音,Masker)存在時,其鄰近臨界頻帶(Critical Band,如 Bark 刻度)內的微弱訊號聽閾值會顯著抬升。若某頻段的量化噪聲能量維持在動態掩蔽閾值(Masking Threshold)以下,該噪聲在主觀感知上等同於「低於聽覺閾值」。
- 時域前後掩蔽(Temporal Masking):強訊號出現前數毫秒(超前掩蔽,Pre-masking)以及訊號結束後 50-200 毫秒內(滯後掩蔽,Post-masking),人耳聽覺神經系統的靈敏度亦受到抑制。編碼器據此動態配置位元分配(Bit Allocation)。
三、 編碼器拓撲與工程實務對照:WAV、FLAC 與 MP3
Brandenburg(1999)回顧了 MPEG Audio Layer III(MP3)的發展演進,將感知音訊編碼劃分為子帶濾波、修正離散餘弦變換(MDCT)、非線性量化與霍夫曼熵編碼(Huffman Coding):
- 線性無壓縮(WAV / AIFF):封裝原始 LPCM 數據,完整保留時域波形與相位關係,未經心理聲學濾除。錄音、混音分軌與母帶封裝唯一指定格式。
- 無損無失真壓縮(FLAC / ALAC):採用線性預測編碼(Linear Predictive Coding, LPC)預測波形趨勢,並對預測殘差(Residual)進行 Rice 熵編碼。其解碼後波形與原始 WAV 在二進位層面保持一致(位元級無損),通常能縮減 40% 至 50% 檔案體積,適用於高保真典藏。
- 感知有損壓縮(MP3 / AAC):依據掩蔽閾值拋棄遮蔽頻譜能量,在 320 kbps 規格下具備高度主觀透明度,但捨棄了高頻超聲細節與微微動態。僅建議用於終端社群試聽或低頻寬串流傳輸,嚴禁作為多軌混音素材重複編碼。
本篇核心重點歸納
- 奈奎斯特—夏農取樣定理確立了 fs ≥ 2fmax 即可無失真重構連續帶限訊號,48 kHz 為現代專業影音標準。
- 24-bit 均勻量化提供約 146 dB 之理論動態範圍,能有效將數位噪聲底線隔離於類比熱噪聲之下。
- MP3 等感知編碼依託聽覺掩蔽效應控制量化雜訊,製作流程應始終保持無損 24-bit WAV 格式以杜絕多次轉碼劣化。
Studio Tian 天空兔音樂廳
聲學工程 × 音樂製作規格
依循聲學物理標準,重現音樂真實動態與頻譜層次
我們將嚴謹的訊號處理與聲學理論落實於實務製作,提供專業人聲修音、分軌混音、原創編曲與串流母帶製作服務。歡迎前往官方網站試聽作品或預約製作諮詢。
參考文獻 (References)
- Shannon, C. E. (1949). Communication in the presence of noise. Proceedings of the IRE, 37(1), 10-21. https://doi.org/10.1109/JRPROC.1949.232969
- Painter, T., & Spanias, A. (2000). Perceptual coding of digital audio. Proceedings of the IEEE, 88(4), 451-515. https://doi.org/10.1109/5.842999
- Egan, J. P., & Hake, H. W. (1950). On the masking pattern of a simple auditory stimulus. The Journal of the Acoustical Society of America, 22(5), 622-630. https://doi.org/10.1121/1.1906661
- Zwicker, E., & Fastl, H. (2013). Psychoacoustics: Facts and models (3rd ed.). Springer Science & Business Media. https://doi.org/10.1007/978-3-540-68888-4
留言
張貼留言