Abstract
在低位元率語音編碼器中,線性預估模型能有效表示語音信號,而線頻譜對係數已被證明係量化語音頻譜之最佳選擇。另一方面,寬頻音訊首重高品質之要求,所以要應用更複雜的人類耳朵聽覺模型為量化音訊頻譜之準則。本篇論文完成的成果有以下三項。一、語音頻譜的兩階段編碼並結合分類切換方法。這個方法將線頻譜對多項式P(z)與Q(z)分別考慮,第一階段使用轉換編碼對偶註標線頻譜對係數做量化。第二階段採用二維預估法對奇註標線頻譜對係數做量化。對預估差值的量化方法則有純量量化與分割向量量化兩種。這個方法利用了線頻譜對係數同一音框內的關聯性,以及線頻譜對係數相鄰音框間的相關性,使每音框僅需19位元就能達到平均頻譜失真小於1 分貝的結果。除此之外、還設計一個分類切換的機置。對頻譜變化緩慢時之音框給予較少之位元數,對頻譜變化激烈時之音框給予較多之位元數,以此方式掌握頻譜變化,達到透明編碼的效果。最後結果可使頻譜失真大於 4分貝的音框數是零,而介於2至4分貝的音框百分比降到只剩0.27%,且平均位元率低於19位元/音框。二、聽覺失真─位元函數曲線的求法。在現在求雜訊完全被遮蔽所需的位元率已經很明白,但求某一聽覺失真不為零所需的位元率尚是待克服的難題。若能求得該函數曲線,將對寬頻音訊編碼方法的極限情形有所瞭解且對設計寬頻音訊編碼器很有裨益。在本篇論文裡將介紹渴望演算法以求得該曲線。三、使雜訊響度為最小的寬頻音訊編碼方法。對音訊做壓縮編碼,當雜訊的能量分佈低於聽覺臨界曲線與遮蔽曲線之準位的最大值時,就可以使編碼後的音訊與原音訊具有相同的聽覺品質。隨著位元率的降低,存在的雜訊就無法完全被遮蔽。因此設計一轉換編碼器,以合成為分析的方式適應調整位元分配,使得量化產生之雜訊可完全被遮敝或當位元不足時使雜訊響度為最小。實驗用的樂聲是以44.1仟赫茲取樣頻率及每個取樣用16位元 PCM 自雷射唱片取樣數位音樂信號。對其編碼還原後聲音品質做量測。量測結果在128、96仟位元/秒(Kbps)情況下可得到透明編碼的效果。在 64仟位元/秒情況下可得到近乎透明編碼的效果。This dissertation describes the research on spectral encodingfor speech and audio signals.