Abstract
在安靜環境中所發展出來的語音辨認系統移植到有雜訊的環境時, 其辨認率將會急遽下降, 雜訊效應之補償乃成為語音辨認之重要課題。在本論文中, 我們進行雜訊對語音影響之分析, 建立雜訊對語音影響之模型, 並提出幾個補償的方法。我們的雜訊補償方法是讓語音辨認系統能從輸入訊號之雜訊狀況, 自動調整系統參數以切合實際的環境。我們以多語者 (50名男性, 50名女性) 國語獨立數字辨認實驗來驗證所提出來的方法, 實驗結果顯示我們的方法可以有效的補償雜訊效應。論文首先分析外加白色雜訊對語音之逆頻譜向量之影響, 雜訊會導致逆頻譜向量之大小縮減, 但對頻譜向量之方向則影響不大, 因此可將純淨語音逆頻譜向量作線性縮小來近似其在雜訊影響下之行為, 再來和測試音作比對。逆頻譜向量之線性調整可導出逆頻譜差在雜訊影響下可作仿射調整。為達成逆頻譜在雜訊環境下之更精確調整方法, 我們將逆頻譜向量之線性調整方法擴展到非線性調整方法, 此方法是根據語音之自迴歸模型及雜訊語音功率頻譜之疊加性,透過自相關係數之調整來間接達到逆頻譜向量之非線性調整效果。調整過程是由參考音和測試音之距離梯度方向引導, 以二元搜尋法找到最合適的雜訊功率大小, 將參考音調整到和測試音最吻合狀態。為進行梯度計算, 我們推廣了雷賓森-德斌 (Levinson-Durbin)演算法,可用來同時計算線性預估係數及其導數。為將逆頻譜向量之非線性調整方法推廣到逆頻譜差之調整, 我們提出一套新的隱藏式馬可夫模型表示法,新表示法以5個音框之語音自相關係數間接代表其逆頻譜及逆頻譜差向量。在雜訊下作語音辨認時, 我們先作自相關數之雜訊調整, 然後再轉換到逆頻譜及逆頻譜差向量, 此一方法能更進一步改善語音在雜訊環境下之辨認率。在通道濾波效應之補償上, 我們結合語音模型與通道先驗資訊, 由輸入語音中作通道逆頻譜之最大後驗機率估計,並依此估計值調整參考音模型,實驗顯示這個方法不但具有通道失真補償效果, 還具有語者調適之能力。