Abstract
語音辨識是一項高難度的技術,語音訊號本身不具備穩態特性( Stationarity),因此分析不易。此外,環境中的雜音,說話的穩定性, 以及語音訊號通過線路的濾波效應所造成的訊號失真,均大大影響辨識率 。而參考模型的訓練語料是否客觀,訓練語料數量是否充足,以及參考模 型訓練方法的好壞,也都會左右辨識率。目前語音辨識在安靜或無失真的 環境下,已有不錯的辨識率,但日常生活中,不可能全部處於這樣的環境 下,為了能將語音辨識的技術與日常生活結合,發展能消除雜訊效應與通 道效應的技術是有其必要性。本論文將以一組由電話線所錄製的語音另外 加上高斯白雜訊來形成測試語音,其中高斯白雜訊是模擬電話線路本身的 雜訊,因此測試語音同時具有雜訊效應與通道效應。雜訊效應在線性頻譜 領域(Linear Spectral Domain)或時域(Time Domain)上與語音訊號具線 性加成關係,而通道效應則在倒頻譜領域(Cepstral Domain)與語音訊號 具線性加成關係,為了能同時在倒頻譜領域作運算,我們使用 Projection_ Based Likelihood Measure的方法,來補償雜訊效應,利用 MSBR(Modified Signal Bias Removal)的方法來補償通道效應,最後我們 將結合這兩種方法的觀念,同時補償雜訊效應與通道效應,在實驗中,我 們會比較同時補償雜訊效應與通道效應時,和只做單一雜訊效應補償或通 道效應補償時的辨識率,並討論本論文所使用得這種方法的可行性。