Abstract
單聲道語音增強的相關研究,一直是語音研究中十分活躍的一塊領域,尤其當語音號夾雜了許多背景雜訊,希望可以藉由語音增強的技術,將背景雜訊去除,還原原來的語音訊號。在日常生活中,有許多語音技術相關的應用產品,使用時容易受到外來背景雜訊的干擾,所以語音增強技術好壞,也可以視為語音相關產品能不能被社會大眾所以接受的關鍵。 基於以上的問題,本文提出了兩階段的語音增強方法。第一階段: 在這階段要做的兩件事情,第一是以MCRA方法下做雜訊的預估,第二是改良OMLSA做增益函數的預估。利用帶聲音框的偵測結果,額外加入邊界的限制條件,使得增益函數預估更能貼近真實的狀態,帶有聲音框的偵測,是利用正規法線性殘餘訊號比值進行判別。第二階段: 在此階段主要是利用弦波模型做語音訊號的重建,目的是加強語音中的諧波成分,第一是利用前一個音框的基頻預測結果來決定該音框的基頻參考值,第二是利用線性預測濾波的方式,將訊號中不帶聲音框的非週期性成分去除,進一步強化語音中的諧波成分,提升語音品質。 實驗結果以分段式訊雜比改進量與語音品質感知評估(PESQ)做為評量,本文提出語音增強方式各個階段的比較,結果顯示本文所提出的方法在分段式訊雜比改進量的評量上,明顯優於傳統利用MCRA-OMLSA架構的語音增強方法,但是在語音品質感知評估評量中,兩者並無顯著差異。