Abstract
語音辨認可提供最自然、親切的人機介面。目前,語音辨認已有越來越多的應用,譬如:聲控、聲音回應系統等等。尤其是透過電話系統的語音辨認更能拓展服務的領域,提供給人們更理想的生活環境。現今,語音辨認系統在安靜的環境中已有相當不錯的辨認率,不過若移植到電話系統中的時候,則其性能即明顯下降。透過電話系統對語音辨認所引起的困難主要有(一)話機和傳輸線所造成的頻譜的失真,(二)背景噪音以及電話線路所引進的雜訊。而且不同的話機間,頻率轉移函數的差別相當大,同時背景噪音和線路雜訊在不同的環境中也有不同的強度,因此其失真並非固定而是變動的。因此,如何使語音辨認系統能在各種不良的環境中均能保有不錯的性能,即為本研究最大的目標。針對不同的失真來源,我們將建立其模型,探討其對原始語音的影響,希望能由此導出語音中不受這些失真影響的強韌特徵,作為穩健辨認系統的基礎,或者由失真對語音影響模式中找出調整特徵的方法。在我們所作的十個中文數字的多語者辨認實驗中,我們發覺原來的乾淨語音的辨認率可以達到98.6℅,受到通道濾波效應後,辨認率降為95.2℅,而受到白色雜訊的影響後,辨認率降為88.8℅。這些下降的辨認率可以用一些方法來改善其結果。在我們這篇研究中所提出的方法可以把受通道濾波效應的語音的辨認率提昇到97.8℅,並且可以把受20DB白色雜訊影響的語音的辨認率提昇到93.8℅。