Abstract
在語音辨識領域中,關鍵詞辨認主要是針對特定應用場合,設定特定關鍵詞,使用者只需透過特定關鍵詞即能使系統為使用者服務。由於大多數關鍵詞辨認系統的服務對象設定於大眾,對於聲音特殊的使用者可能系統無法容易辨認出使用者對系統下達的指令,因此本論文提出在關鍵詞辨認系統中加入語者調適功能,對於腔調特殊或說話習慣特殊的使用者可以藉由語者調適的技術來調整聲學模型,並利用此模型作關鍵詞辨認能得到不錯的辨識效果。本論文研究方向主要是針對通道效應、關鍵詞辨認及語者調適作初步研究。在電話通道效應方面,由於電話的濾波效應以及通道雜訊會影響辨識率,因此本論文分別用CMS、SBR和SM等方法來作補償,其音節正確率可以提升約2~6%。在關鍵詞辨認方面,會因使用者的說話習慣或系統的音節模型不夠完善而形成音節的取代錯誤、刪除錯誤及插入錯誤而造成關鍵詞被隱藏。加入關鍵詞精鍊萃取法後,可以將隱藏在這些錯誤中的關鍵詞擷取出來。在多關鍵詞實驗中,加入關鍵詞精鍊萃取其關鍵詞正確率從72.7%提升至81.9%。在語者調適方面,採用貝氏調適法(MAP)和最大相似度線性回歸法(MLLR)兩種方法作比較。兩種方法皆使用40句調適語料,在批次及監督式的調適環境下作MAP和MLLR調適,實驗結果關鍵詞正確率分別為93.18%和89.55%。最後在微軟視窗2000環境下,利用電話介面卡在電話網路上建構一套具有調適功能的關鍵詞辨認系統,模擬醫院語音預約掛號作為實際測試,以驗證其實用性。