Abstract
在語音辨認技術中,關鍵詞辨認是屬於比較特殊的一種應用。其發展目的 主要是針對某些語音辨認應用場合,不需對整段語音作辨認,而是只要辨 認出某些詞及能達到使用的目的。本研究即嘗試針對整個關鍵詞辨認系統 ,從關鍵詞辨認的架構•辨認核心、發音確認(Utterance Verification )到系統可能遇到的通道效應、雜訊干擾等問題作一系列的初步研究。在 辨認核心方面,我們是採用連續型馬可夫模型(Continuous Hidden Markov Model)技術,以國語音節模型作為基本單位組合成關鍵詞模型及 非關鍵詞部份的填充模型(Filler Model)。我們提出了單一狀態及多狀 態的填充模型架構。辨認方法上我們嘗試了以獨立詞辨認以及建階式( Level Building)演算法來作關鍵詞辨認。在以20個地名當作關鍵詞的辨 認系統上,採用獨立詞辨認架構及單一狀態填充模型為辨認核心的辨認器 可以有近95%的辨認率。在發音確認上,我們以填充模型以及反關鍵詞模 型當作替代模型,在9.33%錯誤拒絕率(False Rejection)的條件下, 會有33.67%的錯誤警報率(False Alarm)。在電話通道效應的考量方面 ,我們採用通道倒頻譜偏移補償來克服電話通道效應,使得電話通道上的 語音辨認有超過80%的辨認率。在雜訊補償上,我們採用狀態整合韋納濾 波器(State Integrated Wiener Filter)。在 0dB 及 10dB環境下,辨 認率約可提昇5%至10%。本研究除了模擬實驗外,也建構一套展示系統 模擬鐵路局電腦語音售票系統作實作測試,以驗證其可實用的特性。