Logo image
關鍵詞語音辨認方法之改進
Thesis

關鍵詞語音辨認方法之改進

鐘慧真
Masters, 國立清華大學, 電機工程學系
1998

Abstract

關鍵詞辨認 Keyword Spotting
本論文探討兩種不同的關鍵詞辨認架構。第一種架構是獨立字詞辨認法,第二種是連續語音辨認法。前者探討兩種不同的填充模型結構對關鍵詞辨認系統辨認效能的影響,後者則是考慮使用者下命令時的習慣語氣,挑選出最常用的非關鍵詞,將這些非關鍵詞與真正關鍵詞定義在一起,成為廣義的關鍵詞模型。 在獨立字詞辨認法內,我們使用兩種填充模型結構。分別是單一狀態填充模型及多狀態填充模型。在這個實驗裡,我們探討填充模型所含音節數對獨立字詞關鍵詞辨認系統效能的影響。經由實驗結果,我們發現在音節數為11時,單一狀態填充模型及多狀態填充模型會有最好的系統效能,分別是94%、95.5%的關鍵詞正確擷取率。 在連續語音辨認架構裡,我們使用廣義的關鍵詞模型。在一階動態演算法階段,我們將得到聲學層次的最佳斷點,也就是音節的分隔點。利用這些分隔點可以切割出一個個的的音節,而我們針對每個音節還選出前N個最可能的待選字音,形成Top N的格狀輸出。所有待選字音之音節分隔點是以最佳音節分隔點為基準。而這個架構的關鍵詞辨認系統效能,對Top 6之格狀音節輸出為93%的關鍵詞正確擷取率。 此外,本論文也針對兩種關鍵詞辨認架構作通道效應補償。在實驗中採取兩種不同的補償方法,分別為倒頻譜平均值正規劃法(CMN)及訊號偏移消除法(SBR)。在獨立字詞辨認的架構,做補償對辨認正確率而言,無太大的提升效果。不過,就連續語音辨認架構而言,兩種補償方法都對辨認率有所貢獻,特別是SBR補償,關鍵詞正確擷取率可達97.5%。

Metrics

1 Record Views

Details

Logo image