Logo image
中文音轉字語言模型之初步研究
Thesis

中文音轉字語言模型之初步研究

賴淑貞
Masters, 國立清華大學, 電機工程學系
1999

Abstract

語言模型 破音字 音調轉變規則 音轉字
中文音轉字語言模型主要是將語音信號經聲學辨認系統處理後所得之注音串(含聲調)轉換成中文字串輸出,在轉換過程中必須依據中文本身的語言特性做相關處理。本論文針對:(1)破音字的校正 及(2)音調轉換規則的訂定 這兩項措施,探討其對於音轉字系統效能的改進情形。 在本論文中,比較使用 修正辭典(作破音字修正)的實驗 與 辭典未做破音字修正的結果(基礎實驗),字錯誤率(word error rate)可降低0.39%至0.72%(因不同的測試語料及不同的辭典而不同)。由於中文字的讀音有變調的現象,因此有必要將這種現象加以考慮,方能顯著提高音轉字系統的正確率。經由 加入3種音調變化規則(使用未修正的辭典),與基礎實驗相比,結果可使字錯誤率降低1.49%至4.80%。若使用 修正辭典 並加入 3種音調變化規則,與 基礎實驗 相比,則可使字錯誤率進一步降低1.88%至5.53%。 使用 修正辭典 加上 4種音調變化法則 的實驗(搜尋對應詞時,候選詞增為2)和 基礎實驗 的結果比較,可使字錯誤率降低2.22%至6.66%。與其他使用不同修正條件的實驗比較,這種音轉字系統是其中效能最好的一種。 在本論文中的實驗中,使用了兩套辭典,其中辭典二收錄詞數比辭典一多出30%,透過上述的修正方法,可讓使用不同辭典的字錯誤率差距由原先的6.48%降低為2.21%,這表示辭典收錄詞數較少者,也可以藉此方法降低音轉字系統的錯誤率。

Metrics

1 Record Views

Details

Logo image