Logo image
中文音轉字語言模型之設計
Thesis

中文音轉字語言模型之設計

朱國華
Masters, National Tsing Hua University
1992

Abstract

音轉字 語言模型 雙連文 Text-to-Speech Language Model Bigram
對於中文使用者來講,想要使用中文和電腦溝通並不方便。一般的鍵盤中文輸入法,不但規則難記易忘,而且需要使用者一面輸入一面拆解字形。注音輸入法則讓使用者直接由字的發音來輸入文字。而語音輸入法則是最自然的一種輸入法,使用者用人與人之間溝通的方式來和電腦溝通。在語音輸入系統或注音輸入系統中,如果想將一連串的注音符號轉換成中文字句,必須要有一個語言模型來從每個音的眾多同音字中,挑出正確的組合來。本論文使用的方法是基於馬可夫模型的統計方式,以詞為處理的單位。比較了零階及一階的馬可夫模型,以及幾種不同的雙連文 (bigram) 模型。並且提出了詞類的雙連文,加上同音字的詞類加詞義雙連文統計模型。同時製作了一套注音輸入系統,以及語音輸入系統。實驗結果方面,在以報紙語料庫做訓練,小學課本課文做測試時,模擬注音輸入系統時可以得到約 92 % 的正確率;而在模擬語音輸入系統的音轉字模型時,可以得到約 82 % 的正確率。處理的速度則分別為 0.15 秒/句 以及 0.52 秒/句 。可以達到即時系統的需求。本論文共分五個部份。第一章是緒論,第二章介紹音轉字語言模型的基本原理,第三章介紹系統架構,第四章是實驗結果以及比較,第五章是結論。

Metrics

1 Record Views

Details

Logo image