Logo image
國語語音資料庫MAT-2000上的聲調辨認研究
Thesis

國語語音資料庫MAT-2000上的聲調辨認研究

徐光輝
Masters, 國立清華大學
1999

Abstract

基頻軌跡 隱藏式馬可夫模型 自相關函數 Creaky voice
國語是一種有聲調的語言,因此,在國語語音的辨認中,聲調佔有重要的地位。聲調辨認的問題,可以分為兩個部分,分別是基頻軌跡追蹤和辨認系統建立。本論文對於基頻軌跡追蹤的方法,提出了一些改良,以兩種自相關函數交替使用,可以增加基頻軌跡追蹤的完整性。在基頻軌跡之平滑化步驟,提出了分別以中間值濾波器和移動平均濾波器做平滑化的兩種做法。在基頻軌跡之正規化方法,提出了以一句話中所有音節基頻軌跡平均值做正規化和以句子中最高基頻音節之基頻軌跡平均值做正規化。辨認系統之設計,採用隱藏式馬可夫模型(HMM)法,以模型組方式進行辨認。 本研究的實驗語料,是經由電話線錄音的國語語音資料庫,MAT-2000。在這個資料庫中,我們採用2~4字詞的語句,即其子資料庫MATDB-4。觀察這些語音資料,發現輕聲音節具音長短的特性,但能量小的特性並不明顯。實驗中,我們對兩種平滑化方法及兩種正規化方法做比較,發現是以移動平均濾波器做平滑化,並以句子中最高基頻軌跡平均值做正規化時,聲調的辨識率最佳,可以達到69%。影響辨認結果的主因,是部分語料中之一聲調與二聲調的基頻平均值太過於接近。三聲調與四聲調間的基頻平均值也很接近。此外,三聲調中有出現 Creaky voice 的現象,此時之基頻軌跡不穩定,以上幾個因素是造成辨認率下降的原因。

Metrics

1 Record Views

Details

Logo image