Logo image
低位元率編碼下之中文連續語音辨識
Thesis

低位元率編碼下之中文連續語音辨識

熊惟遠
Masters, National Tsing Hua University
2000

Abstract

低位元率編碼中文連續語音辨識線頻譜對 LSPLow Bit CodingContinue speech recognition
語音辨認已是逐漸實用化的技術,電話網路上的語音回應系統及個人電腦上的語音輸入法,都是一些典型的例子。近年來,在網際網路上已經發展出語音傳輸的方法,可以利用網際網路打電話,在網際網路上的語音傳輸,即採用語音編碼技術。同樣的,行動電話的語音傳輸方式也是利用語音編碼。為了降低傳輸位元率,都採用低位元率的語音編碼。在過去語音辨識的領域中,研究的方向大多是放在未經壓縮的語音訊號上,但隨著壓縮語音的使用,直接用編碼語音作辨識,是一個必然的趨勢。本論文的研究課題,就是在低位元率編碼下,如何做語音辨識,並以中文連續語音作為研究對象。 本研究利用「台灣地區國語語音資料庫」(MAT 2000)的部份語料,分別對男女聲音建立國語語音之次音節模型,然後以次音節模型建構國語的所有410個音節模型。所採用的特徵參數為編碼語音中已量化的線頻譜對(Line Spectrum Pair),或是由此參數轉換成的虛擬倒頻譜係數(Pseudo Cepstrum)。在一連串相關的延伸實驗中,我們探討線頻譜對的距離量測方法、參數轉換、及通道效應的消除,瞭解不同的原理和方法所產生不同的改善效果,目前可得到的最佳辨識率為40.02%。

Metrics

1 Record Views

Details

Logo image