Abstract
語音的特性中, 最難克服的一點是語音訊號的時變性, 為了保留訊呈在時間上的訊息, 使用向量量化的方式顯然無法滿足這項要求。因為向量量化法是將語音訊號取得一個個音框打散在量化空間上, 也就是打散了一段語音訊號在時間上的相關性, 如此便將隱含在語音內語者的特徵削弱; 另一個原因是根據過去的研究發現, 語音除了瞬間訊息(instantaneous information) 之外, 過渡訊息(transitionalinformation) 也同樣帶有重要徵在內, 為了同時囊括時間上連續關係的訊息與過渡訊息, 促使我們引用一個矩陣(matrix)的單位來取代使用向量(vector)表示特徵的方式。一個矩陣飲食了數個連續音框的語音特徵, 用在萃取語音特徵上, 可以擁有更強的語音結構性。根據我們們的研究發現, 矩陣量化過的語者碼書(codebook), 無論未知語者輸入的語科是單一數字或較長的字串, 辨認率都較向量量化所得的碼書之辨認率較佳。由實驗結果統計資料顯示, 更看出矩陣量化法的語者碼書在辨認錯誤時, 發生性別混淆的比例也比較低。更進一步證明用一個個矩陣來表示語者的特徵是優於用一個個的向量。尤有甚者, 在作完本篇論文研究之后, 我們更發現一個現象, 如果只取單一數字(isolated digit)作為訓練語料(training data), 使碼書中缺少字與字中間連接的樣型(pattern), 所得的碼書很適合用在連續數字的辨認系統因為測試字串和碼書作比對的量化誤差在字與字連接的部份會很明顯的增大, 如此一來便可以輕易地將字串中各個數字的邊界出來, 再加上音長(duration)的條件便能將字串的內容辨認出來。