Abstract
在本論文中,以高斯混合模型(GAUSSIAN MIXTURE MODEL)來代表每一位語者之特徵向量(FEATURE VECTORS)的統計分佈(DISTRIBUTION),以LBG演算法、EM ALGORITHM及最大概似值法(MAXIMUM LIKELIHOOD METHOD)等原理,來做語者辨認的實驗。從幾組不同特徵向量的比較中發現,取梅爾刻度式倒頻譜參數(MEL-SCALE CEPSTRUM)的一階導數和對數能量(LOG ENERGY)的一階導數、二階導數對於語者辨認不但沒有好處,相反地,對於語者辨識率反而有害。 從傳統的高斯混合模型與向量量化式高斯混合模型(VQGMM)的比較中,發現後者在模型訓練速度上的大幅提升,以同樣為32個混合數而言,根據不同的碼本(CODEBOOK)大小,以二至四個CLUSTER數而言,訓練時間可以有40%至55%左右的節省; 在假設共變異矩陣(COVARIANCE MATRIX)為對角共變異矩陣(DIAGONAL COVARIANCE MATRIX)的情形下,對於語者識別(SPEAKER IDENTIFICATION)而言,以主成分分析(PCA)、線性鑑別分析(LDA)較佳,最後才是未做任何處理的陽春值(BASELINE),以平均辨識率而言,大約都有1%至2%的增加,對於語者間的鑑別度分析包括語者驗證而言,則以主成分分析最佳; 在對角共變異矩陣與全共變異矩陣(FULL COVARIANCE MATRIX)的比較中,發現後者具有相當好的表現,大致上,比對角共變異矩陣平均都有6%至7%的增加,唯需花費大約三倍以上的時間來做模型的建立,因此,再以一個向量量化式的高斯混合模型來大幅縮短訓練模型時所需要花費的時間。最後,本論文以4個CLUSTER,每個CLUSTER各8個混合數來運用在全共變異矩陣上,可以比傳統的高斯混合模型省下大約55%的時間,且其辨認率亦不會有太大的下降。