Abstract
在本論文中,主要在探討錄音資料中之語者切割與分群,因為在很多場合中所錄製的語音信號,其內容都是包含一個人以上的。因此如何在一段語音信號中,把不同說話者所發出的語音信號分割出來,並將同一說話者所說的音段分在一起,是本論文的主要目的。 在語者切割方面,本論文所使用之方法有三個步驟,第一步是利用貝氏資訊準約略找出語者轉換點大概的位置,第二步再利用交叉偵測法作精確化,第三步再確認是否為轉換點。在實驗上顯示廣義概似比偵測法偵測轉換點花費的時間少但偵測效能比較差,而貝氏資訊準則偵測法是偵測效能好但偵測轉換點花費的時間相當長,本方法花費的時間雖比廣義概似比偵測法稍長,但比貝氏資訊準則偵測法卻短很多,且偵測效能為三者之冠,可以說是同時擁有廣義概似比偵測法運算量少的優點及貝氏資訊準則偵測法高準確率的優點。在語者分群方面,群集之語者模型採用高斯混合模型,音段與每個群集模型作分群之最大概似法估測,找出最靠近之群集,然後再利用一門檻值判斷要合併或分新群。實驗結果顯示增加高斯混合數對分群的結果是有幫助的,而高斯混合數在等於16時,其結果已達最好,再增加混合數分群效能也不再上升。而另一實驗結果也顯示要分群的音段群中包含語者數愈多,其整體分群效能愈低。