Logo image
在多語者環境下之語者分割與語言辨認研究
Thesis

在多語者環境下之語者分割與語言辨認研究

詹順凱
Masters, National Tsing Hua University
2001

Abstract

語者分割語言辨認 Speaker SegmentationLanguage Identification
在本論文中,利用貝氏資訊法則與語音段分群的觀念,提出快速聲學轉換點偵測法,以建立更可靠與正確的語者分割。語言辨識部份,本論文規劃為中文、日文與英文,三種語言的辨認機制,語言模型採高斯混合模型。經由語者分割後將輸入語音區分為數個語音段,對每一語音段作語言之最大概似法估測,辨認該語音段的語言。實驗中,本論文所提出的快速聲學轉換點偵測法,與過去論文所提出之可變長度聲學轉換點偵測法比較,所需時間約為可變長度聲學轉換點偵測法19%,大量的減少偵測時間。而正確性與可靠度也優於可變長度聲學轉換點偵測法。另外實驗中也比較不同的取樣頻率與特徵參數,對偵測聲學轉換點的可靠度與正確性進行分析。語言辨識實驗部份,將測試句切割成不同長度的語音段,進行語言辨認。實驗結果顯示,必需有一定的長度以上的語音信號段,才能正確的辨識出該語音段屬於何種語言。觀察各種語言間辨識錯誤的情形,日文辨識成英文的比例最高,中文辨識成日文則最低,若能夠掌握各種語言間的特性,必能提高語言辨識的正確性與可靠度。未來尚待努力的方向,多語者環境下之語者分割部份,還有提高正確率與可靠性的空間,未來希望可以得到更好的方式,提高系統正確率與可靠性。特徵參數抽取在本論文中採用梅爾刻度式倒頻譜係數與特徵參數分析,未來希望可以得到一組完全將語者資訊與語音資訊分離的特徵參數,以提高系統的正確性與可靠度。本論文語言辨識的機制,只是完成一個雛形,未來可考慮更多語言的特性,使得語言辨識率提高。

Metrics

1 Record Views

Details

Logo image