Logo image
基於隱藏式馬可夫模型之中文語音合成與吼叫情緒轉換
Thesis

基於隱藏式馬可夫模型之中文語音合成與吼叫情緒轉換

吳尚鴻
Masters, National Tsing Hua University
2009

Abstract

語音合成情緒轉換隱藏式馬可夫模型文字轉語音 emotion conversionspeech synthesishmm
合成出自然、富有情緒的真實語音一直是各方追求的目標,而基於隱藏式馬可夫模型(Hidden Markov Model)實作之中文語音合成系統(Text-To-Speech System),能夠利用少量的語料,合成出相當自然的語音。利用參數化之語音表示法的特性,能夠模仿任意目標語者的說話風格、情緒特徵,進而達到聲音轉換(voice conversion)的效果。 本系統分為三部份,分別是訓練端、調適端以及合成端。在訓練端,做法類似於語音辨認,對語料庫中的語料經過特徵參數抽取後,將特徵參數類似或相同的語音單元作訓練。合成單元的統計機率模型經過訓練後,可以充分的表達出合成單元的聲學特性。在調適端中,許多利用模型調適(Model Adaptation)來增進語音辨識系統(Automatic Speech Recognition)準確性的方法被應用在語音合成系統上,透過模型調適的演算法,將描述原始語者的模型參數調適為描述目標語者的模型參數,以期許可以模擬出任意目標語者自然語音的特色。本論文利用CSMAPLR(Constrained Structural Maximum A Posteriori Linear Regression)模型調適方法,將原始模擬新聞播報方式的模型,調適為吼叫聲(roar)之模型,達到情緒轉換之目的。最後為合成端,由輸入的文字作文句分析(text analysis),挑選出對應的合成單元統計機率模型,這些統計機率模型串接為句模型(sentence model),然後從利用參數產生演算法(parameter generation algorithm)產生特徵參數序列,最後利用反向濾波器產生語音訊號。 實驗中,利用主觀及客觀實驗,評量本系統對情緒以及語者特性之轉換。

Metrics

1 Record Views

Details

Logo image