Abstract
語音轉換是將來源語者的聲音轉換成目標語者的聲音,主要是轉換語者聲音的特質,而語音內容不變。本研究的兩個主要目標是尋找有效語音特徵轉換方法,及提高轉換後的語音與目標語者語音之相似度。早期的研究是將來源語者與目標語者的頻譜特徵參數做向量量化,使用碼本對照(Codebook Mapping)的方法來做語者特徵轉換。由於此種轉換方式的頻譜特徵是「離散」的,因此也造成轉換音質不佳的問題。為了解決上述的限制,近年來有人提出使用高斯混合模型(Gaussian Mixture Model,GMM)來做特徵轉換,然而,GMM所輸出目標語者的頻譜可以視為是一個加權平均的結果,因此造成頻譜的過度平滑化。我們將針對一般使用向量量化(VQ)或高斯混合模型(GMM)的轉換方式的缺失做改善。雖然我們也是使用碼本對照(Codebook Mapping)的方法,但是在轉換的過程中,使用特殊的「前N個」(Top-N)與最佳路徑的方式,建立一套「連續」的轉換機制,使得轉換後的波形特徵沒有「不連續」以及「過度平滑化」的問題。在訓練過程中,相較於一般使用DTW做時間對齊的方式,我們提出一套以音節變異特性,做自動分段線性對應的方法。在實驗中我們發現,不論是轉換語音的音質,或是語者特徵的正確性,都得到較佳的結果。由於韻律訊息對於語者特性來說,其重要性不亞於頻譜訊息,所以我們對於韻律訊息轉換也做進一步的研究,實驗結果證實了韻律訊息的重要性。