Abstract
本論文主要在討論使用大量語句的聲音檔來做語音合成的方法。我們對一般的中文語音合成系統的三大部分:文句分析、韻律產生器、語音合成器加以實作並對語音合成器的部分加以比較。另外,有別於一般傳統的使用單音節來做語音合成的做法,我們同時建構了一個使用411個音節來做合成語料的單音節語音合成系統,和使用許多語音文句語音檔中,取出相同的片段來接合的大量語料庫語音合成系統。並且拿這二個系統來做分析比較。 而使用大量語料庫的語音合成系統時,要面對的困難主要有下列二點,本論文也提出相對應的解決方法: 第一、輸入文句和大量語料庫中的文句比對 輸入文句時,和大量語料庫中文句要加以比對,來找出相同的文字來做合成的語料,但比對起來較為費時。本論文使用反轉檔和最長連續詞數表,可以降低比對時間。 第二、片段與片段之間韻律參數不穩定 從不同語句所取出的片段語音檔來加以接合,因為韻律參數的不一致,會使聽者明顯感覺不自然。本論文也調整各個韻律參數,並選出較合適的語料來合成,可以降低這種情形發生。 使用大量語料庫的語音合成系統在經過語音調整之後,和原來的單音節系統來比較起來雖然使用大量語料庫的合成系統雖還有改進的空間,不過也較單音節語料庫的合成音還流暢,也不失為另一種可行的語音合成方式。