Abstract
雖然國語語音的合成技術已有相當的發展,使合成的語音流利且自然仍是我們努力的目標。合成語音的自然流利與語音合成器處理音婘特征的方式有密切的關係。目前在一般的語音合成器中,皆以合成規則來處理音韻特征。在本論文中,我們提出一種統計的方式來處理國語語音合成系統中的音韻特征。首先我們匯集了大量的語料并由專人錄音,這些錄音的語料經過了聲譜儀的切音處理而構成實驗所需的語料資料庫。我們利用向量量化的技術對所有語料的音長與音調軌慫加以分類,訓練出所需的碼書,這些音長與音調軌慫的碼書則被用於建構統計模型。本論文中的統計方式是以條件機率的模型達成,我們利用資料庫中語料的各種不同組合條件,配合音長與音調軌慫的碼書來訓練音長與音調軌慫兩個統計模型。訓練完成的統計模型可取代現有的合成規則而用於語音合成系統中,我們依據輸入文句的組合條件在統計模型中搜尋機率最大的音長與音調軌慫,供給合成系統使用,如此便可獲得最接近自然語音的合成語音。因為統計模型是由各種不同組合情況的語料訓練而成,此模型應包含所有的語音現象與合成規則。所以我們對統計模型加以分析并與已知的合成規則比較。經由實驗與分析,我們證實了由大量語料訓練而產生的統計模型,能自然的反映語音規則,并且能顯示許多未知的語音現象。故此統計模型的確隱含了語音中的音韻特征,是處理國語語音合成系統中音韻特征的一個有系統且有效的方法。