Abstract
在本論文中,討論了如何使的合成的歌聲更接近真人歌唱,並且在其音質上加以改進。在音質上,我們嘗試了使用對於時域與對於頻域作音高語音長調校的不同方法。在音高的調整上包涵了Multirate,phase vocoder,PSOLA等等方法,同時在音長的改變上我們則嘗試了PSOLA,phase vocoder,WSOLA幾個方向。並且在論文中說明了何以在最後的系統中決定使用何種方法作為依歸的準則。除此之外,在自然度的方面,我們加入了音量的考量,音高遞嬗的平滑化,轉折音,抖音等等部份的模擬。我們也利用multirate的方式作男聲女聲的轉換,經由這樣的轉換可以製造出男女合唱或對唱的特殊效果。 歌聲合成到目前為止還是一項未臻於完美的技術。並不僅只是如何合成岀完美的音質這個問題而已。如何使電腦能夠合成岀接近真人,令人真假莫辯的歌聲仍然是個問題。許多的歌唱技巧在實作上都仍然有其困難性。可以參考的一個方向是如何加入樂理的考量,或者是利用大量的歌聲資料經過訓練後得到某一特定的歌唱模式。雖然如此,接近真人歌唱歌聲合成確實是一項有趣的課題,他的娛樂性與市場性將在可見的未來展現無窮的潛力,比如說自動歌聲矯正,或者虛擬歌手,或者是能夠模仿某特定歌手唱歌的玩具等等。這當然是個美麗的願景,而這個願景相信在不遠的未來可以得到實現。