Logo image
利用音框線頻譜對之多使用者音訊視訊轉換
Thesis

利用音框線頻譜對之多使用者音訊視訊轉換

余儒育
Masters, National Tsing Hua University
2000

Abstract

audio to visual conversionframe basedLSPmodel adaptationGMM
多媒體常常被做為傳輸訊息的媒介並能提供使用者較為豐富生動的感受。多媒體不單單只是各種型式資料的組合,它還整合了不同型式資料之間的交互關係。在這些不同型式的資料中,又以視訊和音訊這兩者較為重要,因為它們在感官上提供了豐富的資訊。人類的語音不論是在發音或是在感知上,都具有聲音和視覺這兩種型態。由於視訊和音訊之間有著極高的相關性,視訊的參數可以由音訊參數來估測。在這篇論文中,我們提出一個基於混合高斯模型音框層次的音訊視訊轉換系統。經由混合高斯模型,視訊參數可以其對應的音訊特徵參數來估得。在語音信號處理上,有許多種語音特徵參數被發展出來。不論使用何種語音特徵參數,訊視參數估測的準確度幾乎一樣。在這裡我們使用線頻譜對當做語音特徵參數,因為線頻譜對會在語音壓縮時自動產生。在另一方面,使用線頻譜對可以使這套系統和採用線譜對的語音壓縮標準如G.723.1及MPEG-4 CELP、HVXC做整合。此外我們把基礎單位由單一個音框延申為多重音框,試圖來處理連音問題。音訊和視訊特徵是因人而異的。一個以特定使用者為條件的混合高斯模型在使用上並不方便,因為此模型套用在其它使用者身上時,估測的準確度將會下降。在這裡我們提出了四種模型調適的演算法,冀望能以較少的計算量來為新使用者鍛造出適用的混合高斯模型。在這些模型的調適之下,這套轉換系統的應用性將更加提高。

Metrics

1 Record Views

Details

Logo image