Abstract
在極低位元率的傳送系統裡,往往將整張影像捨棄,來達到極低位元率的限制。如此一來,在接收端將產生兩種影響:一是畫面不連續,一是語音和影像不同步,本篇論文即是解決這些問題。首先,我們為唇部建模型。利用主軸分析,將所有嘴形轉換成一連串 "投影向量",於是每一個嘴形就由一個投影向量來表示。這正是模型式影像編碼的原理,將每個表情,每個動作,用一些參數代替,以達到資料壓縮的目的。我們將利用這些投影向量,來合成人臉說話的影像。然後,在做唇語識別之前,我們提出模組比對以及分析灰階值的方法,做唇形追蹤的工作。追蹤的結果將用於唇語辨識。唇語辯識分成三個階段。第一步是求各嘴形中,每張影像之間的關係 (包括測試嘴形與參考嘴形)。第二步做奇異值分解。第三步是求測試嘴形和每個參考嘴形之間的關係,並產生一個分數,以決定那個參考嘴形與測試嘴形最像。最後,辨識的結果將用來實現唇形同步系統。未來的工作包括,將合成影像的系統擴充為一個戶動式的人機界面。因此,以拼音的方法來合成,以及加入人工智慧,是必要的。另外,應將讀唇系統普遍化,使能辨識任何人的唇語。至於唇形同步系統,須併入語音訊號,使更正確得彌補遺失掉的嘴形。