Abstract
機器翻譯的研究已經有幾十年的歷史了, Brown【90】所提出的統計式機 器翻譯系統為這個領域開啟了一個新的研究方向。 Brown 利用雜訊通道 的架構,在一連串的研究中,對於翻譯時參數空間過大的問題一直無法有 效的克服,主要原因在於忽略了一些間單的語言分析,以致於翻譯的花費 是以輸入句子的長短成指數函數的快數成長。我們提出兩階段式的統計式 機器翻譯模型,並將問題分為全域性與區域性兩種。在第一階段,以全域 性的資訊解決全域性的問題,希望藉由分析來源語和目標語,擷取出經驗 法則,利用兩種語言的知識,同時解決結構歧異、字義歧異與詞彙對應的 問題。本文討論之區域性資訊解決區域性問題的作法。解決全域性問題後 的句子,還不能完整的以目標語詞句,表達出原文的意思,所以,常要添 加一些虛詞。因此,在本階段,我們根據中英文辭彙對應( Word Correspond)後的結果,分析中英文間衍生字的情形。利用分析的結果, 將可能的衍生字,加入到第一階段處理後的句子中,希望表達出原文的涵 意,而達到使句子通順,甚至潤飾句子的效果。我們建立大量的中文語料 庫,嘗試以統計的方式擷取出語言知識,將句子還原成為中文的表達方式 。適當的分析可以大量減少參數空間並且提高系統效率。