Logo image
英中機器翻譯-中文補詞增刪之研究
Thesis

英中機器翻譯-中文補詞增刪之研究

陳正誼
Masters, 國立清華大學, 資訊工程學系
1993

Abstract

機器翻譯 虛詞 衍生度 稀疏資料 Machine Translation Function Words Fertility Saprse data
機器翻譯的研究已經有幾十年的歷史了, Brown【90】所提出的統計式機 器翻譯系統為這個領域開啟了一個新的研究方向。 Brown 利用雜訊通道 的架構,在一連串的研究中,對於翻譯時參數空間過大的問題一直無法有 效的克服,主要原因在於忽略了一些間單的語言分析,以致於翻譯的花費 是以輸入句子的長短成指數函數的快數成長。我們提出兩階段式的統計式 機器翻譯模型,並將問題分為全域性與區域性兩種。在第一階段,以全域 性的資訊解決全域性的問題,希望藉由分析來源語和目標語,擷取出經驗 法則,利用兩種語言的知識,同時解決結構歧異、字義歧異與詞彙對應的 問題。本文討論之區域性資訊解決區域性問題的作法。解決全域性問題後 的句子,還不能完整的以目標語詞句,表達出原文的意思,所以,常要添 加一些虛詞。因此,在本階段,我們根據中英文辭彙對應( Word Correspond)後的結果,分析中英文間衍生字的情形。利用分析的結果, 將可能的衍生字,加入到第一階段處理後的句子中,希望表達出原文的涵 意,而達到使句子通順,甚至潤飾句子的效果。我們建立大量的中文語料 庫,嘗試以統計的方式擷取出語言知識,將句子還原成為中文的表達方式 。適當的分析可以大量減少參數空間並且提高系統效率。

Metrics

1 Record Views

Details

Logo image