Abstract
Brown[1990]利用雜訊通道的架構,提出一套新的統計式機器翻譯系統,提供機器翻譯研究領域的新方向。然而在於他們一連串的研究中,對於翻譯時的參數問題一直無法有效克服,主要原因在於未能使用一些簡單的分析,以致於翻譯的花費是以輸入句的長短成指數函數的快速增加。本研究目的是在於發展一個簡單的逐句式翻譯系統,主模型為統計式翻譯模型輔以部分法則,主要的架構來自於雜訊通道。嘗試利用中文語料庫來幫助字義、結構歧異的問題,同時提出有關於中英文詞序間的分析。為了不因缺乏結構等分析而產生高昂的花費,提出一個“兩階段的翻譯模型”為之對策。第一階段是全域性問題的解決,有關於結構、字義、轉換生成過程的問題均屬於此階段,必須利用全域性的資訊來解決。第二階段是區域性的問題,有關於英文翻譯成中文時衍生度的處理,這部份和中文本身的語言特性有極大的關係,故使用中文的區域性資訊來解決。本篇論文在討論這“兩階段的翻譯模型”的第一階段處理,並且利用簡單句中的文法單元之中心語來作為翻譯對象,最主要的原因是翻譯過程的現象,和這些文法單元之中心語有很大的關係。本文共分五章,第一章為機器翻譯簡介,第二章為機率統計式翻譯模型討論,第三章是兩階段翻譯模型之第一階段研究,第四章則為實驗進行之安排,第五章敘述結果以及討論。