Abstract
在了解篇章(discourse) 結構和內容時,回指(anaphoric reference) 是一個很重要的語言現象。在漢語中有三種回指:零形回指(zero anaphora)、 代名回指(pronominal anaphora) 和名詞回指(nominal anaphora)。雖然有多種關於回指的理論研究,但都難有完滿的解釋。這可以歸結為語言現象復雜而人力常難以負荷。為了輔助語言學家分析龐雜的語言現象及利於自然語言的電腦處理,設計一種能從大量語料中擷取規律性的方法是較好的。在本篇論文中,首先從自然語言處理觀點指出問題的所在,那就是已知回指的形式,要找出它的先行詞是那一個,文中分析了西方在電腦處理英文方面的一些研究,而指出方法上問題的所在。接著分析先前語言學家的研究,了解那些特徵會影響回指的選擇。計有分析了陳平(Ping Chen)、 戴浩一(James Tai) 李櫻(Ing Li) 等的研究。然後我提出以語意角色(semantic roles)作為使用或解決回指的主要特徵,并以悠改後的案例學習的法則G-UNIMEM來作規律性的自動擷取。語意角色的提出是參考西方Sidner對英文研究所得的啟示;而案例學習法則是以Leborwitz 的UNIMEM為藍本,計有分類器(classifier)、規則產生器(rule generator)規則過濾器(rule filter) 及特徵選擇器(feature selector)四個模組。對於修改的動機及方法在文中都有討論。文中有對所選特徵的符號說明及意義解說,并有學習過程的一個範例。在測試時,有超過160 個的語料作為個例,每個語料都是配對的連接句子。所得的結果和分析列在論文中,其結果是可接受的,因其和先前語言學家所提的研究結果有吻合地方。在結論和討論中,有對於本方法與其他方法的比較,尤其著重於和戴浩一所提準則的比較。取了120 例子去測試,結果戴浩一的準則雖簡單但其可計算性的效果不如預期的好,而筆者所提的方法是有其可實行性。一些可改進的地方亦一一有所討論。