Abstract
剖析規則(parsin rules)與詞彙(lexicons)的建立與維護一直是自然語言剖析(natu-ral language parsing) 的一大瓶頸。本論文提出一個語言習得的機器學習模。它將自然語言的剖析視為一種解題的過程 (problem solving)。使用者給定句子和其剖析樹(parse tree)做為輸入的訓練例子 (training examples)。而此句子即為初始狀態(initial state) ,其剖析樹即為目標狀態(goal state)。在輸入許多訓練例子後,系統可以自動地習得如何將這些句子剖析成剖析樹的規則,並同時整理和歸納其詞典(Lexical dictionary)的內容與結構。剖析的策略是建構在馬克士的剖析策略(Marcus' parsing Strategy)上。它主要的兩個資料結構––節點堆疊(node stack)與緩衝堆疊(buffer stack)的內涵即為剖析規則的情況部份 (condition parts),而從給定的剖析樹中推導而來的適當的運算元 (action operators) 即成了剖析規則的動作部份(action parts)。經由對這些習得的規則作一般化,系統除了可以獲得較精簡的規則以外,並可以同時歸納詞典的內容。此系統採用三種歸納及一般化(Generalization)的方法:“簡單的一般化”(Simplegeneralizations),“利用質問的一般化”(Generalization by Asking Questions)及“往回傳導的一般化”(Generalization Back-Propagation) 。“簡單的一般化”是用於當二條規則(rules) 只有一個差異時,此差異可以被歸納成一個新的觀念(co-ncept)。“利用質問的一般化”是利用詢問使用者的方式來作一般化,以避免產生過度的一般化 (over-generalization)。而往回傳導的一般化是對最後被執行的規則作“利用質問的一般化”後,將此一般化的結果往回傳導至先前被使用過的規則中,如此可以減少系統詢問使用者的次數,並可以進一步將這些規則一般化。藉由這些一般化方法的緊密結合可以提高本自然語言習得系統的效率和品質。