Abstract
斷詞與詞性標示是中文處理的兩個基本問題。目前電腦應用在中文處理方 面,對於斷詞已能達到相當高的正確率,然而在中文詞性標示的基礎研究 上,仍未有相當的研究及令人滿意的結果。分析其原因,不外乎中文詞性 之訂定尚無標準;中文句法較複雜,變化較大,想要以法則分析法來運作 似乎不太容易;還有缺乏良好的含詞性及詞性頻率的電子辭典。目前我們 以含有詞性及詞頻的電子辭典,採用機率式的方法來做斷詞與詞性標示。 在這個系統裡,有一個基線模式,其他的模式可與之比較。此外,對於部 份未知詞與中文姓名,我們也做了處理。根據對語料的統計,單字未知詞 與雙字未知詞共佔未知詞的百分之九十二,因此未知詞的解決首要在單字 與雙字上。實驗結果顯示能使正確率增加百分之三點五。未知詞處理的困 難在於除了認定一個未知詞外,還要決定未知詞的詞性。在詞性的決定上 ,我們只考慮動詞、名詞、形容詞這三類,其餘詞性出現的機率並不高, 因此並不考慮。中文姓名處理是將姓與名分開處理,姓分為單姓與複姓, 名分為單名與複名,這些都有不同的機率公式處理。姓的召回率高達百分 之九十三點三,名的召回率高達百分之八十五,這點說明了以機率模式處 理中文姓名是可行的,且有很好的效果。在本篇的後面部份,我們做了正 確率的評估與錯誤的分析,以利我們了解什麼是發生錯誤的主因,尋求改 進之道。