Logo image
機率式斷詞及詞性標定
Thesis

機率式斷詞及詞性標定

陳志達
Masters, National Tsing Hua University
1990

Abstract

斷詞詞性標定機率模式二階馬可夫機率模詞彙庫自然語言機率式斷詞
單獨的漢字并非中文句法上及語意上的最小元素。詞才是中文中能夠獨立出現,并自由運用的最小單位。將輸入句子的字串順序,轉換成詞語順序的過程就叫做斷詞。斷詞的目的主要是為了簡化自然語言處理系統的運算步驟,避免考慮太多不可能的斷詞情形。然而因為中文的詞彙和其它語言一樣,很多都具有不只一個以上的詞性。如何找出句子中詞彙的正確詞性,對自然詞 言處理系統是非常重要的。本篇論文提出一個使用機率模式的系統,分別解決斷詞及詞類標定上的問題。首先將斷詞轉換成限制條件滿足問題,再以詞獨立出現的機率做動態規劃的最佳化決定,運算時間與詞的長度成幾近線性的關係,詞的長度也不受限制。在詞類標定問題上,系統使用二階為可夫機率模式,作為中文詞性標示的初步實驗方法。機率模式在中文斷詞上有很好的表現,實驗結果顯示,系統在斷詞部份可以達到接近96% 的召回率。相對於以前的研究,此系統使用較簡單的運算方法,系統也只須使用一個簡單的詞彙庫,而且詞彙的長度完全不受限制。實驗結果分析顯示,斷詞錯誤原因多數是肇因於詞庫未收藏的詞彙,因為機率模式所導致的錯誤所佔比率極小。詞性標示部份,系統可以達到大約80% 的正確率。實驗中也發現如果要進一步提高正確率,則有賴詞類系統做更有層次的畫分,避免初步的語言處理考慮過多的語意成份,才能達到較佳的效果。

Metrics

1 Record Views

Details

Logo image