Abstract
在人類的語言中,有許多的字有許多不同的意義。人類很容易從文章中了解該字所代表的意義,但對電腦來說,這並不是一件容易的事。語意岐義解析便是指字義的辨識。語意岐義解析在自然語言處理中,是一個相當重要的問題。由於網際網路的快速發展,資訊成長的速度也日益加快。文章分類有助於人們取得所需的資訊。傳統文章分類的作法,大多是統計字在文章中出現的頻率或機率。在此論文中,我在先作語意岐義解析將它結合到文章分類上,以提高文章分類的正確率。在本文中,我們介紹如何結合語意岐義解析與文章分類。我們從文章中找出一些不同的屬性,並實驗比較那些屬性對於語意岐義解析較有用處。我們並實際比較了幾種不同的演算法,包括決策樹學習法,以及以貝氏理論為理論基礎的天真的貝氏分類法,還有實例學習法等演算法。看那一種演算法可以得到較高的正確率。最後,我們展示了,如何結合語意岐義解析與文章分類,我們先找出文章中比較容易作語意岐義解析的字,把這些字依機器可讀型字典中,所查出的語意編號編成特別的字串。並用這個字串來取代原有的字。對於那些無法在機器可讀型字典中找到的字,以及雖然可以在機器可讀型字典中找到,但是較不容易作語意岐義解析的字,保留原本的型式。經過這樣的處理之後,以可提高文章分類的正確率。