Logo image
中文書後索引自動產生之研究
Thesis

中文書後索引自動產生之研究

曾聰義
Masters, 國立清華大學, 資訊工程學系
1992

Abstract

書後索引 中文自動索引 自然語言 Book Indexes Automatic Chinese Indexing Natural Language
索引是尋找與選擇知識的重要工具之一,但是以人工來編製索引是一件繁 瑣而且沒有效率的工作。在這篇論文中,將針對利用自然語言與統計的技 術來發展電腦輔助產生中文索引系統,研究其可行性。中文的語意基本單 位是詞,但是在中文文件中的詞卻不像英文有空白區隔開來,所以在進行 中文自動索引前,必須先經過斷詞程序。另外中文虛字也常有其他的詞性 存在,不像英文虛字十分明確較無歧義而容易處理,因此必須用標示詞性 來解決此問題。另外索引常常是由名詞片語或動詞片語組成的,因此也要 進行名詞片語標示的工作。但是中文自然語言處理的技術尚未十分成熟, 利用自然語言處理的技術來進行中文自動索引,有所助益也會增加不少錯 誤。因為缺乏中文自動索引的研究資料,所以進行幾個初步實驗以了解問 題,並利用人為修改過的真實索引來計算正確率與召回率。因為詞是中文 的基本語意單位,所以每個實驗都先經過斷詞的程序,以詞為基本單位進 行實驗。前兩個實驗只利用統計的技術來完成自動索引的工作,以觀察統 計技術的效率,兩個實驗唯一的不同點是使用的統計方法不同。第三個實 驗則加入詞性標示、名詞片語標示等自然語言處理技術,以了解其功效。 經過實驗後發覺兩種方法所得的正確率與召回率相差不多,但是經過自然 語言處理後的索引品質會提升不少。由觀察與分析初步實驗的結果,我們 決定同時使用自然語言處理與統計技術來解決中文自動索引的問題。實驗 結果發現這種方法的召回率與正確率都比初步實驗高約 25%,而達到 63%左右。主要錯誤的原因是自然語言處理的錯誤與統計的錯誤各約佔 40%。實驗的結果很令人滿意,可以利用此實驗結果來完成一套電腦輔助 人工編製索引的系統。

Metrics

1 Record Views

Details

Logo image