Abstract
索引是尋找與選擇知識的重要工具之一,但是以人工來編製索引是一件繁 瑣而且沒有效率的工作。在這篇論文中,將針對利用自然語言與統計的技 術來發展電腦輔助產生中文索引系統,研究其可行性。中文的語意基本單 位是詞,但是在中文文件中的詞卻不像英文有空白區隔開來,所以在進行 中文自動索引前,必須先經過斷詞程序。另外中文虛字也常有其他的詞性 存在,不像英文虛字十分明確較無歧義而容易處理,因此必須用標示詞性 來解決此問題。另外索引常常是由名詞片語或動詞片語組成的,因此也要 進行名詞片語標示的工作。但是中文自然語言處理的技術尚未十分成熟, 利用自然語言處理的技術來進行中文自動索引,有所助益也會增加不少錯 誤。因為缺乏中文自動索引的研究資料,所以進行幾個初步實驗以了解問 題,並利用人為修改過的真實索引來計算正確率與召回率。因為詞是中文 的基本語意單位,所以每個實驗都先經過斷詞的程序,以詞為基本單位進 行實驗。前兩個實驗只利用統計的技術來完成自動索引的工作,以觀察統 計技術的效率,兩個實驗唯一的不同點是使用的統計方法不同。第三個實 驗則加入詞性標示、名詞片語標示等自然語言處理技術,以了解其功效。 經過實驗後發覺兩種方法所得的正確率與召回率相差不多,但是經過自然 語言處理後的索引品質會提升不少。由觀察與分析初步實驗的結果,我們 決定同時使用自然語言處理與統計技術來解決中文自動索引的問題。實驗 結果發現這種方法的召回率與正確率都比初步實驗高約 25%,而達到 63%左右。主要錯誤的原因是自然語言處理的錯誤與統計的錯誤各約佔 40%。實驗的結果很令人滿意,可以利用此實驗結果來完成一套電腦輔助 人工編製索引的系統。