Abstract
傳統上文件摘要可以大略分為四種形式:指示性摘要(Indicative Abstract),資料性摘要(Informative Abstract),評論性摘要(Critical Abstract),摘錄(Extract)。指示性摘要是提示讀者此篇文章的存在,並提供足夠的資訊,使其能決定是否應該閱讀原始文件;而資料性摘要提供豐富的內容資訊,有時甚至用來代替原始文件;評論性摘要是指以摘要的形式對原文作一評論;摘錄是直接由原文字句中選取提供事實資料的文句,段落等的節錄,可能是指示性或資料性的性質。本篇論文所得的摘要屬於摘錄的一種,擷取文件中適當長度的部分,來作為文件內容的摘要。 首先,我們先以郵政總局郵遞區號檢視程式中的台灣省各級行政區區域名稱語料庫為基礎,取出文件中台灣區各級行政區的名稱,再以百家姓語料庫為基礎取出文件中屬於人名的中文詞組。接著,我們利用詞語與詞頻的關係提出一套中文文件自動取詞的方法,來擷取出文件中的關鍵詞。根據中文語詞的長度與在文件中出現頻率給予各個關鍵詞不同的權重。最後,設計一套合理的計分方式,配合文件各語句中各個關鍵詞的權重,給予文件各語句適當的分數。分數最高之語句即為文件之指示性摘要。在專有名詞自動取詞方面,平均精確率約為86%,召回率約為84%。關鍵詞斷詞平均精確度為91%。摘要結果有86%的摘要可以取代明日報之人工摘要。