Abstract
在過去人類行為分析是透過傳統人為觀察方式來記錄。像婚姻治療方面,評分者利用觀看錄影的方式來對一整段夫妻對話中所展現的行為作評分。藉由這樣取得各種行為表達程度的量化,針對此量化分數來更進一步研究夫妻婚姻治療成效,但這種做法非常耗時且會因為評分者的各種主觀因素影響最後的準確性。 如果能透過機器學習的方式來自動化處理辨識,將會節省非常多的人工時間和提升客觀性。深度學習(Deep Learning)在目前機器學習上是很熱門的話題。本論文提出以堆疊稀疏自編碼器(Stacked Sparse Autoencoder,SSAE)方式對聲音訊號特徵進行降維,並找出相對關鍵的高階特徵,最後再利用邏輯迴歸分析(Logistic Regression,LR)來辨識。此方法的整體準確率為 75%(丈夫行為平均辨識準確率為 74.9%、太太為 75%)。相對於過去研究的 74.1% (丈夫行為平均準確率 75%,太太為 73.2%) (Black et al., 2013),提升 0.9% 。我們提出的方法在使用更低維度的聲音特徵值中可有效的提升行為辨識準確率。