Abstract
過去,三音模型(triphone)已經被證明是表現最好的聲學模型,比雙音模型(biphone)及單音模型(monophone)更好;不過,三音模型之所以表現如此之好,主要原因是其所需要估計的參數比雙音模型及單音模型多出許多的緣故。所以,要訓練三音模型所需要的訓練語料自然比其他的聲學模型還要多,然而,這並非對所有的語音研究都是可能的。 在這篇論文,我們將介紹一種新的聲學模型---轉移模型(transition phone model)。在某些情況下,其所需要估計的參數數目與單音模型差不多;但其所表現出來的效果與雙音模型是差不多的,甚至在訓練語料不足時,它的表現可以比三音模型更好。 除了轉移模型以外,我們還介紹另一個新的觀念--- complementary model,利用complementary model的觀念,可以凸顯這段未知其內容的聲音在“對”的模型的可能性(likelihood),降低其在 “錯”的模型的可能性(likelihood)。這不僅可增加切段(force alignment)的準確度,還可增加辨識率。