词类扩充方法在语音识别中的应用
2014-03-21杨林国
电子技术应用 2014年6期
杨林国
(安徽职业技术学院,安徽合肥230061)
近年来,自动语音识别ASR(Automatic Speech Recognition)在移动互联网中受到越来越多的重视。其中,基于N-gram的统计语言模型LM(Language Model)训练是ASR中听写(dictation)应用的重要组成部分。但是N-gram语言模型面临两个重大的问题,即数据的稀疏性[1]和对训练语料的强依赖性。一般情况下,要训练相应的N-gram的语言模型,必须在相应的领域搜集大量的领域语料,并且利用各种有效的平滑算法[2]来解决数据的稀疏性。但是,在实际的应用中,对于领域相关的语料需要大量的人力来搜集或者无法得到,同时特定领域具有特定的分类(如歌手名)和实时性,这限制了在特定领域中语音识别的应用。因此,在这种情况下,基于特定领域的词类扩充方法在语音识别中十分重要[3]。
通常情况下,传统的特定领域的语言模型流程是将一个通用的、训练充分的通用语言模型和一个特定领域的、训练不充分的特定领域模型通过某种方式组合成一个新的模型。因此,这种自适应技术通常也叫话题自适应或者领域自适应技术。可以使用大量的文本训练成一个通用的语言模型M,在给定特定领域的少量语料S后,语言模型自适应的目标就是利用M和S为该特定领域生成一个特定领域模型。用这种方法能够取得比较好的结果[4-5]。但是,这种传统的方法无法满足特定领域词表的不断扩充和实时性。
为了解决特定领域的词类扩充和自适应问题,本文设计了基于分类的语言模型和HCLG[6]结合的新型解码方法,如图1所示。……
登录APP查看全文
