APP下载

结合Conformer与N-gram的中文语音识别①

2022-08-04许鸿奎卢江坤张子枫周俊杰胡文烨姜彤彤郭文涛李振业

计算机系统应用 2022年7期
关键词:语言模型

许鸿奎,卢江坤,张子枫,周俊杰,胡文烨,姜彤彤,郭文涛,李振业

1(山东建筑大学 信息与电气工程学院,济南 250101)

2(山东省智能建筑技术重点实验室,济南 250101)

随着科技的飞速发展,语音识别技术已经成为了智能设备的标配,这项技术贯穿了多门学科理论,包含了模式识别、电子技术、数理统计、信号处理、计算机科学、物理声学、生理科学和语言学等. 由于语音交互提供了更自然、更便利、更高效的沟通形式,语音必定将成为未来最主要的人机互动接口之一.

在20 世纪50 年代,贝尔实验室就开始基于简单的孤立词语音识别技术的研究[1]. 1968 年,苏联科学家Vintsyuk 提出采用动态规划的算法实现动态时间规整(dynamic time warping,DTW)[2,3],一度成为当时语音识别的主流技术. 后来模式识别、动态规划算法和线性预测编码这3 种技术被引入到语音识别中,成功的使得孤立词语音识别系统从理论上得以完善,并且可以达到实用化的水平[4,5]. 进入80 年代后,基于隐马尔科夫模型(hidden Markov model,HMM)[6,7]的声学建模和基于N-gram 的语言模型在语音识别中得到运用[8,9],这时期语音识别开始从孤立词识别系统向大量词汇连续语音识别系统发展. 后来又结合高斯混合模型(Gaussian mixed model,GMM),形成基于高斯混合模型-隐马尔可夫模型(Gaussian mixed model-hidden Markov model,GMM-HMM)[10]的语音识别框架,使基于HMM 的语音识别模型效果得到提升.

进入21 世纪后,深度学习技术不断发展,在2011 年,微软研究院的Deng 等人以音素状态为建模单位提出了深度神经网络-隐马尔可夫模型(DNN-HMM)的识别方法,用DNN 模型代替原来的GMM 模型……

登录APP查看全文

猜你喜欢

语言模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
语言是刀
让语言描写摇曳多姿
多向度交往对语言磨蚀的补正之道
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
我有我语言
论语言的“得体”
一个相似模型的应用