结合深度神经网络与内容转录的语音识别研究
2021-08-02郑磊
软件导刊 2021年7期
关键词:模型
郑 磊
(山东青年政治学院信息工程学院,山东济南 250103)
0 引言
随着数字时代的到来,信息爆炸式增长,传统的以文本形式保存信息的方式已经不能满足现代人对知识的需求[1]。声音作为一种直接记录和掩饰信息的媒介,在实时传递信息的同时,将情感传递给信息,对信息的记录更有价值[2]。随着多媒体文件的大量应用,基于多媒体数据的信息检索技术已成为信息学研究的热点[3-5]。如何像检索文本一样快速、准确地从各种多媒体文档中查找最重要的信息成为当前关注的热点。
本文介绍了语音识别原理和相关算法。在此基础上将深度神经网络算法(Deep Neural Network,DNN)应用于大词汇量连续识别系统,建立基于深度神经网络的声学模型关键词检测系统。在对比实验中,将所提出的深度神经网络模型应用于构建声学模型,与传统GMM-HMM 进行对比,深入分析了算法对识别系统性能的影响。
1 相关研究
关键词检测技术起源于20 世纪70 年代,最早研究是基于“给定词”概念。语音识别作为关键字检索的一项关键技术受到广泛关注。2006 年,Mustafamk 等[6]提出深度学习概念。微软研究人员将受限的Boltzmann machime(REM)和深度信念网络(DBN)引入到语音识别声学模型训练中,在大词汇量语音识别系统中取得成功[7]。
我国语音识别研究起步较晚。在国家的大力支持下,中国科学院自动化研究所、中国科学院声学研究所等科研机构在语音识别方面进行了广泛研究并取得显著进展。目前,微软、1BM、谷歌等国外公司相继开发了中文语音识别系统[8-9],中国的公司如百度讯飞、搜狗也推出了相应的中文连续语音识别项目。……
登录APP查看全文
