语音识别及端到端技术现状及展望①
2021-03-19张绍阳侯佳正张少博
计算机系统应用 2021年3期
鱼 昆,张绍阳,侯佳正,张少博
(长安大学 信息工程学院,西安 710064)
语音是采用一定语言规则通过人体发声器官发出的有规律的声音信号.语音识别(Auto Speech Recognition,ASR)是研究如何将语音信息转化成文本信息.语音的研究领域可以细分为语音识别、语音合成、声纹识别.其涉及到信号处理,自然语言处理等.在发展过程中经历了3 个阶段.一是孤立词识别,二是连接词识别,如连续数字或连续单词,三是大词汇量下连续语音识别.
自上世纪50年代开始,着手于最简单的数字识别任务,语音识别领域进入研究者的视野.到80年代,研究者们采用统计分析的方法使连续语音识别成为可能.在我国,50年代末有研究者采用电子管电路,对英语中的元音进行尝试识别.90年代,清华大学和中科院自动化所等单位在汉语听写机原理样机的研制方面取得有效成果[1].进入21世纪,深度学习的发展极大促进了语音识别技术.2017年,微软宣布了其在Switchboard 词错率(Word Error Rate,WER)降至5.1%[2],这意味一定条件下机器已经可以像人类专业速记员一样识别词语了.2018年阿里巴巴语音识别模型DFSMN 采用开源框架Kaldi 进行构建,在Fisher (FSH)数据集上测试词错率仅为9.4%[3].百度的模型在其自建的中文数据集上训练并测试,WER 低至7.93%,取得良好的效果[4].但是在复杂多变的应用场景中,识别准确率会大大下降.因此,语音识别领域还有许多问题需要继续研究和解决.
1 语音识别技术研究
1.1 语音信号特征提取技术
早在1952年,首先研究了特定说话人孤立数字……
登录APP查看全文
