基于改进的N-gram模型和知识库的文本查错算法
2021-10-15旷文珍
计算机应用与软件 2021年10期
王 琼 旷文珍 许 丽
1(兰州交通大学自动化与电气工程学院 甘肃 兰州 730070) 2(兰州交通大学研究院甘肃工业交通自动化工程技术研究中心 甘肃 兰州 730070)
0 引 言
随着人工智能发展新时代的到来,语音识别技术已被广泛应用,但在实际应用中,现有的语音识别引擎还存在领域知识不够丰富的问题。面对专业领域对语音识别的特殊要求,研究者们主要对语音识别模型进行了研究,提出一系列的新模型和方法,如:文献[1]提出了基于声学状态似然值得分模型及监督状态模型的语音识别特征融合算法;文献[2]提出了一种基于随机段模型的发音信息集成方法;文献[3]构建了一种基于声学特征空间非线性流形结构新型声学模型;文献[4]对基于隐马尔可夫模型的电力调度语音识别系统进行了研究。也有部分学者从语音识别后文本入手,通过自然语言处理技术进行研究,来提高专业领域内的语音识别率。
目前市场上成熟的语音智能识别软件针对日常用语的识别准确率已取得了不错的效果。但铁路车务系统对行车指挥用语有标准化要求,现有的语音智能识别软件无法满足,识别的错误类型主要有散串错误和同音字错误,其中散串错误是指将词组识别为连续的单字,如将“红光带”识别为“宏光代”。同音字错误又分为两种情况,一种是将正确词组识别为同音异意词,如将“道岔”识别为“刀叉”;还有一种是铁路信号领域内一些字母或数字特殊规定,如“DG”规定发音为“dao gui”,被识别为“捣鬼”。……
登录APP查看全文
