APP下载

基于改进的N-gram模型和知识库的文本查错算法

2021-10-15旷文珍

计算机应用与软件 2021年10期
关键词:文本模型

王 琼 旷文珍 许 丽

1(兰州交通大学自动化与电气工程学院 甘肃 兰州 730070) 2(兰州交通大学研究院甘肃工业交通自动化工程技术研究中心 甘肃 兰州 730070)

0 引 言

随着人工智能发展新时代的到来,语音识别技术已被广泛应用,但在实际应用中,现有的语音识别引擎还存在领域知识不够丰富的问题。面对专业领域对语音识别的特殊要求,研究者们主要对语音识别模型进行了研究,提出一系列的新模型和方法,如:文献[1]提出了基于声学状态似然值得分模型及监督状态模型的语音识别特征融合算法;文献[2]提出了一种基于随机段模型的发音信息集成方法;文献[3]构建了一种基于声学特征空间非线性流形结构新型声学模型;文献[4]对基于隐马尔可夫模型的电力调度语音识别系统进行了研究。也有部分学者从语音识别后文本入手,通过自然语言处理技术进行研究,来提高专业领域内的语音识别率。

目前市场上成熟的语音智能识别软件针对日常用语的识别准确率已取得了不错的效果。但铁路车务系统对行车指挥用语有标准化要求,现有的语音智能识别软件无法满足,识别的错误类型主要有散串错误和同音字错误,其中散串错误是指将词组识别为连续的单字,如将“红光带”识别为“宏光代”。同音字错误又分为两种情况,一种是将正确词组识别为同音异意词,如将“道岔”识别为“刀叉”;还有一种是铁路信号领域内一些字母或数字特殊规定,如“DG”规定发音为“dao gui”,被识别为“捣鬼”。……

登录APP查看全文

猜你喜欢

文本模型
一半模型
初中群文阅读的文本选择及组织
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
FLUKA几何模型到CAD几何模型转换方法初步研究
如何快速走进文本