APP下载

基于训练模型改进的语音问句信息抽取方法

2021-08-11刘继明

科学技术与工程 2021年18期
关键词:语义信息模型

刘继明, 孙 成, 袁 野

(1.重庆邮电大学经济管理学院, 重庆 400065; 2.重庆市智慧邮政工程技术研究中心, 重庆 400065)

为进一步提高智能问答系统中知识图谱信息链接及问答系统的整体性能,针对客户语音语音问句这类特殊自然语言文本的口语化、中文自然语言字词多义等特征导致词性标注结果效率不高、准确性低等问题,通常采用信息抽取、事件抽取、实体抽取等解决方法。其中实体语义词性标注(part-of-speech tagging, POS tagging)和抽取工作,作为自然语言处理(natural language processing,NLP)中一个重要的基础任务,是文本以及数据结构化处理最关键及最基础的一步,语义词性精度直接影响后续任务的整体性能研究,为信息抽取、事件抽取、关系抽取、构建知识图谱、句法分析等工作打下基础。在传统词性标注方法上,通常使用规则或统计方法比如最大熵[1]、支持向量机[2]、guided learning[3]、隐马尔可夫(hidden markov model, HMM)[4]等模型对数据进行标注,这些模型大多需要进行人工特征提取。随着互联网信息技术的和人机交互技术的飞速发展,使用机器深度学习方法实现语义词性标注是NLP的主要研究内容。

1 相关研究

近年来,机器深度学习进行词性标注的在自然语言处理中正逐渐兴起。Collobert等[5]首次提出基于深度学习算法的NLP来处理英文词性标注、命名实体识别等问题,利用由卷积网络和条件随机场的CRF(conditional random filed)层组成结合模型,简称Conv-CRF。随后CNN(convolutional neural network)[6-7]、GRN(gated recursive neural network)[8]、LSTM (long short-term memory)[9-10]深度学习模型都被引入到中文词性标注任务中。2013年Zheng等[11]研究基于机器深度学习词性标注的方法,提出一种用Perceptron-style算法替代传统Maximum-likelihood方法。……

登录APP查看全文

猜你喜欢

语义信息模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
语言与语义
订阅信息
3D打印中的模型分割与打包
“上”与“下”语义的不对称性及其认知阐释
认知范畴模糊与语义模糊
展会信息
语义分析与汉俄副名组合
健康信息