APP下载

基于深度学习的英语自然语言处理系统

2021-03-10曹艳琴

系统仿真技术 2021年4期
关键词:特征提取英语模型

曹艳琴

(西安培华学院人文与国际教育学院,陕西西安 710125)

自然语言处理(Natural Language Processing,NLP)是指利用人类交流所使用的自然语言与机器进行交互通信的技术[1-4]。在NLP研究的早期,学者主要焦点集中在语言结构分析、技术驱动的机器翻译和语言识别方面[5-6]。目前的研究重点是NLP如何更加自然地在现实世界中使用,相应的研究领域包括智能对话系统和社交媒体数据等[7-8]。

随着机器学习的发展,有学者提出基于词典和规则的有监督机器学习分词算法[9-10],该类方法的优点是简单、易于实现,并且可以根据特定场景制定合适的词典。然而,由于没有统一的分词标准,词典的质量无法明确界定,分词结果存在较大差异。此外,有学者提出利用深度学习在NLP领域进行序列标记[11-12]。然而,深度学习网络训练过程比较复杂,许多传统文本标记方法无法直接移植到深度学习网络。最后,NLP中最重要的为文本特征提取,常用的特征提取方法包括TF-IDF算法、TextRank算法、LDA算法等[13-14]。然而,现有的模型并没有考虑不同模式对当前学习任务的重要性,只关注如何有效地同时使用多种模式进行特征提取。

为解决上述问题,本文提出了一种多模态融合特征提取模型,结合条件随机场(Conditional Random Field,CRF),解决句子层次分析中的序列标注问题。并基于混合网络英语分词处理方法,提高英语分词效率及准确率。

1 英语分词混合网络

1.1 网络架构

基于字符的序列标注任务同样可以看作是一个英语分词任务。在分词处理过程中,深度学习对于四元组的描述,主要是借助A4nin,即注释集的方式来实现。……

登录APP查看全文

猜你喜欢

特征提取英语模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
基于Gazebo仿真环境的ORB特征提取与比对的研究
一种基于LBP 特征提取和稀疏表示的肝病识别算法
3D打印中的模型分割与打包
读英语
基于MED和循环域解调的多故障特征提取
酷酷英语林
Walsh变换在滚动轴承早期故障特征提取中的应用