APP下载

基于BiLSTM-IDCNN-CRF模型的生态治理技术领域命名实体识别

2021-03-16马建霞

计算机应用与软件 2021年3期
关键词:文本生态信息

蒋 翔 马建霞 袁 慧

1(中国科学院西北生态环境资源研究院 甘肃 兰州 730000) 2(中国科学院兰州文献情报中心 甘肃 兰州 730000) 3(中国科学院大学经济与管理学院图书情报与档案管理系 北京 100190) 4(中国移动通信集团北京有限公司 北京 100007)

0 引 言

自然语言处理(Nature Language Processing,NLP)是一门融语言学、计算机科学、数学于一体的交叉学科。在大数据时代的背景下,自然语言处理已广泛应用于各个任务中,如:信息检索、机器翻译、舆情分析、知识图谱构建等。命名实体识别(Named Entity Recognition,NER)是自然语言处理的基本任务之一,其目的在于从文本中识别出专有名词和有意义的短语,是上述较高层次自然语言处理任务中不可缺少的一部分基础工作。

在生态治理技术领域中,有大量的文献数据没有得到充分的开发与利用。对生态治理技术领域的论文数据进行充分的挖掘和利用,首先需要自动、准确、快速地识别和抽取生态治理文献中的相关实体,如生态治理技术名称、实施时间、实施地点等。抽取出的实体将应用于生态治理技术领域后续的自然语言处理任务(如:关系抽取、事件抽取、领域知识图谱构建等)。使用神经网络技术从大量文献中识别出生态治理技术领域的命名实体,不仅有助于生态治理技术领域的研究人员开展相关的科研工作,也促进了文本抽取技术在资源环境情报分析方面的应用。

生态治理技术领域中的文献存在书写规范不统一、专有名词较多等问题,在分词时会加入大量的噪声,降低实体的识别效果。……

登录APP查看全文

猜你喜欢

文本生态信息
“生态养生”娱晚年
住进呆萌生态房
生态之旅
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
订阅信息
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
生态
展会信息
如何快速走进文本