基于联合序列标注深度学习的层级信息抽取
2021-08-12王旭强田雨婷
计算机应用与软件 2021年8期
王 扬 郑 阳 杨 青 王旭强 田雨婷
(国网天津市电力公司信息通信公司 天津 300310)
0 引 言
随着互联网技术的飞速发展,各个行业都产生并累积了丰富的数据资源。其中作为语言载体的文本数据占据了很大的比重,这些数据普遍存在于各行各业中,包含着大量的有用信息。然而,文本信息一般是以非结构化或者半结构化文本的形式呈现的,无法使用统计分析工具对其中蕴含的信息进行分析和挖掘,人工筛选又花费大量的时间[1]。因此,如何高效准确地从众多的文本数据中进行信息抽取(Informat-ion Extraction)是一个值得研究的问题。信息抽取主要是指从一个给定的文本中识别并提取出具有一定现实意义的或者感兴趣的子序列结构化的内容,是很多自然语言处理任务中基础但又很重要的一环[2]。
信息抽取技术的发展也使得很多文本、Web系统等应用程序从中受益,例如使用基于Web的信息抽取系统来抽取多种多样的信息如招聘信息、新闻信息和技术成果信息等[3-5]。除此之外,信息抽取技术在一些重要的应用领域中也得到了充分的应用。骆轶姝等[6]使用信息抽取方法来处理非结构化的甲状腺病史文档,实现了对甲状腺病史的结构化,并将结构化的结果通过RDF格式进行了存储,对该疾病的诊断有着重要的意义;丁晟春等[7]使用信息抽取技术来实现对动物卫生事件舆情信息中时间、地点、疫病名称、动物数量和应对措施等内容的抽取,提高了动物卫生领域舆情监测的效率;……
登录APP查看全文
