基于远程监督关系抽取的开源情报处理
2021-03-05赵国清何佳洲李永盛王景石
指挥控制与仿真 2021年1期
赵国清,何佳洲,乔 慧,李永盛,王景石
(江苏自动化研究所,江苏 连云港 222061)
随着信息技术的发展与普及,互联网、媒体、社交软件等公开信息源的信息量变得极其庞大与繁杂,其中蕴含了大量有价值的信息,是任何信息系统都不可忽视的领域。开源情报工作能从这些公开信息中挖掘出有价值的信息,以弥补传统秘密情报的不足,是现代情报系统的重要组成部分,也是近十多年来引起广泛关注的情报课题[1]。
开源数据形式多样,有图像、视频、文本等形式,而其中以文本数据最为海量,挖掘情报的潜力也最大。但这些文本数据以半结构化和非结构化数据为主,信息处理惯用的数据挖掘技术在文本信息的抽取上受到掣肘,表现不佳。因此,一种能够低成本、自动化地从这些异构多元的文本数据中抽取出有价值信息的方法,是开源情报处理的关键。
本文针对开源文本数据异质多元、结构松散等问题,提出了一种开源文本信息的自动化处理方法,利用远程监督方法自动标注训练数据,降低人工标注成本,同时利用神经网络从文本中抽取有价值的情报信息。最后,在中文人物关系自动标注数据集上对算法进行了验证,结果抽取性能相较于基线模型有显著提升。
1 相关研究
1.1 开源情报处理研究现状
早期的开源情报处理研究大多局限于情报管理与操作典范,如北约组织出版的开源情报操作手册[2],对具体的开源情报处理与分析方法并未深入研究。……
登录APP查看全文
