APP下载

基于远程监督关系抽取的开源情报处理

2021-03-05赵国清何佳洲李永盛王景石

指挥控制与仿真 2021年1期
关键词:文本信息模型

赵国清,何佳洲,乔 慧,李永盛,王景石

(江苏自动化研究所,江苏 连云港 222061)

随着信息技术的发展与普及,互联网、媒体、社交软件等公开信息源的信息量变得极其庞大与繁杂,其中蕴含了大量有价值的信息,是任何信息系统都不可忽视的领域。开源情报工作能从这些公开信息中挖掘出有价值的信息,以弥补传统秘密情报的不足,是现代情报系统的重要组成部分,也是近十多年来引起广泛关注的情报课题[1]。

开源数据形式多样,有图像、视频、文本等形式,而其中以文本数据最为海量,挖掘情报的潜力也最大。但这些文本数据以半结构化和非结构化数据为主,信息处理惯用的数据挖掘技术在文本信息的抽取上受到掣肘,表现不佳。因此,一种能够低成本、自动化地从这些异构多元的文本数据中抽取出有价值信息的方法,是开源情报处理的关键。

本文针对开源文本数据异质多元、结构松散等问题,提出了一种开源文本信息的自动化处理方法,利用远程监督方法自动标注训练数据,降低人工标注成本,同时利用神经网络从文本中抽取有价值的情报信息。最后,在中文人物关系自动标注数据集上对算法进行了验证,结果抽取性能相较于基线模型有显著提升。

1 相关研究

1.1 开源情报处理研究现状

早期的开源情报处理研究大多局限于情报管理与操作典范,如北约组织出版的开源情报操作手册[2],对具体的开源情报处理与分析方法并未深入研究。……

登录APP查看全文

猜你喜欢

文本信息模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
订阅信息
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
展会信息
如何快速走进文本
健康信息