APP下载

一种挖掘文本中实体间关系的方案设计

2021-04-09中国煤炭科工集团

电子世界 2021年14期
关键词:监督模型

中国煤炭科工集团 于 澄

企业在多年的运营过程中会留存大量的电子文档,这些文档多以非结构化形式存储在文件服务器,里面蕴含了大量的有价值信息。如何能够把可利用的信息从这些文档中挖掘出来并加以利用,是一个有价值的课题。本文论述了基于自然语言处理、弱监督学习等人工智能技术,设计一种可行的提取文本内实体关系信息的软件方案。

1 文本中实体关系识别的应用场景及主要内容

随着信息化、数字化技术的发展与应用,大部分企业基本实现了纸质文件向电子化文档的过渡。在企业中,大量电子文档作为企业运营的历史留存,形成了企业的知识库、经验库。而电子文档在企业中通常是以非结构化的电子文件形式存放在文件服务器或数据库中。企业管理者可以通过文本检索工具,设定搜索关键字,获取所需的相关信息。然而,使用检索工具的前提是,检索者须事先知晓所要检索的对象的称谓信息,如要检索“某某公司”相关的内容,则需要知道“某某公司”的全称作为关键字信息进行检索。但是面对海量的文档内容,检索者如何能够尽可能多的提取其中有价值的信息,包括已知检索对象和未知检索对象的信息,并把这些信息进行结构化的存储,以便后续更好的利用其价值,就成为了一个值得探究的课题。进一步讲,在商业领域应用较多的场景是,在海量文档库中识别出公司、机构等实体单位名称,并根据语境提取实体之间可能存在的关系,如股权关系、债券关系、客户关系等。……

登录APP查看全文

猜你喜欢

监督模型
一半模型
突出“四个注重” 预算监督显实效
重尾非线性自回归模型自加权M-估计的渐近分布
监督见成效 旧貌换新颜
夯实监督之基
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
绩效监督:从“管住”到“管好”
监督宜“补”不宜“比”
人大监督不能总是“心太软”