基于语义推理的文本信息关联关系分析技术*
2014-09-28陈天莹苏智慧
电讯技术 2014年1期
陈天莹,苏智慧
(中国西南电子技术研究所,成都610036)
1 引言
基于文本信息的数据挖掘和知识发现是当前信息处理的一大热点。文本信息中蕴含的潜在信息非常丰富,信息之间既具有语义性又具有关联性。文本信息的无结构性导致计算机对其理解、处理、分析较为受限,目前主要依托人工阅读、编辑、分析的方式来进行处理。因此,如何快速从文本信息中找到信息之间的所有直接和潜在关联,并快速对关联信息进行分析是辅助文本信息分析人员工作的重要技术。
关联关系属于知识发现的范畴,分别在数据挖掘和文本挖掘中有不同的内涵和处理技术,针对不同领域、不同信息处理对象其涉及的关键技术也大有不同。
在数据挖掘中的关联分析主要是指关联规则挖掘,它由 Agrawal等人[1-2]提出,其处理对象主要是海量的有结构的数据库数据。关联规则挖掘主要是在有结构化的数据集上发现数据集中项之间的联系。现已发表的研究论文包括确定性关联规则的挖掘、量化关联规则的挖掘、增量式关联规则的挖掘、广义关联规则的挖掘等。最著名的关联规则算法是Apriori[3]算法,其思想是通过多次迭代找出所有的频繁项目集。关联规则主要运用于交易数据库中发现各数据项之间的关联关系,从而生成形如“X Y”的规则。
文本挖掘中的关联分析主要是指知识关联,它是利用各项智能分析技术对非结构化文本进行信息提取、存储、分析后获取有用知识和信息的技术。……
登录APP查看全文
