利用二次归并的Deep Web实体匹配方法
2016-09-29陈丽君
计算机应用 2016年8期



摘要:针对权重边剪枝(WEP)方法在准确率和匹配效率等方面的不足,通过引入自匹配和归并概念,提出一种基于二次归并的Deep Web实体匹配方法。首先,提取各对象的属性值,并按属性值重组对象,使具有相同属性值的对象聚集在一起,实现块的有效划分;其次,计算块内各对象间的匹配度,并据此进行剪枝、自匹配检测、归并,输出初步类簇;最后,以初步类簇为基础,利用簇内对象间传递的消息以及对象属性相似值,进一步挖掘匹配关系,触发新一轮的类簇归并与更新。实验结果表明,与WEP方法相比,所提方法通过自匹配检测,自动区分匹配关系并采取合适的匹配策略,使归并过程逐渐精化,提高了匹配准确率;通过分块、剪枝,有效缩减了匹配空间,提高了系统运行效率。
关键词:二次归并;Deep Web;实体匹配; 类簇;相似值
中图分类号:TP391; TP311
文献标志码:A
0引言
与Surface Web相比,Deep Web资源具有数量更大、质量更优、内容更精确、使用价值更高、增长迅速等特点。接口集成是访问Deep Web资源的主要途径,但由于Web的自治性和动态性,使得Web数据库的数据冗余度高,异构现象严重,给接口集成造成较大困扰。实体匹配(也称实体识别、记录匹配等)是一种在数据集合中发现同一实体不同描述的技术,可用于数据库记录的错误检测、重复检测、不一致数据发现等,以消除数据重复、数据不一致等异构现象。
与模式匹配类似,实体匹配的关键要做好两项工作:评判依据的选择和匹配方法的运用[1];同时,鉴于Deep Web的海量数据,有效的匹配空间缩减策略也非常重要。……
登录APP查看全文
