知识图谱中实体相似度计算研究
2017-04-25高大启
中文信息学报 2017年1期
李 阳,高大启
(华东理工大学 计算机科学与工程系,上海 200237)
知识图谱中实体相似度计算研究
李 阳,高大启
(华东理工大学 计算机科学与工程系,上海 200237)
实体相似度的计算有诸多应用,例如,电商平台的相似商品推荐,医疗疗效分析中的相似病人组等。在知识图谱的实体相似度计算中,给出了每个实体的属性值,并对部分实体进行相似度的标注,要求能得到其他实体之间的相似度。该文把该问题归结为监督学习问题,提出一种通用的实体相似度计算方法,通过清洗噪声数据,对数值、列表以及文本等不同数据类型进行预处理,使用SVM,Logistic回归等分类模型、Random Forest等集成学习模型以及排序学习模型进行建模,得到了较好的结果。
实体相似度;监督学习;分类模型;集成学习
1 引言
知识图谱(knowledge graph)是目前非常热门的研究领域。它本质上是一种语义网络,其结点代表实体(entity)或者概念(concept),边代表实体/概念之间的各种语义关系。对于一个包含众多实体的知识库,我们除了关注实体本身的信息外,还需要关注实体与实体之间的关联信息。其中面临的一个问题就是:给定两个实体,如何判断它们之间是否相似,以及相似的程度有多高。
实体间的相似是指实体之间在深层语义上的相似,而非只关注表层信息的传统相似度。例如,“刘德华”和“张学友”都是香港歌手,他们之间有很多共同属性;相对的,“刘德华”和“马德华”虽然在名字上很相似,但他们之间却没有太多属性共性,所以 “张学友”比“马德华”对于“刘德华”来说更相似。……
登录APP查看全文
