APP下载

知识图谱中实体相似度计算研究

2017-04-25高大启

中文信息学报 2017年1期
关键词:语义分类文本

李 阳,高大启

(华东理工大学 计算机科学与工程系,上海 200237)

知识图谱中实体相似度计算研究

李 阳,高大启

(华东理工大学 计算机科学与工程系,上海 200237)

实体相似度的计算有诸多应用,例如,电商平台的相似商品推荐,医疗疗效分析中的相似病人组等。在知识图谱的实体相似度计算中,给出了每个实体的属性值,并对部分实体进行相似度的标注,要求能得到其他实体之间的相似度。该文把该问题归结为监督学习问题,提出一种通用的实体相似度计算方法,通过清洗噪声数据,对数值、列表以及文本等不同数据类型进行预处理,使用SVM,Logistic回归等分类模型、Random Forest等集成学习模型以及排序学习模型进行建模,得到了较好的结果。

实体相似度;监督学习;分类模型;集成学习

1 引言

知识图谱(knowledge graph)是目前非常热门的研究领域。它本质上是一种语义网络,其结点代表实体(entity)或者概念(concept),边代表实体/概念之间的各种语义关系。对于一个包含众多实体的知识库,我们除了关注实体本身的信息外,还需要关注实体与实体之间的关联信息。其中面临的一个问题就是:给定两个实体,如何判断它们之间是否相似,以及相似的程度有多高。

实体间的相似是指实体之间在深层语义上的相似,而非只关注表层信息的传统相似度。例如,“刘德华”和“张学友”都是香港歌手,他们之间有很多共同属性;相对的,“刘德华”和“马德华”虽然在名字上很相似,但他们之间却没有太多属性共性,所以 “张学友”比“马德华”对于“刘德华”来说更相似。……

登录APP查看全文

猜你喜欢

语义分类文本
分类算一算
语言与语义
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
“上”与“下”语义的不对称性及其认知阐释
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊
如何快速走进文本
语义分析与汉俄副名组合