基于多源知识和Ranking SVM的中文微博命名实体链接
2015-04-21陈万礼昝红英吴泳钢
陈万礼,昝红英,吴泳钢
(郑州大学 信息工程学院,河南 郑州 450001)
基于多源知识和Ranking SVM的中文微博命名实体链接
陈万礼,昝红英,吴泳钢
(郑州大学 信息工程学院,河南 郑州 450001)
命名实体是文本中承载信息的重要单元,正确分析存在歧义的命名实体对文本的理解起着关键性作用。该文提出基于多源知识和Ranking SVM的中文微博命名实体链接,结合同义词词典、百科资源等知识产生初始候选实体集合,同时从文本中抽取多种组合特征,利用Ranking SVM对候选实体集合进行排序,从而得到目标实体。在NLP&CC2014*http://tcci.ccf.org.cn/conference/2014/index.html中文微博实体链接评测数据集上进行了实验,获得了89.40%的平均准确率,与NLP&CC2014中文微博实体链接评测取得最好成绩的系统相比,本文的系统具有一定的优势。
命名实体;中文微博实体链接;同义词词典;百科资源;Ranking SVM;语义特征
1 引言
据《第35次中国互联网络发展状况统计报告》[1]显示,截至2014年12月,中国网民规模达6.49亿,其中手机网民规模5.57亿,互联网普及率达到47.9%。由此可见互联网规模之大,已经成为人们生活的重要组成部分。而这种爆炸式的增长带来的问题之一便是用户产生的内容数据急剧增长,其中大多数为文本数据,进而促使了文本大数据分析技术的广泛使用。而这种分析挖掘必然面临对于词义正确理解的强烈需求。由此可见,解决命名实体链接问题非常必要,将存在歧义的实体正确地链接到对应的知识库中具有重要意义。
本文实验数据来自新浪微博,而微博与普通文本相比最显著的区别在于内容长度限制在140字以内,且发布的内容具有如下特点:文本长度短、口语化、表达不清晰等。……
