抑制背景噪声的LDA子话题挖掘算法*
2017-06-21李静远丘志杰刘悦程学旗任彦
华南理工大学学报(自然科学版) 2017年3期
关键词:背景
李静远 丘志杰 刘悦 程学旗 任彦
(1. 中国科学院 计算技术研究所∥中国科学院 网络数据科学与技术重点实验室,北京 100190;2. 国家计算机网络应急技术处理协调中心,北京 100029)
抑制背景噪声的LDA子话题挖掘算法*
李静远1丘志杰1刘悦1程学旗1任彦2
(1. 中国科学院 计算技术研究所∥中国科学院 网络数据科学与技术重点实验室,北京 100190;2. 国家计算机网络应急技术处理协调中心,北京 100029)
专题文章集合是一些拥有相似背景知识的文章集合.为了更好地从专题文章集合内部的复杂信息关联中高效挖掘子话题信息,文中提出了抑制背景噪声的线性判别分析(LDA)子话题挖掘算法BLDA,通过预先抽取专题文档集合的共同背景知识、在迭代过程中重设关键词的产生等方式提高子话题抽取的准确程度.在微信公众账号文章上的系列实验证明,BLDA算法针对有共同背景的专题文章集合的聚类结果显著优于传统的LDA算法,其中主题召回率提高了170%,Purity聚类指标提高了143%,NMI聚类指标提高了160%.
子话题挖掘;线性判别分析;背景噪声抑制
话题的挖掘与分析一直是自然语言处理领域的一个重要研究方向,在舆情分析等领域具有广泛的应用.由在线社交网络的快速发展引发的网络信息爆炸,使得普通用户在快速生成的巨量信息面前显得无所适从,因此当前对在线社交网络上的信息表示普遍出现了分类化与精细化趋势,信息分布更加细致紧凑,如微博中的HashTag等标签机制,以及微……
登录APP查看全文