APP下载

一种高效的文本区间热词查询算法

2018-03-03赵志洲何震瀛王晓阳

计算机工程 2018年2期
关键词:文本

赵志洲,路 畅,何震瀛,王晓阳

(复旦大学 计算机科学技术学院,上海 200433)

0 概述

互联网高速发展使人们获取海量信息变为可能,但随之带来一些新问题,如“如何从海量Web文本信息中提取用户感兴趣的热门话题”。

为有效进行话题检测和跟踪(Topic Detection and Tracking,TDT),研究者开展了大量研究工作[1-2],其中从文本数据中提取热词成为当前研究的热点问题之一[3-5]。文献[6]提出TF-IDF(Term Frequency-Inverse Document Frequency)用于词权重计算,TF-IDF综合考虑词频和反文档频率,弱化频繁出现在多个文档中的词的重要性。文献[7]提出TF-PDF (TF-Proportional Document Frequency)方法,TF-PDF综合考虑词频和文档频率,将更高的权重赋予出现在多个文档中的词。文献[8](下文称Chen算法)在TF-PDF方法的基础上,考虑词频随时间的波动情况,并重新定义词权重的计算方法。上述方法能够有效提取与话题相关的词,即满足算法的有效性。文献[9]基于热度矩阵对微博热点话题进行检测。但是这些算法的一个特点是:面向挖掘任务,时间复杂度较高,因此,难以直接应用于热词在线查询问题。

为此,本文对文本数据的区间热词在线查询问题展开研究。热词的在线查询处理方法需要同时满足2个特性:有效提取与话题相关的词,即在线查询的有效性;快速获得查询时间范围内的热词,即在线查询的时效性。因此,设计同时满足有效性和时效性的热词在线查询方法依然是一个具有挑战性的问题。针对上述方法时效性不足的缺点,本文提出一种文本数据区间热词在线查询处理算法(EHWE),该算法可以在已划分的数据上进行快速区间查询处理。……

登录APP查看全文

猜你喜欢

文本
重点:论述类文本阅读
重点:实用类文本阅读
初中群文阅读的文本选择及组织
作为“文本链”的元电影
在808DA上文本显示的改善
“文化传承与理解”离不开对具体文本的解读与把握
基于doc2vec和TF-IDF的相似文本识别
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
从背景出发还是从文本出发
如何快速走进文本