APP下载

基于Hadoop框架的TF-IDF算法改进

2012-11-24李彬

网络安全与数据管理 2012年7期
关键词:单词

李彬

(暨南大学 信息科学技术学院计算机科学系,广东 广州 510632)

TF-IDF(Term Frequency-Inverse Document Frequency)是一种用于资讯检索与文本挖掘的常用加权技术[1],用来评估单词对于一个文件集或一个语料库中的其中一份文件的重要程度。单词的重要性随着其在文件中出现的次数成正比增加,但同时会随着其在语料库中出现的频率成反比下降。TF-IDF算法的各种形式常被搜索引擎、Web数据挖掘、文本分类及相似度计算等各种应用中,而这些应用往往是以处理海量数据的输入为背景。因此,如何在海量数据中快速有效地计算出TF-IDF具有重要意义。

1 TF-IDF算法原理

在一份给定的文件里,词频 TF(Term Frequency)指的是某一个给定的词语在该文件中出现的次数。对于在某一特定文件里的词语ti来说,它的重要性可表示为:

式中,ni,j是该词在文件 dj中的出现次数,而分母则是在文件dj中所有字词的出现次数之和。

逆向文件频率 IDF(Inverse Document Frequency)是一个词语普遍重要性的度量。某一特定词语的IDF,由总文件数目除以包含该词语的文件的数目,再将得到的商取对数得到:

式中,|D|表示语料库 中的文件总数,|{j:ti∈dj}|表 示包 含词语ti的文件数目。

在式(1)、式(2)的基础上,可得单词的权重计算公式[2]:

某一特定文件内的高词语频率以及该词语在整个文件集合中的低文件频率,可以产生出高权重的TFIDF。因此,TF-IDF倾向于过滤掉常见的词语,保留重要的词语。

2 Hadoop简介

Hadoop是一个开源的可运行于大规模集群上的分布式并行编程框架,它主要由分布式文件系统HDFS和MapReduce计算模型构成。HDFS实现了文件的分布式存储,它是MapReduce计算的数据载体[3-4]。……

登录APP查看全文

猜你喜欢

单词
Exercise 1
Exercise 2
Exercise 4
Exercise 6
Exercise 1
Exercise 3
Exercise 5
看图填单词
看完这些单词的翻译,整个人都不好了
单词拾趣