APP下载

文本处理中的MapReduce技术

2012-06-29李锐,王斌

中文信息学报 2012年4期
关键词:模型

李 锐,王 斌

(1. 中国科学院 计算技术研究所,北京 100190;2. 中国科学院 研究生院,北京 100190)

1 引言

计算机诞生于20世纪40年代,从那时起,文本就起着非常重要的作用。文本是信息的主要载体之一,发展到信息“爆炸”的今天,文本处理越来越多地应用在超大规模的数据集上。传统的一些单机方法难以应付和处理T级别、P级别的海量数据,主要原因如下: 第一,从计算方法上来看,一些算法使用的是迭代的计算方法,以数据为代价来换取正确率和精确度的提升,例如,EM算法和一些用于机器学习采样或近似推断的方法等;第二,从模型方面来看,目前很多应用都基于统计模型,如统计语言模型(Statistical Language Model)、话题模型(Topic Model)等,而这些模型对数据量的要求也越来越大;第三,从真实的数据来看,网络上的文本规模也不断增长,网页数目每时每秒都在更新。即便是对学术界,对大数据量处理要求也越来越高,特别是超大数据集ClueWeb09*http://boston.lti.cs.cmu.edu/Data/clueweb09/等的发布,推动研究者更加认真地思考大规模数据的处理方案[1]。

一些出色的研究机构和业界在分布式的大背景下,提出了很多不同的方案来解决这个问题,都各有其优缺点: 并行数据库是一个发展很成熟的技术,拥有很多成功的商业实现: Teradata、Netezza、DataAllegro(Microsoft)、ParAccel、Greenplum、Aster、Vertica和DB2等[2]。但不足在于数据的读入花费的时间很长,不擅长半结构化数据或非结构化数据的处理, 架设和调优难度较大。PRAM(Parallel Random Access Machine)假设有无限容量的共享存储器,有多个功能相同的处理器,任意时刻可以访问共享存储单元。它的优点在于结构简单,便于分析优化;……

登录APP查看全文

猜你喜欢

模型
一半模型
一种去中心化的域名服务本地化模型
适用于BDS-3 PPP的随机模型
函数模型及应用
p150Glued在帕金森病模型中的表达及分布
函数模型及应用
重尾非线性自回归模型自加权M-估计的渐近分布
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
一个相似模型的应用