文本挖掘手册 分析非结构性数据的高级方法
2008-05-08
James Sanger ABS Ventures, Waltham, Massachusetts
The Text Mining Handbook
Advanced Approaches in Analyzing
Unstructured Data
2007, 410pp.
Hardcover EUR
ISBN 978-0-521-83657-9
R.费尔德曼等著
信息时代使得存贮大量的数据变得容易。在万维网、内联网、新闻专线以及其他地方可以利用的文件的增长趋势是压倒一切的。尽管我们可以利用的数据的数量在持续地增加,但是我们吸收和处理这些信息的能力并未能同步增加,而搜索引擎只要通过几个按键就可以获得越来越多的信息,越来越多的文件则进一步加剧了这个矛盾。
文本挖掘是一个新的激动人心的领域,通过利用源自数据挖掘、机器学习、自然语言处理、信息检索以及知识管理等技术来试图解决信息超负荷的问题。文本挖掘涉及了文件收集的预处理(文本分类、信息析取、术语析取)、中间表示的存贮、分析这些中间表示的技术(例如:分布分析、集群、趋势分析、关联规则以及结果的可视化)。
本书介绍了文本挖掘的通用理论,以及在它的背后的主要技术。作者提供了文本挖掘的广义化体系结构,并且概括了被文本挖掘系统经常使用的算法及数据结构。
本书共有12章,各章内容如下:1.文本挖掘初步;2.文本挖掘的操作;3.文本挖掘预处理技术;4.分类;5.群集;6.信息析取;7.信息析取概率模型;8.利用概率和混合方法的预处理应用;9.对浏览及查询细分表示层的考虑;10.可视化方法;11.链接分析;12.文本挖掘的应用。最后是附录A:DIAL-用于文本挖掘的专用信息析取语言。
本书的特点:(1)对文本挖掘领域作了完整的介绍,它包括了所有计划开发文本挖掘系统或者使用这些系统的关键性课题,特别是涉及了预处理技术和信息析取和利用分析;……