图书馆服务质量评价中微博数据的应用研究
2014-09-01文炯
文炯
摘 要 论文探讨利用R语言工具对图书馆新浪微博数据进行子主题聚类和挖掘,指出:在文本分词、构建词频——文档矩阵的基础上,使用Pamk算法和Kmeans算法进行微博聚类,获取图书馆服务质量评价与建议信息,挖掘图书馆核心微博用户,便于图书馆利用微博数据评估服务效果,改进服务质量。
关键词 微博 图书馆服务质量评价 文本聚类 核心用户
分类号 G250.7
Research on the Application of the Microblog Data in the Library's Service Quality Evaluation
Wen Jiong
Abstract This paper investigates the sub topic mining and clustering of the librarys Sina microblog data by using R language tool. It points out that based on the text segmentation and term—document matrix, clustering librarys Sina microblog data by using Pamk algorithm and Kmeans algorithm to gain librarys service quality evaluations and advices and to unearth Sina microblogs core?users of the library, can be easy for us to evaluate the librarys service effect and improve its service quality.
Keywords Microblog. Librarys service quality evaluation. Text clustering. Core users.
微博(Microblogging)是目前图书馆服务广为采用的SNS形式之一,集信息传播、获取、分享和互动为一体,用户可随时随地通过手机、即时通讯、Web等方式更新博文、组建个人社区,关注目标对象,获取外界信息[1]。用户越来越多地开始选择微博作为评价图书馆服务、提出服务意见的工具和平台。
以“微博”及“图书馆”为关键词,通过逻辑“与”运算符连接,在《中国期刊全文数据库》中进行统计发现,虽然目前国内图书馆学界对“微博”主题挖掘研究的文献不少,但多以语义分析,抽取的主题较为宽泛,而以特定主题为导向,进行“微博”主题下的子话题挖掘和聚类的研究甚少。本文将在上述研究的基础上,以“图书馆”为主题,探讨利用R语言工具对图书馆新浪微博数据进行子主题聚类和挖掘,获取图书馆服务质量评价与建议信息,挖掘图书馆核心微博用户,便于图书馆利用微博数据评估服务效果,改进服务质量。
1 设计思路和方案
R是一种免费、开源的面向对象的可编程语言,通俗易懂,拓展性强,拥有大量强大的数据统计分析功能包和科学数据可视化工具。……
