APP下载

基于Python影评数据挖掘与分析
——以《你好,李焕英》为例

2021-10-25邵小青贾钰峰章蓬伟

信息记录材料 2021年10期
关键词:可视化文本情感

邵小青,贾钰峰,章蓬伟,丁 娟

(新疆科技学院信息科学与工程学院 新疆 库尔勒 841000)

1 引言

近年来,自然语言处理技术得到了以计算机科学为代表的自然科学领域到社会科学领域的广泛关注,并且在新闻传播、舆论管理、观点分析等问题中展示了不容忽视的价值[1]。随着互联网的发展和大数据时代的到来,网络上的数据分析仅仅靠人工筛选挖掘出有价值的信息是实现不了的,如何快速高效地从不规则、海量的文本中挖掘出有意义的信息并分析情感倾向性是自然语言处理(natural language processing,NLP)领域研究的热点。NLP是人工智能领域的一个分支,主要是运用自然语言处理和理解人类的语言,应用包括机器翻译、信息提取、文本分类、语音转换等。本文通过Python语言编写爬虫程序自动获取数据,筛选有价值的信息,对数据进行挖掘来解决业务问题。对豆瓣影评数据进行清洗与筛选,采用Python的类库SnowNLP进行影评数据的情感分析,将有价值的数据通过可视化技术展示出来,可以帮助用户更高效便捷地获取到有价值的信息,同时为媒体、电影市场、社交网站提供口碑及相关服务的帮助。

2 数据采集

登录豆瓣电影《你好,李焕英》页面,Python爬取解析网页源码,由于豆瓣电影短评总数只能显示500条评论,爬取到数据500条。首先确定数据所在的url,《你好,李焕英》豆瓣影评的URL是https://movie.douban.com/subject/34841067/comments?start=20&limit=20,34841067为电影ID,start=20影评开始的页面,limit=20是每页评论数。使用requests库发送网络请求,url='https://movie.douban.com/subject/34841067/comments?status=P',headers={"User-Agent":Mozilla/5.0 (Windows NT 10.0;Win64;x64) AppleWebKit/537.36 (KHTML,like Gecko) Chrome/90.0.4430.72 Safari/537.36 Edg/90.0.818.42},查看文本内容:response=requests.get(url=url,headers=headers)。使用xpath解析影评数据,html_data=response.text,selector=parsel.Selector(html_data),comments_list=selector.xpath("//span[@class='short']/text()").getall()。每条数据内容有10个维度,数据保存结果见图1。……

登录APP查看全文

猜你喜欢

可视化文本情感
基于CiteSpace的足三里穴研究可视化分析
基于Power BI的油田注水运行动态分析与可视化展示
如何在情感中自我成长,保持独立
基于CGAL和OpenGL的海底地形三维可视化
失落的情感
情感
在808DA上文本显示的改善
“融评”:党媒评论的可视化创新
基于doc2vec和TF-IDF的相似文本识别
如何在情感中自我成长,保持独立