大数据视角下的非结构化文本挖掘分析方法
2021-07-27黎伟健胡斌李威唐健玲肖西西
新媒体研究 2021年8期
黎伟健 胡斌 李威 唐健玲 肖西西
关键词 非结构化文本;情感分析;分类分析
中图分类号 G2 文献标识码 A 文章编号 2096-0360(2021)08-0008-03
1 研究背景
根据IDC报告,当下数据以每年50%左右的速度快速增长,非结构化文本数据占比很高。因此,非结构化文本数据的挖掘分析显得尤为迫切和重要。
文本挖掘(Text Mining)又称为文本数据挖掘(Text Data Mining)或文本知识发现(Knowledge Discovery in Texts,KDT),是指从大量非结构化文本数据中抽取未知的、可理解的、最终可用的知识,并运用这些知识更好地组织信息,进而获取用户感兴趣或有用模式的过程[1-2]。文本挖掘流程大致可以描述为基于网页、文档、字符等非结构化文本数据,利用自然语言处理技术实现非结构化文本数据结构化,再结合机器学习、统计分析、可视化分析等技术进行挖掘分析,进而实现搜索引擎、舆情分析、新闻分类等。
目前,文本挖掘作为信息时代的重要研究领域,逐渐成为国内外学者的重点研究方向。本文将基于大数据视角,通过对文本挖掘分析方法进行梳理,总结海量文本分析流程,以期能有助于对海量文本开展情感分析和问题分类。
2 文本挖掘方法
采用“朴素贝叶斯算法”(Naive Bayes Classifier)和机器学习[3],对客户反馈的意见进行情感正负向判断,将客户反馈标记为1(正向)、0(中性)、-1(负向)3类。通过人工标注分类规则、机器运行相结合的方法对客户意见进行分类,发现用户反馈意见的主要内容,分析完成后会通过不断的人工校验优化分类规则,提高分析准确性。
2.1 客户情感倾向分析……p>
登录APP查看全文
