基于潜在特征的汽车评论要素挖掘
2017-03-21王钰刘复星赵帅刘贺
王钰+刘复星+赵帅+刘贺



摘要:互联网的迅速发展带来了网络中评论数据的大量增长,分析这些非结构化的文本数据的潜在价值对于整车企业在生产、营销、售后等环节具有重要的指导意义。汽车垂直网站内的评论数据海量且复杂,本文提出一种基于潜在特征的评论要素挖掘模型,对文本数据进行细粒度的挖掘,识别出文本的评论要素,即评价对象与评价词。在汽车之家评论语料进行的实验表明,本模型的预测准确率达到81%,具有良好的分类效果。
关键词:文本挖掘;评论要素;序列标注;潜在特征
中图分类号:TP391 文献标识码:A 文章编号:1009-3044(2016)33-0247-04
Abstract: The rapid development of the Internet has brought a lot of data growth in the network. The potential value of unstructured text data is of great significance to the production, marketing and after-sales. This paper presents a mining model of automobile reviews based on latent feature, which makes text data mining fine, and discerns the commenting essentials of text, namely review object and review word. The results of the experiments show that the prediction accuracy of this model is 81%, with good classification results.
Keywords: text mining, commenting essentials, sequence annotation, latent feature
1引言
隨着互联网和信息行业的发展,数据已经渗透到当今每个行业和业务职能领域,成为重要的生产因素,与此同时,汽车行业作为已有百年历史的传统产业,也在“互联网+”的时代趋势下进行着新一轮的产业革新。本文将对网络采集的汽车评论数据,利用文本挖掘技术进行分析。
当前,各汽车垂直网站中的评论数据多为文本数据,数据量大,结构复杂,并且包涵了众多无效信息。事实上,对于汽车评价数据的不同维度,人们更多关注其中真正有价值的部分,即一段评论的评论要素。现有的汽车评论要素识别方法考虑的特征有限,本文通过将评论要素挖掘建模为序列标注问题,综合考虑多个特征,提出基于潜在特征的挖掘模型识别评论要素。
2相关工作
2.1 评论要素概述
评论要素包括评价对象与评价词,评价对象是每一评论文本中的主题,评价词为评价对象所对应的描述。……
