基于在线评论的服装质量特征挖掘方法
2021-11-03周俊妍薛文良魏孟媛刘蕴莹钱竞芳
东华大学学报(自然科学版) 2021年5期
周俊妍, 薛文良, 魏孟媛, 刘蕴莹, 钱竞芳, 丁 亦
(1. 东华大学 纺织面料技术教育部重点实验室,上海 201620; 2. 中华人民共和国 上海海关,上海 200120)
随着互联网及自媒体的兴起,消费者可以在不同网络平台对商品进行评价,这些最贴合市场的用户自生成内容对商品质量监管而言,是相对实时、有价值、可信的。基于电商评论内容,从专业角度挖掘服装质量特征,帮助消费者及服装企业和检验机构等使用者更好地了解服装质量的动态。商品评论中的产品特征挖掘方法主要是基于统计、规则和机器学习等方法。
基于统计的方法包括基于词性、词频[1-3]、关联规则及点互信息等。Hu等[4]提出产品特征集合中的频繁项利用关联规则提取,非频繁项基于与频繁项共现度高的形容词集合抽取,这种方法易引入高频非特征集合。Popescu等[5]通过计算候选特征和特征基准词间的PMI(pointwise mutual information)值对其进行优化,使准确率提升20%。王永等[6]利用frequent pattern-growth(FP-growth)算法,进一步降低关联规则的复杂度。这类方法原理简单且应用较为广泛,但受分词效果局限,召回率普遍偏低,易忽视低频非名词特征词。
基于规则的方法一般包括两类:一是自定义语言规则,二是利用句法分析工具构建句法规则集合[7]。李盛[8]提出词组规则、特征词和评价词的双向循环过滤规则,并建立特征词库。Kobayashi等[9]和Zhuang等[10]建立特征词与观点词的共现规则,从而抽取特征词。刘涛[11]利用依存句法分析工具,抽取5种主要依存关系构建句法规则,再经剪枝策略抽取产品特征。……
登录APP查看全文