基于长短时记忆网络的电商大数据同一性标定*
2021-04-06刘亚波吴秋轩
刘亚波,吴秋轩
(杭州电子科技大学自动化学院,浙江 杭州 310018)
1 引言
在政府采购电子化的趋势下,发挥基于机器学习的大数据分析优势,对电商大数据进行同一性标定,即在政府采购海量电商大数据中找出同一种商品,对提升政府采购决策水平和效率具有重要意义[1]。同一性标定问题实质上是一个短文本相似度计算问题,但在有些实际应用场合,对标定准确率和标定速度均有较高要求。
在短文本相似度计算方面,Ho等[2]基于离散小波变换将文本转换成DNA序列,利用欧几里得距离计算已序列化文本之间的相似度。但是,文本向量化解释性不强,Yao等[3]提出了基于改进长短时记忆网络LSTM(Long Short-Term Memory)的短文本相似度计算方法,并通过其实现的归一算法来避免梯度消失。仅通过余弦距离计算相似度无泛化能力,马慧芳等[4]通过加权计算将不同词项内外共现距离相关度与强类别特征相融合用于计算短文本相似度,但考虑的语义和语境信息有限。Wu等[5]将基于BTM(Biterm Topic Model)主题建模并采用JS(Jensen-Shannon)散度计算文本相似度和基于词表征全局向量GloVe(Global Vectors for word representation)词向量建模并用改进词重WMD(Word Mover’ Distance)衡量文本相似度进行线性融合,作为距离函数实现K-means聚类,该方法在微博短文本上具有良好表现,但建模过程与计算相对复杂。Flisar等[6]基于DBpedia Spotlight框架来识别短文本中的相关概念进而实现短文本分类,但提取大量不相关特征降低了以相似度计算来实现分类任务的性能。Yang等[7]通过组合语料库中单词对的全局权重和在自身短文本中的局部权重来计算短文本相似度,对于全局和局部共现少的短文本,其样本利用率低。……
