基于M-distance算法思想的优化加权KNN算法
2021-11-29程勖,高雍政,郭芳
大连理工大学学报 2021年6期
程 勖, 高 雍 政, 郭 芳
( 大连工业大学 管理学院, 辽宁 大连 116032 )
0 引 言
数据特征选择已成为推荐系统重点研究领域,目的是快速实现最优分类,且要精准识别特征信息.数据特征选择主要通过两种途径实现:其一,通过用户商品数据库进行过滤,采用矩阵分解[1]、Slope One[2];其二,学习用户偏好的描述性模型,采用评分机制,如贝叶斯网络[3]、神经网络分类[4]等.常见的分类方法有决策树、KNN算法、SVM算法、贝叶斯网络、神经网络等.传统KNN算法因其简单高效最为常用.它是一种惰性分类算法,特点在于样本数据不需要训练,使用便捷,但是时间复杂度较高,且将单一变量(距离)作为相似度衡量标准,导致推荐精度低且体验度不够完善,如Jaccard相似性[5]、Manhattan距离[6]等.针对KNN算法的不足,主要解决方案集中在裁剪[7-9]与降维[10-12]两个方面.裁剪方法虽然可快速去除噪声数据,但以损失分类精度为代价;降维方法虽然提高了运算速度,但以牺牲特征数据为代价.如何在保证分类精度的前提下,降低时间复杂度,提升运算速度备受关注.
本文通过M-distance算法思想进行簇聚类,对样本数据进行预处理.相对于k-means方法,它的时间复杂度比较小,聚类效果比较显著[13].然后对数据进行加权处理,以便缩小数据间的距离,并兼顾数据之间的相关性,更加准确地对数据进行分类.最后,通过简谐振动原理,计算数据相似度距离,优化遍历数据过程,提高搜索速度.
1 加权K近邻算法的特征选择方法
1.1 K近邻算法简介
在模式识别中……
登录APP查看全文
