APP下载

大规模数据集谱聚类并行优化算法

2021-10-20郝笑弘尹青山

机械设计与制造 2021年10期
关键词:实验

郝笑弘,尹青山

(1.山西水利职业技术学院,山西 太原030032;2.吉林大学软件学院,吉林 长春130012)

1 引言

计算机技术的快速发展和网络带宽的不断扩展,海量多样化数据成为当前数据处理的常态,面对海量数据,如何挖掘出最有价值信息成为研究的热点,聚类作为数据挖掘的重要手段和研究方向,通过广泛的探索性分析和数据内在联系识别,达到相似特征数据的归类,从而提示数据的隐藏价值[1]。谱聚类以非线性核距离作为聚类相似判断依据,适用于非凸等任意形状的数据,且能够取得全局最优解[2]。但传统谱聚类计算代价与存储开销阻碍了其在大规模数据集中的应用,且数据规模越大,这种性能瓶颈越明显。

为此,文献[3]兼顾视角内划分质量与视角间协同,通过多代表点策略和多视角代表性保持对多样化大规模数据集进行一致性约束,并通过加权系数最大化与拉格朗日乘子实现数据的谱聚类,相比于传统谱聚类,改进算法在聚类时间和存储优化上具有一定的优势;文献[4]选用非负矩阵分解对多视角数据进行处理,以获得各视角的潜在特征矩阵,然后引入正交约束以优化局部特征,通过数据加权调整缺失数据的聚类贡献影响,最后通过分块处理以缓解大规模数据的内存需求;文献[5]以Nyström近似采样降低大规模数据的相似度计算复杂度,有利于聚类效率的提高,通过对采样过程的自适应优化要,进一步提高谱聚类在大规模数据集上的聚类效果;……

登录APP查看全文

猜你喜欢

实验
记住“三个字”,写好小实验
记一次有趣的实验
有趣的实验
做个怪怪长实验
NO与NO2相互转化实验的改进
实践十号上的19项实验
《实验流体力学》征稿简则
我实验,我快乐