基于K-均值聚类的卷烟市场研究
2010-08-06四川大学霍叶青何跃
中国商论 2010年4期
关键词:用户
四川大学 霍叶青 何跃
在激烈的市场竞争中,只有掌握卷烟消费群体的特征,才能立于不败之地。信息是决策的基础,通过市场调查,可以获得大量的信息。通过对调查得到的卷烟市场中的消费群体的数据进行聚类分析,可归纳出有利于提高卷烟的生产和销售的信息。
聚类分析是数据挖掘领域中的核心技术之一,聚类分析处理的数据对象的类是未知的,把数据按照相似性归纳成若干类别。它是从给定的数据集中搜索数据对象之间所存在的有价值的数据分布模式,实现在同一聚类之间的样本差异最小化,而在不同聚类样本之间的差异最大化的一种挖掘技术[1]。
文章使用K-均值聚类方法进行分析,对四川省2007年卷烟市场数据进行研究,找出其中的群体规则。
1 K-均值聚类方法介绍
聚类分析是根据一定的分类规则,划分记录集合,确定每个记录所在类别。使得同一类别中,个体之间差距较小,不同类别中,个体之间的差距较大的一种挖掘技术。聚类技术能把不同格式的数据快速分簇,其中主要有K-均值聚类方法。
K-均值聚类方法是一种在无类标号数据中发现簇和簇中心的方法,通过迭代把对象划分到不同的簇中,以求目标函数最小化,使生成的簇尽可能地紧凑和独立[2]。
设需分析的样本为Xi,i = 1,2 …,N。给定一组初始中心Ck,k=l,2 …,K。初始中心可以是从训练数据中随机选择的个体。K-均值算法交替执行的步骤:
(1)对每个样本Xi,找出离它最近的中心点( 簇):……p>
登录APP查看全文
