基于聚类的多维数据热点发现算法
2019-03-13聂晓辉
小型微型计算机系统 2019年3期
关键词:特征
邹 磊,朱 晶,聂晓辉,苏 亚,裴 丹,孙 宇
1(清华大学 计算机系,北京 100084) 2(北京小桔科技(滴滴出行)有限公司,北京 100193)
1 引 言
随着大数据概念的普及,人们逐渐认识到了海量数据中存在的巨大价值.各种针对大数据的数据挖掘研究和成果也如雨后春笋般涌现,热点发现就是被广泛研究的数据挖掘问题之一[1-3,18,19].热点发现有助于快速地初步了解整体数据的特点,并为后续的分析工作提供方向与决策基础.通过热点发现能够从网民产生的海量文本内容中挖掘出当前网民讨论的热点话题,例如反腐,某明星结婚等,以及这些话题的热度[3].通过热点发现还能够快速发现用户数据的明显特征,例如用户通常在白天使用某项服务,以及大部分用户都使用苹果手机等.本文针对多维数据的热点发现进行研究.
多维数据通常包含多个与目标事件相关的特征,这些特征可以是用户的手机品牌、使用的服务类型、事件发生的时间、用户的地理位置、用户的网络延迟、软件版本、服务器负载、用户年龄等,每次目标事件发生都对应一条多维数据.例如图 1所示,该多维数据包含5个特征,并且展示了7条数据作为示例.特征可以根据其取值特点分成数值型特征和类别型特征.数值型特征的取值是存在一维欧式距离关系的数值,例如图 1中的网络延迟和时间.类别型特征的取值被分成多个类别,例如图 1中的手机品牌,网络类型,所在城市.

图1 多维数据示例
Fig.1 Example of multi-dimensional and multi-class data
如果把多……
登录APP查看全文
