面向不完全标记数据流的集成分类算法
2016-09-28王中心
阜阳师范大学学报(自然科学版) 2016年3期
王中心,孙 刚,2,王 浩
(1.阜阳师范学院 计算机与信息工程学院,安徽 阜阳 236037;2.合肥工业大学 计算机与信息学院,安徽 合肥 230009)
面向不完全标记数据流的集成分类算法
王中心1,孙刚1,2,王浩1
(1.阜阳师范学院 计算机与信息工程学院,安徽 阜阳 236037;2.合肥工业大学 计算机与信息学院,安徽 合肥 230009)
实际数据流中许多数据是无标签的,且其中隐含着不同类型的概念漂移。为此,本文提出了一种面向不完全标记数据流的集成分类算法,该算法利用K均值聚类算法标记无标签实例,利用Hoeffding Bounds不等式确定的双阈值检测概念漂移,同时动态地更新分类模型以适应数据流环境的变化。实验结果表明,本文提出的算法能够在类传播过程中具有较高标记正确率,又能从噪音中识别出不同类型的概念漂移。
数据流;分类;集成模型;不完全标记;概念漂移
数据流分类在电子商务、传感器网络、网络入侵检测等实际应用领域有着广泛的应用,但是,实际应用中存在许多数据是没有类标签的。例如,Web网页中存在许多无标签的网页,网络入侵检测的数据包中存在许多无标签的数据包,电子商务网站存在许多无标签的商品评论数据。无标签数据加剧了数据流分类的难度,传统的数据挖掘分类算法和已有的数据流分类算法[1-5]对于包含许多无标签数据的数据流分类面临着严峻的挑战。已有的数据流分类算法总是假设数据流中的数据具有完整的类标签,这个假设明显和实际应用领域的情况不符;……
登录APP查看全文
