基于支持向量机的虚假点击识别方法研究
2018-08-22于媛媛郑金丽孔志有
科学与财富 2018年21期
关键词:机器学习
于媛媛 郑金丽 孔志有
摘要:目前,广告收入是科技巨头公司的重要收入来源,如国外的Google、Facebook等,国内的百度、阿里巴巴、腾讯等。在这些网站上投放的广告,大部分的点击都是虚假点击,即点击后未下载广告中的软件,这不仅会浪费公司大量的广告费,还会误导公司的经营策略。因此,如何鉴别虚假点击成为了一个重要的社会问题。本文使用了我国移动端约两亿条真实点击数据,将其分为训练集和测试集,选用机器学习算法中的支持向量机(SVM)算法来进行分类器的构建,并使用AUC评价指标对识别结果进行分析。
关键词:虚假点击,支持向量机,机器学习
一、数据集的特征设计
特征设计是机器学习的一个重要环节,原始数据不能直接应用到机器学习模型中,需要通过一些方法将这些原始数据根据其类型进行处理之后才能作为机器学习模型的输入。以移动端点击数据为例,其一般包括点击时的IP地址、点击的时刻、广告发布商的频道号等内容。这些数据因为数据格式不同,代表的含义也不同,所以不能直接作为训练集数据进行使用。一般可将原始数据分为数值型特征数据,如点击时刻,和类别型特征数据,如IP地址,广告发布商的频道号等。对于数值型特征可使用等距离散化方法进行处理,以点击时刻为例,因为时刻的范围在0点到24点之间,所以可将时刻分为24个区间,构造一个24维的二值特征向量。如果某条数据的点击时刻是19点20分,则可将其24维向量中的第19维向量置为1,用来表示其点击时刻在19点到20点的区间内。……
登录APP查看全文
