APP下载

基于隐变量后验生成对抗网络的不平衡学习

2021-06-01何新林戚宗锋李建勋

上海交通大学学报 2021年5期
关键词:分类模型

何新林, 戚宗锋, 李建勋

(1. 上海交通大学 电子信息与电气工程学院, 上海 200240;2. 电子信息系统复杂电磁环境效应国家重点实验室, 河南 洛阳 471003)

数据分布不平衡是影响数据挖掘或者机器学习分类算法性能的一个关键因素.传统的分类算法假设数据分布是均衡的,以提升全局准确率为优化目标.但现实世界中的许多应用如医疗诊断[1]、金融欺诈检测[2]、人脸识别[3]及机械故障检测[4]等均存在数据分布不均衡的情况,某些类别的数目远远超过其他类别,二分类问题中通常分别称为多数类和少数类.在这些问题中,少数类是人们关注的重点,传统分类算法致力于提升全局准确率,导致分类结果偏向多数类而忽视了人们关注的重点.

目前主要从数据层面[5-9]和算法层面[10-11]或者两者结合[12-13]来解决不平衡分类问题.数据层面的解决办法通过对少数类过采样或者多数类欠采样使数据达到均衡,算法层面的解决办法通过设定算法参数如数据加权、代价敏感来强调少数类,两个方法的结合通过采样来平衡数据集,同时改进算法来强调少数类.

尽管现有的解决办法达到了良好的表现[10],鉴于最近几年深度网络生成模型在表示学习上显现出的巨大优势[14-15],本文关注利用深度神经网络对少数类进行过采样,因为过采样不会丢失数据中重要的信息,而且可以作为预处理步骤来进行可视化或者与算法层面方法相结合.传统的采样方法都是基于线……

登录APP查看全文

猜你喜欢

分类模型
一半模型
分类算一算
垃圾分类的困惑你有吗
重尾非线性自回归模型自加权M-估计的渐近分布
教你一招:数的分类
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
给塑料分分类吧
一个相似模型的应用