新能车属性离散化的分辨矩阵和信息增益算法
2021-05-13周爱国于江洋施金磊王嘉立魏榕慧
测控技术 2021年4期
关键词:信息
周爱国, 于江洋, 施金磊, 王嘉立, 魏榕慧
(同济大学 机械与能源工程学院,上海 201804)
新能源智能车监控数据中部分连续属性的取值精度过高,导致后续挖掘算法会占用过多的空间和时间,且训练出的模型容易出现过拟合的情况。数据离散化的目的是将连续的属性取值转换为离散的区间值[1],以降低属性的取值精度,断点集合则是算法划分离散区间的依据。对于新能源智能车来说,理想的离散化算法应在保证故障分类效果的前提下,获得尽可能小的断点集合。
离散化算法可分为无监督离散化和有监督离散化。其中,无监督离散化不考虑类信息,因此这类算法效率高,但是离散化后数据的分类精度较差;而有监督离散化则使用故障类别信息作为启发条件,例如信息熵、方差等,从而有偏向性地设置断点,可以获得较好的离散化效果[2]。目前,常用的有监督离散化算法可分为:基于统计的离散化算法、基于类和属性相关度的离散化算法以及基于信息熵的离散化算法等[3]。其中,基于统计的离散化算法[4-6]虽然具有较强的数据理论基础,但计算过于复杂,故不宜采用;基于类和属性相关性的离散化[7]则需要保证离散区间不小于类别数,且容易丢失信息;而谢宏等[8]提出的基于粗糙集和信息熵的离散化算法,将信息熵和粗糙集理论结合起来,使用决策表的信息熵来描述断点的重要性,算法在连续属性取值较多时也具有较高的计算效率,适用于数据量较大的场景,是一种经典的数据离散化算法。……
登录APP查看全文
