基于代表的交叉验证分类
2021-11-08孙远秋
王 轩,顾 峰,闵 帆,孙远秋
(1.西南石油大学 网络与信息化中心,成都 610500;2.西南石油大学 计算机科学学院,成都 610500;3.西南石油大学 人工智能研究院,成都 610500)
0 引 言
分类是机器学习的重要研究课题之一。近年来,分类技术在众多领域得到广泛应用。Zhang等[1]在2015年提出了基于代表的邻域粗糙集覆盖分类算法(representative-based classification through covering-based neighborhood rough sets, RCCNRS),自算法提出以来,刘福伦[2]结合6种相似度计算方式,研究了相似度对算法的分类影响;结合代价敏感[3]和主动学习[4]的研究,使算法分类性能得到提升,更贴近实际应用。本文的前期工作对算法的5种标签预测策略进行了对比。
在分类问题上,RCCNRS算法能取得较高的分类精度。然而,在监督式学习中,训练样本的不同,或直接影响分类结果,或通过构建过拟合/欠拟合的分类模型间接影响分类结果。比如,对于RCCNRS算法而言,训练集分割时导致的数据类别不平衡可能会导致数据集的观测几率发生变化,进而影响对未分类样本的分类,影响算法最终的分类精度。
单个分类通常存在分类偏好,对此,集成学习[5-6]的概念被提出。集成学习通过结合多个分类器,组成多分类器系统来完成学习任务,通过均衡各分类器的分类偏好,往往能取得较满意的性能。集成学习有同质集成和异质集成2种策略。同质集成策略,指参与集成的“基分类器”是同种类型但拥有不同参数的个体分类器;异质集成策略,指参与集成的“组件分类器”由不同的算法生成。
针对上述情况,结合集成学习,本文提出基于k-fold交叉验证[7]的3种策略。……
