基于随机森林算法的企业非法集资风险预测
2021-07-17彭昌
消费电子 2021年5期
彭昌
一、背景介绍
企业非法集资具有严重社会危害性。一是参与者容易遭受经济损失。犯罪分子通过高回报利诱等方式聚揽资金后,任意挥霍、转移或者非法占有,参与者难以收回资金。二是非法集资严重扰乱正常经济金融秩序,容易引发金融风险。三是非法集资容易引起社会不稳定和社会治安问题,甚至引发局部地区的社会动荡。如何基于大量企业信息构建预测模型,并判断企业是否存在非法集资风险,对于监管机构、公司合作伙伴和投资者具有一定价值。
二、研究思路
根据大量企业信息,利用随机森林和LightGBMi两种机器学习算法分别构建企业非法集资风险预测模型,并对其模型性能指标F1-score值进行对比。
三、实验过程
(一)數据预处理
本文实验中用到的企业信息数据集源于某竞赛数据集,包含24865家企业数据,其中14865家企业数据带有是否非法集资标注,可作为训练集;剩余10000家企业数据不带是否非法集资标注,可作为测试集。数据由企业基本信息、企业年报、企业纳税情况、企业变更信息、企业新闻舆情信息和企业其他信息等组成,数据包括数值型、字符型、日期型等众多数据类型,部分字段内容有缺失,其中第一列id为企业唯一标识,label为目标变量。
对获取的数据进行数据预处理,包括数据分析、变量筛选、填充缺失值、特征编码、可解释性特征提取等操作。
1、变量筛选
根据缺失值占比、Ⅳ值(Information Value,即信息价值)和高相关性进行变量筛选,变量缺失值大于0.5被删除,变量Ⅳ值小于0.02被删除(Ⅳ值是用来衡量变量预测能力的,Ⅳ值越大,表示该变量的预测能力越强,一般会舍弃lV值小于0.02的变量),两个变量相关性高于0.7时,Ⅳ值低的变量被删除。……
登录APP查看全文
