正则稀疏化的多因子量化选股策略
2021-01-11舒时克
舒时克,李 路
上海工程技术大学 数理与统计学院,上海201620
随着信息技术的发展,数据的规模越来越大,数据往往会出现维度较高而样本量较小的情况。因此,从众多的特征中选取出有效的特征就成为了一个难点。针对这种高维数据,目前的处理的方式大体分成两类:一类是从训练数据出发,通过特征工程等手段筛选特征,再通过模型进行预测;另一类是从模型本身出发,在模型中加入具有稀疏性质的惩罚项能够有效的筛选特征。经典的惩罚函数有L1 惩罚项、L2 惩罚项和Elastic Net惩罚项等。Jagnnathan[1]发现在线性回归中加入L1惩罚项的Lasso模型,从而建立更好的投资组合模型。但L1惩罚项存在过度稀疏的问题。针对L1 惩罚函数的不足,Zou[2]在线性回归中同时加入L1 和L2 惩罚项,构建了弹性网模型(Elastic Net),并将其运用到高维数据上,该模型不仅能够克服了高维数据多重共线的问题,也克服了Lasso模型将特征压缩的过度稀疏的问题。文献[3]在对比了最小二乘(OLS)、Lasso 和Elastic Net 之后,应用于量化投资市场,发现Elastic Net 模型能够比OLS 模型和Lasso 模型更有效的筛选因子,同时也能克服Lasso 模型将系数矩阵过度压缩的缺点,并能构建出更加有效的投资组合。
文献[4]指出Lasso 和Elastic Net 的解虽然满足Oracle的稀疏性和连续性的假设,但是不满足无偏性的性质,因此Fan 等人提出了SCAD 的惩罚函数,该惩罚项不仅满足Oracle 的三个性质,并且也能对系数进行压缩。文献[5]提出了MCP 惩罚函数,该惩罚项也满足Oracle的三个性质,而且能够很好的处理特征之间存在很高的相关性的数据。……
