面向组合投资预测的大数据生成算法
2021-02-25赵会群
赵会群,曲 艺
(北方工业大学 信息学院,北京 100144)
0 引 言
为了解决组合投资预测问题,我们不仅需要各个投资项信息数据,还需要宏观经济因素、微观经济因素、行业因素等大量数据。然而真实、大量、多样的金融数据由于保密性、时间等一些问题的限制不易获取,因此需要一种可以基于真实数据集建模并保持真实数据集特征的大数据生成方法。
真实的金融数据一般以时间序列的形式表现。现关于时间序列数据模拟和生成的方法主要有:回归移动平均模型(autogressive integrated moving average,ARIMA)[1]、自回归条件异方差模型(autoregressive conditional hete-roscedasticity model,ARCH)[2]、支持向量回归模型(support vector regression,SVR)[3]、长短期记忆网络模型(long short term memory,LSTM)[4]等。由于本文所需模拟生成的数据表现出较明显的季度或月度的周期性变化,所以将采用季节性差分自回归移动模型(seasonal autogressive integrated moving average,SARIMA)来对各项时间序列数据进行自动模拟生成,为原有历史数据集补充部分未来数据,用于后续组合投资数据生成模型的更新。
为了解决组合投资预测的数据生成问题,需要先将其转化为影响因素和投资项的组合优化问题,通过模型分析各数据项之间的关系,最终生成大规模数据集。近年来,已有学者使用遗传算法[5]、粒子群算法[6]、蚁群算法[7]等解决组合优化问题的经典算法,来实现测试数据的自动生成。此外,由于贝叶斯网络模型[8]可清晰揭示节点变量间的关系及概率分布,该模型同样已应用于数据生成领域。但随着时间的变化和金融数据的增加,将更新的信息应用到投资组合预测之中是十分必要的。……
