APP下载

基于深度强化学习的投资组合管理研究

2021-03-07王康白迪

现代计算机 2021年1期
关键词:深度动作策略

王康,白迪

(四川大学计算机学院,成都610065)

0 引言

美国经济学家马科维茨(Markowitz)1952年首次提出投资组合理论,并进行了系统、深入和卓有成效的研究。投资组合管理是不断将资金重新分配到许多不同的金融资产中的决策过程,旨在抑制风险的同时最大化收益[1]。在发达的证券市场中,马科维茨投资组合理论早已在实践中被证明是行之有效的,并且被广泛应用于组合选择和资产配置。但是,我国的证券理论界对于该理论是否适合于我国股票市场一直存有较大争议。

如何使投资组合在一定的风险范围内获得最大的收益,是一个非常值得关注的问题。同时,由于影响证券活动的复杂因素很多,如收益的风险和不确定性,因此很难建立合适的投资组合管理模型。深度强化学习最近因其在电子游戏[2]和棋盘游戏[3]方面的卓越成就而备受关注。但是这些是离散动作的强化学习问题,不能直接应用于连续动作的投资组合管理问题。虽然投资组合管理的动作可以离散化,但是离散化被认为是一个主要缺点,因为离散动作并不能使得强化学习代理进行充分探索,从而增加了风险。例如,一种极端的离散动作可以定义为将所有资本投资到一种资产中,而没有将风险分散到其他资产上。所以为了尽可能地分散风险,强化学习算法的动作必须是连续的。我们利用了深度强化学习的策略梯度算法(PG)[4]和最近提出的一种双延迟深度确定性策略梯度算法(TD3)[5]来实现连续动作的投资组合管理,TD3算法的性能在Silver提出的深度确定性策略梯度算法(DDPG)[6]上有进一步提升。……

登录APP查看全文

猜你喜欢

深度动作策略
例谈未知角三角函数值的求解策略
我说你做讲策略
深度观察
深度观察
深度观察
动作描写要具体
高中数学复习的具体策略
动作描写不可少
非同一般的吃饭动作
Passage Four