APP下载

Fast-PPO:最优基线法的近端策略优化算法

2020-07-13陈佳黎刘保生杨郭镳

小型微型计算机系统 2020年7期
关键词:策略方法

肖 竹,谢 宁,陈佳黎,刘保生,姜 峰,杨郭镳

(电子科技大学 未来媒体中心 计算机科学与工程学院,成都 611731)

1 引 言

最近,针对强化学习(RL)提出了几种不同的神经网络函数逼近算法[1,2].主要的常用算法有深度Q学习[3,4],Vanilla策略梯度(PG)[5],信任区域策略梯度(TRPO)[6]和近端策略优化算法[7].Q学习算法[8,9]可以很好地应用在动作离散的学习环境中,但不能在动作连续控制的基础上表现良好.Vanilla策略梯度方法在数据效率和鲁棒性方面都较差.信任区域策略梯度算法[6]相对复杂,与包含噪声或参数共享的架构不兼容.近端策略优化算法使用惩罚来改进过大的优化,在信任区域策略梯度算法方法的基础上获得更好的采样复杂性[10].

由于近端策略优化算法是一种新的强化学习的策略梯度(PG)方法[11],因此可以采用提高策略梯度方法效率的手段来改进近端策略优化算法,包括基于参数的探索和最佳基线[12],我们选择使用最佳基线来提高效率.我们的想法启发于最先进的策略梯度方法、策略梯度和基于参数的勘探(PGPE)以及最佳基线减分(将方差正则化技术与基于参数的勘探和最佳基线相结合)[12].在实践中,在策略梯度方法中使用了最佳基线,从经验上帮助发现策略更新的正确方向.

NPC(Non-Player Character)行为的传统做法是通过脚本或行为树来操纵的.冗长的规则表通过分析NPC周围环境的信息来确定其下一个行为.然而,随着游戏的更新、设计和维护,调整这些规则表是非常耗时的.就最近强化学习……

登录APP查看全文

猜你喜欢

策略方法
基于“选—练—评”一体化的二轮复习策略
例谈未知角三角函数值的求解策略
我说你做讲策略
学习方法
高中数学复习的具体策略
用对方法才能瘦
四大方法 教你不再“坐以待病”!
赚钱方法
捕鱼
Passage Four