强化学习模型及其在避障中的应用
2016-04-22吴成东沈阳建筑大学信息学院沈阳建筑大学沈阳006
山东工业技术 2016年1期
孙 魁,吴成东(.沈阳建筑大学信息学院; .沈阳建筑大学,沈阳 006)
强化学习模型及其在避障中的应用
孙魁1,吴成东2
(1.沈阳建筑大学信息学院;2.沈阳建筑大学,沈阳110016)
摘 要:强化学习是机器学习的一个重要分支,其优点是不需要先验知识,通过与环境的交互进行试错学习。与有导师学习不同,强化学习没有得到确定的目标值而是一个奖赏值。本文介绍了强化学习的模型和一些常用算法,并将强化学习的方法应用在避障问题上。
关键词:强化学习;马尔科夫决策;避障
1 概述
强化学习(Reinforcement Learning,RL)是近几年来人工智能和机器学习研究的热点。不同于监督学习,强化学习强调与环境的交互并在其中进行学习,用极大化的从环境获得的评价性反馈信号为学习目标,所以强化学习在求解那种无法获得教师信号的复杂优化决策问题中具有广泛的应用[1][2]。
强化学习是机器学习的一个重要分支。强化学习通过对环境的反复试探,从中学习环境到可执行动作的最优反应式策略,以期获得最大回报。相比于其它学习策略,强化学习的明显优势在于它对先验知识的是否完备几乎没有要求,即使在信息完全未知的情况下,强化学习仍然具有较好的自适应性和鲁棒性[3]。
传统的强化学习方法主要针对的是离散状态和行为空间的马尔科夫决策过程,也就是状态的值函数或行为的值函数采用了表格的形式来进行存储和迭代计算。但是实际工程应用中的许多优化决策问题是具有大规模或连续的状态或行为空间的情况,所以表格型强化学习算法也同动态规划法一样存在维数灾难。……
登录APP查看全文
