基于局部加权k近邻的多机器人系统异步互增强学习
2012-08-15杨月全韩飞金露倪春波曹志强张天平
东南大学学报(自然科学版) 2012年1期
杨月全 韩飞 金露 倪春波 曹志强 张天平
(1扬州大学信息工程学院,扬州 225009)(2中国科学院自动化研究所复杂系统管理与控制国家重点实验室,北京 100190)
多机器人系统已成为当前国内外机器人领域研究的热点.由于机器人所面临的环境往往是未知的、动态的,因而通过人为的规划来解决多机器人系统中所遇到的一切问题是不现实的.在这种情况下,学习能力为机器人克服这些困难提供了行之有效的方法.机器人的学习可主要通过以下方式进行[1]:借助于自身的各种传感器,机器人可以在与环境的不断交互中获取知识;借助一些领域知识、先验知识来缩短学习时间;通过与其他机器人共享知识促进彼此的技能;模拟进化的有关思想来对自身的参数进行优化.
增强学习是一种以环境反馈作为输入的机器学习方法[2].文献[3]提出了一种新的多智能体Q学习算法,通过对联合动作的统计来学习其他智能体的行为策略,并利用智能体策略向量的全概率分布保证了对联合最优动作的选择.文献[4-6]引入能体现人的经验的模糊推理规则来改进机器人学习.文献[7]提出了连续状态空间中 kNN-TD算法,从状态分类的角度来加快学习速度.文献[8]提出了一种未知环境下基于有先验知识的滚动Q学习算法.文献[9-10]基于TD算法,提出了快速强化学习方法和自然梯度强化学习算法.在此基础上,基于局部加权 kNN-TD 算法[7,11-14],本文提出了多机器人系统的无时滞异步的……
登录APP查看全文