APP下载

基于多Agent Q学习的RoboCup局部配合策略

2014-08-03赵发君李龙澍

计算机工程与应用 2014年23期
关键词:动作区域策略

赵发君,李龙澍

安徽大学 计算机科学与技术学院,合肥 230601

基于多Agent Q学习的RoboCup局部配合策略

赵发君,李龙澍

安徽大学 计算机科学与技术学院,合肥 230601

1 引言

RoboCup是近年世界上规模最大的机器人足球大赛,包括仿真和实体两类比赛项目[1]。RoboCup仿真2D是RoboCup最早的项目,也是软件仿真项目的重要组成部分。是各个研究团体在人工智能和多Agent智能体协作方面研究的交流平台[2-4]。

RoboCup仿真2D的比赛平台是模仿人类足球赛的场地和规则制作出来的。整场比赛分为上下半场,各10 min。比赛中以100 ms为周期,每个球员为单独的程序,是由客户端开辟出来的一个独立的线程,仿真球员通过向服务器发送命令来完成自身所要进行的动作[5]。为了使球员在每个周期都能选择最优的动作,现在的很多队伍都采用Q-学习来实现[1,5-8],并且在一定程度上实现了Agent间的协作效果。但是现行的队伍很多采用的方法是:只有带球球员才进行Q-学习获得最优动作[5-8],即在马尔科夫决策环境中(MDP)[3-4,9]选择Q值最大的动作执行,并根据执行动作后的球场评估来更新该动作的Q值,不带球球员则使用事先规定好的策略选择动作,比如,跑位,铲球等[6],这样并不能很好地与带球球员互相协作,更不能对多变的球场状态做出很好的反应。本文采用改进的Q-学习算法使得不带球球员也可以用Q-学习算法得到最优动作来实现多Agent之间的协作,并且约束了算法的使用范围,从而减少了计算量,确保了比赛的实时性。

2 强化学习与Q学习

2.1 强化学习

登录APP查看全文

猜你喜欢

动作区域策略
例谈未知角三角函数值的求解策略
我说你做讲策略
动作描写要具体
高中数学复习的具体策略
动作描写不可少
关于四色猜想
分区域
非同一般的吃饭动作
基于严重区域的多PCC点暂降频次估计
Passage Four