采用时间差分算法的九路围棋机器博弈系统
2012-09-24张小川唐艳梁宁宁
智能系统学报 2012年3期
张小川,唐艳,梁宁宁
(重庆理工大学计算机科学与工程学院,重庆400054)
近年来人工智能是信息科学中重要的热点研究领域之一,其相关算法、技术及研究成果正被广泛运用于各行业,如军事、心理学、智能机器、商业智能等.机器博弈是人工智能研究的重要分支,而围棋机器博弈是机器博弈的热点问题之一,其庞大的搜索空间和较高的复杂度,使其在机器博弈中有着重要的研究价值.
目前,围棋机器博弈中常采用的博弈算法有α-β剪枝搜索算法[1]、模式匹配[2-3]和 UCT 算法[4]等.围棋机器博弈相对于六子棋、象棋等其他棋类博弈拥有更大的搜索空间和更高的复杂度,当采用α-β等传统搜索算法时,会在时间有限情况下无法搜索到目标解.因此,本文尝试将时间差分法引入至围棋机器博弈,将博弈系统看成一个具有自我学习能力的围棋人工生命体或围棋智能体,它能在不断的博弈过程中提高自己的博弈能力.借助计算机C语言,实现了该围棋机器博弈系统,并且通过博弈实战验证了该方法的有效性和可行性.
1 时间差分算法
1.1 强化学习
强化学习(reinforcement learning,RL)较其他常用的机器学习算法,如神经网络、决策树等,在博弈系统中有着独特优势.该方法通过不断的试探与环境进行交互,根据试探所得到的反馈来决定下一动作选取,不同于传统的监督学习.监督学习需要一个教师信号来告诉智能体怎样选取动作,并给出好坏程度的评价标准,而强化学习则是……
登录APP查看全文
