APP下载

多智能体博弈强化学习研究综述

2021-11-12陈希亮章乐贵

计算机工程与应用 2021年21期
关键词:动作智能策略

王 军,曹 雷,陈希亮,赖 俊,章乐贵

陆军工程大学 指挥控制工程学院,南京210007

自20世纪50年代著名的达特茅斯会议首次提出人工智能的概念以来,人工智能就在不断的发展,人工智能的发展大致可分为运算智能、感知智能和认知智能几个阶段。运算智能,即快速计算和记忆存储能力。感知智能,即视觉、听觉、触觉等感知能力,如采用神经元网络方法识别图像和斯坦福大学研制的诊断和治疗感染性疾病的专家系统MYCIN,所依赖的技术主要是监督学习,监督学习解决问题的方法就是靠输入大量的标签数据学到抽象特征并分类。随着感知智能技术的不断提高和完善,人工智能也逐渐从感知智能向决策智能迈进[1],如AlphaGo、AlphaZero和DQN在Atari游戏中的重大突破,而AlphaGo的核心算法是强化学习,相比监督学习的标签数据,强化学习只需要带有回报的交互数据[2]。然而现实世界复杂多变,物联网时代使得物物相连,单个智能体的智能决策已无法满足需求,群体智能决策逐渐成为主流,很多过去被认为是不可能解决的群体决策问题都能通过多智能体深度强化学习算法得以解决[3],最具代表性的就是StarCraftⅡ、Dota2和德州扑克。

1 多智能体深度强化学习关键科学问题

强化学习主要解决的是序贯决策问题,需要智能体不断地与环境进行交互和尝试,当智能体通过动作与环境进行交互时,环境会给智能体一个即时回报,智能体会根据回报评估采取的动作,如果是正向的回报则加大采取该动作的概率,如果是负向的回报则减小采取该动作的概率,同时智能体的动作可能会改变环境,不断重复,最终找到最优策略使得累积回报的期望最大。……

登录APP查看全文

猜你喜欢

动作智能策略
例谈未知角三角函数值的求解策略
我说你做讲策略
智能前沿
智能前沿
智能前沿
智能前沿
动作描写要具体
高中数学复习的具体策略
动作描写不可少
非同一般的吃饭动作