APP下载

基于强化学习的机械臂自主视觉感知控制方法

2021-11-13胡春阳王恒史豪斌

西北工业大学学报 2021年5期
关键词:机械智能环境

胡春阳, 王恒, 史豪斌

(1.湖北文理学院 计算机工程学院, 湖北 襄阳 441053; 2.西北工业大学 计算机学院, 陕西 西安 710129)

传统的机械臂控制方法几乎都是按照人为预设轨迹来完成特定的任务目标。近些年来随着人工智能技术的发展,将人工智能技术应用在机械臂控制,实现复杂动态环境下的机械臂智能控制成为一个热门的研究方向。

智能控制的目标就是构建出一个能够自主学习适应新环境的系统,强化学习[1]凭借着其自身特点是实现这一目标的关键技术。深度神经网络和强化学习相结合组成的深度强化学习在游戏决策任务上已经取得了非常大的成功。Google DeepMind团队最早提出深度神经网络与强化学习相结合的深度Q网络[1]在Atari游戏决策控制上获得了出色的表现,从此开启了深度强化学习的时代。其后又逐渐涌现了能够处理连续动作空间问题的深度确定性策略梯度算法(DDPG)[3]、近端策略优化算法(PPO)[4]、异步优势演员评论家算法(A3C)[5]等强化学习算法模型。

深度强化学习在游戏行为决策任务上表现得非常成功,并增强了强化学习的可解释性[6],很大一部分决定性因素在于游戏环境中奖励函数通常能够直接给出,并且能够直接用来优化。但是在机械臂控制环境中奖励设置往往是当智能体完成某一个任务目标时,环境给予一个正反馈,其他情况下没有反馈。由于智能体起初是随机地在环境中进行探索,绝大多数探索步骤没有奖励回馈,强化学习模型训练时很难收敛,并且当智能体所处的环境发生动态变化时会极大加剧这一状况。……

登录APP查看全文

猜你喜欢

机械智能环境
长期锻炼创造体内抑癌环境
一种用于自主学习的虚拟仿真环境
调试机械臂
孕期远离容易致畸的环境
环境
智能前沿
智能前沿
智能前沿
智能前沿
简单机械