基于云端可视化交互的强化学习平台
2021-05-17姚铁锤王彦棡迟学斌王晓光
姚铁锤,王 珏,王彦棡,迟学斌,王晓光
(1.中国科学院计算机网络信息中心,北京 100190;2.中国科学院大学 计算机科学与技术学院,北京 100049)
0 概述
强化学习作为机器学习领域的研究热点,在博弈游戏[1-2]、机器人控制、图像处理、机器翻译、交通控制[3]和自动驾驶等任务中表现优异。随着对强化学习研究的不断深入,各个研究机构和公司相继研发了不同的强化学习实验环境和平台。
OpenAI Gym[4]集文字任务、Atari、Box2D、经典控制、MuJoCo[5]和机械手臂等物理引擎于一体,提供统一的算法接口用于强化学习算法训练。DeepMind Control Suite[6]对MuJoCo 进行封装,辅以基础强化学习算法,用于机器人控制。DeepMind Lab和TORCS(The Open Racing Car Simulator)[7]分别构建迷宫和赛车的模拟器,训练强化学习智能体的导航、3D 视觉和策略等方面能力。OpenAI Gym、DeepMind Control Suite、RLlab[8]、DeepMind Lab[9]、TORCS、Pybullet[10]和PySC2[11]等用于强化学习的实验环境均包含物理引擎和基础渲染显示模块,其中,物理引擎通过感知用户操作和物体当前状态计算物体新的状态,渲染显示模块根据物体的信息进行渲染并在显示界面感知用户的操作。然而此类强化学习环境中实验场景的物理引擎模块和渲染模块耦合性较高,且模拟渲染的方式各成一体[1,5-6,8-9,12-13],这限制了大规模集群资源的利用率,增加了强化学习训练环境部署和算法验证的难度。
2018 年加州大学伯克利分校DASARI 等人开发的RoboNet[14]平台,收集了线下实体机器人1 500 万帧手臂与物体交互的视频作为强化学习训练数据集,2019 年李飞飞团队开发的RoboTurk[15]平台则提供了137.5 h 的机器人交互数据。然而此类平台仅提供特定的数据集[5,8,12,15-17],缺少强化学习训练环境和硬件资源的支撑。……
