谷歌打造开放源码库RLiable让机器强化学习评估更可靠
2021-01-19
海外星云 2021年23期
关键词:深度

强化学习作为机器学习的三大基本范式之一,被用在诸多学科,如信息理论、基于仿真的优化、多智能体系统、群体智能、统计学等。
强化学习通过从经验中学习来解决决策任务,其重点是在探索未知领域和开发现有知识之间找到平衡,涉及智能代理应如何在环境中采取行动,以最大限度地提高累积奖励。
强化学习已在电子游戏、平流层飞行气球和设计硬件芯片等复杂的任务上取得了可观的实验结果。然而,谷歌认为现行的强化学习经验评估标准越来越表现出一些问题,可能会给人一种机器学习在快速进步的错觉,同时会减慢强化学习领域的发展速度。
针对这个问题,谷歌在NeurIPS 2021上的一份口头报告《基于统计边缘的深度化学習》中,深入探讨了如何在只使用少量训练的情况下,考虑结果的统计不确定性,并使深度强化学习的评估更可靠。
谷歌提出了一个更严格的强化学习评估方法,并发布了多种统计工具,包括分层引导置信区间、性能概况、四分位数均值和最优性差距, 同时还发布了一个开放源码库RLiable。

强化学习中的经验研究依赖于评估一系列不同任务的表现,例如,使用Atari 100k游戏来评估进展。大多数深度强化学习算法是以比较海量任务上的相对性能进行评估的,它们得出的结果比较了总体表现的点估计值,如任务的平均值和中位数。
但不同训练运行的得分具有随机性,因此只报告点估计值并不能表明新的独立运行也会得到相似的结果。……
登录APP查看全文