APP下载

基于循环卷积神经网络的POMDP值迭代算法

2021-02-05于丹宁刘云龙

计算机工程 2021年2期
关键词:智能模型

于丹宁,倪 坤,刘云龙

(厦门大学航空航天学院,福建厦门 361102)

0 概述

随着人工智能技术的快速发展,智能体规划被广泛应用于组合调度、游戏博弈等任务[1-2]中,然而现实世界中的动态系统多数面向部分可观测环境,针对部分可观测环境下的智能体规划问题,部分可观测马尔科夫决策过程(Partially Observable Markov Decision Process,POMDP)模型应用而生[3-5]。POMDP模型的核心思想是将动态系统中的不确定性规划问题转化为最优化问题进行求解,但由于其基于系统隐含状态空间进行建立,因此人为建立模型需要大量先验知识并且存在容易陷入局部极小值的问题[6-7]。深度神经网络作为一种多层次特征学习网络,能够自动从训练数据中学习抽象特征[8]。KARKUS等人在深度神经网络与QMDP模型的基础上,提出基于卷积神经网络(Convolutional Neural Network,CNN)的POMDP值迭代算法QMDP-net[9],其是QMDP模型的网络化表示,能使POMDP模型所需的参数以网络中权值的形式通过训练数据进行自动学习,无需提供大量的先验知识或假设POMDP模型已知。此外,QMDP-net已被证明在未预先给定环境模型的情况下可有效解决2D网格地图上的导航规划问题[10-12]。

由于QMDP-net中的值迭代模块是通过卷积层与最大池化层相结合的网络结构进行表示,然而该网络结构使得QMDP-net存在训练结果不稳定、随机种子及超参数敏感等问题[13-14]。为解决上述问题,本文提出一种基于循环卷积神经网络(Recurrent Convolutional Neural Network,RCNN)的POMDP值迭代算法RQMDP-net,使用门控循环单元(Gated Recurrent Unit,GRU)网络实现值迭代过程,并以经典游戏《格子世界》网格地图上的导航规划任务为例对RQMDP-net算法的有效性进行验证。……

登录APP查看全文

猜你喜欢

智能模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
智能制造 反思与期望
智能前沿
智能前沿
智能前沿
智能前沿
智能制造·AI未来
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究