APP下载

融合强化学习和进化算法的高超声速飞行器航迹规划

2022-06-21池海红周明鑫

控制理论与应用 2022年5期
关键词:规划动作智能

池海红,周明鑫

(哈尔滨工程大学智能科学与工程学院,黑龙江哈尔滨 150001)

1 引言

高超声速飞行器具有快速响应、大航程、高效摧毁和强突防能力等突出优点,在飞行过程中,如果能够有效地实施机动飞行,就能避开障碍或威胁区域,从而提高生存概率.但是,由于高超声速飞行器的复杂特性,很难对这种控制对象进行路径规划和控制.宋建梅等[1]对远程导弹的运动模型进行离散化处理,运用A∗[2]算法来进行三维的航迹规划.李春华等[3]提出的稀疏A∗则将每次的搜索空间限制在满足无人机性能约束的范围内来进行航迹规划.上述研究均保证了规划的航迹满足实际对象的飞行需求,但是并不适用于存在动态威胁的情况,对环境的适应性也差.

相反,强化学习(reinforcement learning,RL)具有较好的实时性、优秀的泛化表现和设计流程的通用性等优点,使得它在机器人、无人机等领域的路径规划问题上均取得了优异的表现.Faust等[4]运用概率路线图(probabilistic roadmaps,PRM[5])在大型地图上分割出多个局部目标点,然后由深度确定性策略梯度(deep deterministic policy gradient,DDPG[6])训练的RL智能体引导机器人朝局部目标点移动,解决了复杂环境下机器人的远距离路径规划问题.Bae等[7]以整个地图图像作为RL 智能体的观测状态,采用的深度Q 网络(deep Q networks,DQN[8])算法在静态和动态障碍物的环境中表现出了优于A∗和D∗[9]的效果.上述方法均基于无模型的强化学习(model-free rein-forcement learning,MFRL),并且均使用“离线训练+在线使用”的模式,但没有探讨在线使用阶段RL智能体失败时的应对措施……

登录APP查看全文

猜你喜欢

规划动作智能
智能前沿
智能前沿
智能前沿
智能前沿
动作描写要具体
规划引领把握未来
快递业十三五规划发布
动作描写不可少
多管齐下落实规划
迎接“十三五”规划