APP下载

多约束复杂环境下UAV 航迹规划策略自学习方法

2021-05-17郑柏通

计算机工程 2021年5期
关键词:规划动作策略

邱 月,郑柏通,蔡 超

(华中科技大学人工智能与自动化学院多谱信息处理技术国家级重点实验室,武汉 430074)

0 概述

战场环境中的无人飞行器(Unmanned Aerial Vehicle,UAV)航迹规划任务需要考虑多方面的因素,如无人飞行器的性能、地形、威胁、导航与制导方法等,其目的是在低风险情况下以更低的能耗得到最优航迹。

目前,典型的无人飞行器航迹规划算法包括A*算法[1]、遗传算法[2]、蚁群算法[3]和粒子群算法[4]等,虽然它们具有很强的路径搜索能力,但是在面临新的飞行环境时,多数算法无法从历史经验中获得先验知识,导致难以适应多变的环境。强化学习通过智能体来不断地试探环境,迭代学习从“状态-动作”对中获得的累积经验,得到使收益最大化的策略,即状态到动作的映射。与传统方法不同,将强化学习理论应用于无人飞行器航迹规划领域,能够使无人飞行器获得类似人类的学习能力,在未知环境中将学到的策略作为先验知识可以提高航迹规划的效率,从而更快地适应新环境。但是强化学习存在维度灾难问题,导致难以解决复杂的实际问题。人工智能技术的发展使得深度学习可以很好地处理高维信息。深度强化学习[5-7]结合了具有强大感知能力及表征能力的深度学习与具有决策能力的强化学习,能够提高航迹规划策略在复杂多变环境中的泛化能力。

在实际的航迹规划中,需要综合考虑如何利用航迹规划的任务、约束条件和优化目标等信息来设计强化学习系统的四要素,即状态、动作、奖惩函数和策略。……

登录APP查看全文

猜你喜欢

规划动作策略
例谈未知角三角函数值的求解策略
我说你做讲策略
动作描写要具体
高中数学复习的具体策略
规划引领把握未来
快递业十三五规划发布
动作描写不可少
多管齐下落实规划
迎接“十三五”规划
非同一般的吃饭动作