基于策略梯度的智能车辆模型预测运动控制算法*
2021-12-22孙浩陈泽宇吴思凡潘峰
汽车技术 2021年12期
孙浩 陈泽宇 吴思凡 潘峰
(1.北京联合大学,北京市信息服务工程重点实验室,北京 100101;2.北京联合大学,机器人学院,北京 100027;3.清华大学,汽车安全与节能国家重点实验室,北京 100084)
主题词:智能车辆 运动控制 策略梯度 模型预测控制
1 前言
智能车辆运动控制的目标是实现对期望轨迹的准确跟踪,是智能驾驶的基础核心技术之一[1]。模型预测控制(Model Predictive Control,MPC)是一种最优控制方法,其通过参考模型的引入直接处理被控对象的动力学特性,且其基于模型的预测功能使算法拥有对环境的前馈能力,从而取得更好的控制效果,因此受到研究者的广泛关注[2-5]。然而,MPC通过对优化问题的在线求解计算当前最优控制量,求解效率较低。如Wang和Boyd的研究表明,对于线性时不变系统的MPC问题,当其状态维数为m,控制输入维数为n,控制时域为T时,状态转移形式及控制输入形式的二次凸优化问题在线求解的时间复杂度分别为O([T(n+m)]3)和O([Tn]3)[6],其求解复杂度呈三次指数增长,在线求解效率较低。交叉方向乘子法可以实现MPC问题的时域分解,降低问题的维数,从而提高在线求解效率[7-8],但时域分解要求系统必须为线性。车辆运动为平面刚体运动,其运动控制问题为非线性控制问题,对其线性近似将导致控制精度的下降。
近年来,随着神经网络的发展,其强大的表示及近似能力推动了强化学习由表格型求解向函数近似型求解发展。强化学习的应用领域也从有限的离散空间拓展到无限的连续空……
登录APP查看全文
