求解多目标暂态电压紧急控制的强化学习方法*
2015-10-21邓卓明刘明波
华南理工大学学报(自然科学版) 2015年12期
关键词:发电机
邓卓明 刘明波
(华南理工大学 电力学院,广东 广州510640)
暂态电压安全一般指故障发生以后10 s 以内的电压安全稳定问题. 大量的感应电机负荷使电网受扰后难以维持暂态电压安全,因为暂态过程中母线电压大幅度降落将在感应电机等动态元件上产生不平衡转矩,导致感应电机转差爬升,迅速扩大系统的无功缺额[1-2],出现暂态电压幅值恢复较低、恢复缓慢等现象.暂态电压安全紧急控制通过调整发电机端电压参考值、投切容抗器[3]和切负荷[4]等手段,校正不安全的母线电压[5-6]. 暂态电压安全紧急控制问题本质是含有大量微分-代数方程约束的多目标最优控制问题.最常见的处理方法是借助加权求和将多目标控制问题转为单目标最优控制问题求解[7].另一种处理方法是先求取多目标问题的帕累托最优解集(POSS),然后根据决策者的偏好来选择一个折中最优解[8]. 求解POSS 的数学优化方法主要有:法线边界交叉(NBI)法[9]和规格化法平面约束(NNC)法[10-11],其优点是能够找到均匀分布的POSS,但需与其他求解算法结合,且求解时间较长.
多目标强化学习(MORL)方法通过智能体试错与环境形成交互式学习,根据可行解的支配关系返回奖励信号,引导其往奖励更高的解搜索,最终获得帕累托前沿(PF)上一系列最优解[12].文献[13-14]中修改了强化学习初始点的定位.文献[15]中提出采用多步回溯Q()学习算法,引入资格迹的概念来更新Q()函数.然而,它们仍需在广域状态空间中搜索最优……
登录APP查看全文