APP下载

基于改进随机森林的城市污水处理过程运行数据清洗方法

2021-05-26韩红桂赵子凡伍小龙杨士恒

北京工业大学学报 2021年5期

韩红桂, 赵子凡, 伍小龙, 杨士恒, 何 政, 赵 楠

(1.北京工业大学信息学部, 北京 100124; 2.计算智能与智能系统北京市重点实验室, 北京 100124;3.北京城市排水集团有限责任公司, 北京 100044)

城市污水处理数据是实现污水处理过程运行状态监测、操作优化控制以及故障诊断等环节的重要依据,是提高城市污水处理效率和运营监管水平的信息基础. 由于城市污水处理过程运行环境复杂,多处于泥水混合状态,具有腐蚀性强、干扰多等特点,检测设备获取的数据受污染严重,易出现缺失、离群等异常现象,这为城市污水处理过程数据的分析、处理和运用带来困扰. 如何获取高质量数据、降低异常数据影响已成为污水处理过程数据应用面临的挑战. 为此,城市污水处理厂通常在数据应用过程中采用数据清洗方法,识别异常数据特征,并对异常数据进行剔除和补偿,保证数据的可信度. 然而,城市污水处理过程数据存在异常特征多样,包括离群数据、重复数据和缺失数据等,异常数据难以被识别和重新补偿,导致数据清洗效果不理想.

针对异常数据特征难以识别的问题,基于概率分布的异常数据识别方法被广泛应用. 该方法主要通过分析污水处理过程数据的分布特性,给定正常数据置信区间,当数据超出置信区间时则判定为异常数据[1-2]. 该方法主要适用于变量数据存在可辨识的分布特性,如高斯分布、泊松分布等[3],但污水处理数据采集受进水波动、工……

登录APP查看全文