
第一作者:Ziang Zhu
通讯作者:王瑾丰
通讯单位:南京大学
原文链接:https://pubs.acs.org/doi/10.1021/acs.est.5c15251

在现代污水处理厂中,如何让复杂的生物反应过程始终稳定、高效地运行,一直是工程控制领域的核心难题。传统依赖经验规则的自动控制系统虽然稳定可靠,但在面对进水水质剧烈波动、反应过程高度非线性的情况下,往往显得力不从心。近年来,基于强化学习(RL)的智能控制逐渐受到关注,这类“会学习的控制代理”能够自主决策、动态调整关键运行参数,有望实现更高效的生物脱氮与系统调控。然而,理想与现实之间仍存在明显鸿沟。目前多数强化学习控制策略仍停留在计算机模拟阶段,难以真实反映污水处理系统中复杂的运行环境。同时,算法本身的“黑箱”特性也使其决策逻辑难以被工程师理解和信任。如何在真实反应器中验证其可行性,并揭示智能控制背后的决策规律,正成为推动污水处理迈向智能化的重要挑战。
本期NewMIT小编,将向大家介绍一项03月10日发表于《Environmental Science & Technology》的突破性研究成果。研究者构建了一种反应器—智能代理一体化(reactor–agent integration)系统,实现了物理生物反应器与强化学习(RL)智能代理之间的直接交互,并证明基于代理的智能控制在应对进水扰动方面明显优于传统控制策略。
核心观点
在本文中,研究者构建了一种反应器—智能代理一体化(reactor–agent integration)系统,实现了物理生物反应器与强化学习(RL)智能代理之间的直接交互,并证明基于代理的智能控制在应对进水扰动方面明显优于传统控制策略。实验结果表明,在短期运行波动条件下,与知识驱动控制相比,RL 智能控制可使氮污染物超标程度降低约 30%;同时,通过协同调节溶解氧(DO)设定值与内部混合液回流,系统运行成本进一步降低 36.5%。为提升算法的可解释性,研究提出了一套连接算法智能与工艺透明性的分析框架。该框架综合利用控制动作可视化、代理决策树模型、Sobol 灵敏度分析以及决策轨迹分析等方法,系统揭示 RL 智能体的决策逻辑,并将其与生物反应动力学和过程控制原理相联系。这些分析使原本的“黑箱”策略转变为可解释、符合工艺规律且可审计的控制方案。总体而言,本研究验证了基于智能代理的控制策略在真实运行条件下的可行性、稳健性与透明性,为其在全规模污水处理厂(WWTPs)中的可靠应用奠定了基础。
图文导读

图1 实验室规模反应器和RL试剂的闭环集成
图1展示了强化学习(RL)智能代理与生物反应器耦合的整体控制框架,用于实现生物脱氮过程的智能化调控。系统采用厌氧–缺氧–好氧–缺氧(AA′OA′)反应流程,在传统AAO基础上增加第二缺氧区,以强化反硝化并进一步去除残余氮。反应器以实际污水处理厂进水为原料,并接种好氧池活性污泥,通过持续监测COD、NH₄⁺-N与总氮(TN)评估运行稳定性。运行过程中,RL智能代理实时接收反应器状态信息,并生成最优控制策略,通过上位控制系统与PLC执行,实现对溶解氧(DO)设定值、内部混合液回流(IMLR)、进水流量及碳源投加等关键参数的动态调节,从而构建起反应器—智能体的闭环控制体系。

图2 在动态进水条件下,基于RL的控制与静态和基于知识的策略的性能比较
图2展示了在进水峰值扰动条件下,不同控制策略对生物脱氮系统性能的影响。总体来看,强化学习(RL)智能控制在抑制氮污染物峰值、加快系统恢复以及降低运行成本方面均表现出明显优势。具体而言,进水流量突增导致出水 NH₄⁺-N 与 TN 浓度同步升高(图2B、2C),但RL控制通过动态调节溶解氧(DO)设定值与内部混合液回流(IMLR),将NH₄⁺-N稳定在约 3.1 mg N/L,TN降至 9.6 mg N/L,且恢复时间明显提前。进一步分析超标持续时间发现,RL控制使NH₄⁺-N超标时间缩短 15 min,而TN则实现零超标(图2D、2E)。综合评价指标进一步验证了这一优势。与传统知识控制相比,RL策略使出水质量指数(EQI)提升1.96%,同时成本指数(CI)降低36.55%、能耗指数(PI)降低19.56%(图2F)。这些结果表明,RL智能控制不仅提升了系统对冲击负荷的适应能力,也实现了更高效、更节能的运行优化。

图3 使用替代决策树和Sobol敏感性指标分析RL-only和RL+BO控制策略的可解释性
图3揭示了强化学习(RL)智能控制策略的可解释性分析过程。研究通过代理决策树与灵敏度分析,将原本复杂的“黑箱”算法转化为可理解的控制逻辑,从而帮助工程人员理解其决策依据。首先,代理决策树将RL策略转化为规则化结构。相比RL-only策略结构复杂且奖励较低,RL+BO模型形成更简洁的决策路径,并快速收敛到高奖励节点,显示出更稳定的控制性能(图3A、3B)。进一步通过Sobol灵敏度分析量化不同变量对控制策略的影响。结果表明,RL-only策略主要关注出水质量指数与成本指数,控制目标较为单一;而RL+BO策略对进水流量变化表现出更高敏感性,能够更好地应对水力与有机负荷波动(图3C、3D)。综合来看,该方法不仅揭示了关键控制变量及其相互作用,也为在SCADA系统中构建规则—智能融合控制提供了理论依据,从而提升强化学习控制在污水处理中的可信度与工程可实施性。

图4 四种影响情景下RL与RL+BO策略的控制决策轨迹比较
图4展示了不同进水条件下强化学习控制策略的决策轨迹演化特征,揭示智能代理如何随系统状态变化动态调整控制行为。总体来看,引入贝叶斯优化(RL+BO)后,控制轨迹更加平滑稳定,系统适应性明显增强。在高流量、高C/N条件下,两种策略轨迹总体相似,但RL+BO在溶解氧(DO)与内部混合液回流(IMLR)调节上更加平滑稳定(图4A)。当处于高流量、低C/N条件时,RL控制出现分散波动,而RL+BO快速收敛至最优轨迹(图4B)。在低流量、高C/N条件下,RL策略在碳源投加上表现出明显振荡,而RL+BO保持较稳定的控制路径(图4C)。在最为受限的低流量、低C/N条件下,RL策略波动显著,而RL+BO仍保持单调且稳定的控制趋势(图4D)。整体而言,RL+BO通过协同调节DO、IMLR与碳源投加,实现更稳定的控制路径,在保障出水水质的同时优化能耗与运行成本。
主要结论
综上所述,本研究通过实验验证与机理分析相结合,系统评估了强化学习(RL)智能控制在生物脱氮中的应用潜力。首先,实验结果表明,RL控制器可与生物反应器实现真实耦合,并在应对短时水力冲击方面优于传统静态和经验控制策略。其次,通过将RL控制与校准机理模型结合,建立了实验验证与大规模模拟之间的统一框架,使复杂扰动条件下的系统行为能够得到系统分析。再次,研究提出的可解释性分析方法将原本“黑箱”的RL策略转化为符合工艺规律、可审计的控制逻辑,从而提升数据驱动控制在污水处理中的可信度。从工程角度看,RL更适合作为辅助决策工具而非单纯算法优化器。但当前实验仍局限于短周期测试,难以反映长期微生物适应和实际污水厂连续波动特征。未来研究需在更长周期和更大规模系统中验证,并进一步考虑传感器噪声与通信延迟等工程因素。

来源:NewMIT。投稿、合作、转载、进群,请添加小编微信Environmentor2020!环境人Environmentor是环境领域最大的学术公号,拥有25W+活跃读者。由于微信修改了推送规则,请大家将环境人Environmentor加为星标,或每次看完后点击页面下端的“在看”,这样可以第一时间收到我们每日的推文!环境人Environmentor现有综合群、期刊投稿群、基金申请群、留学申请群、各研究领域群等共20余个,欢迎大家加小编微信Environmentor2020,我们会尽快拉您进入对应的群。

往期推荐



扫描二维码,快速入群~