集成多智能体强化学习和最大压强控制的混行交叉口协同控制
Collaborative control of mixed traffic intersections integrating multi-agent reinforcement learning and maximum pressure control
通讯作者:
收稿日期: 2025-07-14
| 基金资助: |
|
Received: 2025-07-14
| Fund supported: | 中央高校基本科研业务资助项目(300102345602);陕西省自然科学基础研究计划资助项目(2024JC-YBMS-376);陕西省社会科学基金资助项目(2021R025);陕西省教育厅科学研究计划资助项目(23JK0557);陕西省社会科学基金资助项目(2022R028). |
作者简介 About authors
曹宁博(1987—),男,讲师,从事自动驾驶汽车和行人安全研究.orcid.org/0000-0002-6630-0466.E-mail:
针对混行交叉口包含网联自动驾驶车(CAVs)、人驾车辆(HDVs)及行人的交通控制问题,提出融合多智能体近端策略优化(MAPPO)与最大压强控制(MPC)的协同控制方法. 通过构建分布式部分可观测马尔可夫决策过程(Dec-POMDP),设计分层状态空间与动作空间,并引入能够同时考虑安全性、通行效率、相位切换频率及规则依从性的奖励函数. 采用集中式训练与分布式执行框架,基于SUMO仿真平台在低、中、高交通流量场景下对模型性能进行验证. 结果表明,所提出的MAPPO-MPC方法能够显著提升吞吐量(最高提升44.3%),降低排队长度(最高降低49.3%)、车辆平均延误(最高降低43.2%)和行人等待时间(最高降低43.53%),且在CAV渗透率超过50%时表现出更显著的性能优势,优于传统Webster方法以及基线模型.
关键词:
A collaborative control approach integrating multi-agent proximal policy optimization (MAPPO) and maximum pressure control (MPC) was developed to address traffic control challenges at mixed traffic intersections involving connected autonomous vehicles (CAVs), human-driven vehicles (HDVs), and pedestrians. A hierarchical state space and an action space were designed through the formulation of a decentralized partially observable Markov decision process (Dec-POMDP). Reward functions considering the balance among safety, traffic efficiency, phase switching frequency, and regulatory compliance were introduced. The proposed model was validated under low, medium, and high traffic flow conditions using a centralized training with decentralized execution framework on the SUMO simulation platform. Experimental results demonstrated that the proposed MAPPO-MPC method significantly improved the throughput (by up to 44.3%) while reducing the queue length (by up to 49.3%), average vehicle delay (by up to 43.2%), and pedestrian waiting time (by up to 43.53%). Moreover, the model exhibited more substantial performance advantages when the CAV penetration rate exceeded 50%, outperforming the traditional Webster-based methods and the baseline models.
Keywords:
本文引用格式
曹宁博, 万启超, 赵利英, 李梓萌, 黄宝林.
CAO Ningbo, WAN Qichao, ZHAO Liying, LI Zimeng, HUANG Baolin.
随着自动驾驶技术的快速发展,交通系统正转向CAVs-HDVs-行人混行模式. 作为城市路网的关键节点,混行交叉口的协同控制面临决策主体异构性及安全-效率平衡等核心挑战. 传统方法依赖于定时信号控制方案,难以适应交通流的动态特性,也无法配合CAVs实现高效管理. 多智能体强化学习(multi-agent reinforcement learning, MARL)凭借对复杂决策问题的自适应优化能力,成为突破这一瓶颈的重要方法.
MARL通过分布式决策实现全局优化,成为解决混行交叉口控制难题的新途径. 罗彪等[4]指出MARL可通过协同博弈来建模智能体间策略耦合,但在混行交叉口的应用仍存空白. 在无信号控制方面,Peng等[5]将深度强化学习(deep reinforcement learning, DRL)应用于CAVs协同,证明少量CAVs通过速度协调可提升通行效率,但未整合HDVs、信号控制与行人要素. 许曼晨等[6]基于多智能体近端策略优化(multi-agent proximal policy optimization, MAPPO)实现无信号交叉口车辆决策,设计多目标奖励函数提升安全性,但未涉及信号灯. 在信号控制优化方面,Wei等[7]提出PressLight算法,将最大压强控制(maximum pressure control, MPC)与RL结合,通过最小化路网压强来提升效率,为奖励设计奠定基础,但未考虑车辆控制且难以迁移至混行场景.
现有研究存在3个主要局限:1)控制维度单一性. Bdeir等[8]基于Q-learning优化CAVs轨迹,忽视与HDVs、信号灯的协同. 2)场景鲁棒性不足. Sharif等[9]评测表明多数DRL算法在动态城市环境中泛化性较差. 3)多智能体协同机制缺失. Yu等[10]提出动态协调图来建模多车交互,但未扩展至信号控制系统. 孙彧等[11]强调传统方法如多智能体深度确定性策略梯度(multi-agent deep deterministic policy gradient, MADDPG)因离线策略特性难以解决环境非平稳性问题. 在车辆协同方面,Zhang等[12]采用MARL实现多车协作换道. Zhou等[13]设计多目标奖励函数优化混流高速路的换道安全性与能效. Mate等[14]结合近端策略优化(proximal policy optimization, PPO)实现高速编队协同. Schester等[15]基于博弈论和自博弈训练合流车辆控制,扩展多车交互规模. 上述研究均未解决信号灯-CAVs-HDVs-行人的协同问题.
针对上述不足,提出融合MAPPO与MPC的混行交叉口分层协同框架. 理论层面借鉴Schulman等[16]的PPO裁剪机制与Yu等[17]的集中式训练与分布式执行(centralized training with decentralized execution, CTDE)范式,构建Dec-POMDP模型[18]解决策略耦合与非平稳性问题;方法层面引入Wei等[7]的压强最小化目标设计信号灯奖励函数,结合车辆安全、效率多目标优化,实现CAVs-HDVs-信号灯-行人协同管理;验证层面采用SUMO仿真平台[19],在低、中、高流量场景下验证模型的泛化性,填补现有研究场景单一缺陷. 对混行交叉口协同控制理论体系的系统性拓展,为智能网联交通系统提供可工程化的解决方案.
1. 问题描述和理论基础
1.1. 研究场景和问题描述
研究场景为CAVs、HDVs与行人共存的交叉口,如图1所示. 在该混行场景中,行人行为可通过信号配时优化实现相对高效的时空分离与控制. 车辆通行的控制问题较为复杂. 车辆与信号灯的协同控制同时受到交通供给(如车道布局与信号相位设置)和交通需求(如CAVs与HDVs的混合比例及交通流波动)的共同制约. 不仅须在仿真环境中精确构建与实际路口一致的拓扑结构及信号逻辑(包括能够随交通需求动态调整的自适应信号控制机制),还须嵌入信号约束下的CAVs与HDVs运动行为模型. CAVs除完成自身速度规划与信号协同外,还须借助协同决策机制实时引导HDVs的运行,从而在保障安全性的前提下提升整体交通效率. 必须在仿真与实际场景一致的建模框架下,系统分析多模态交通需求与智能信号控制之间的动态交互关系,在建模过程中对部分复杂因素(如车辆混合比例)进行合理简化.
图 1
以图1为例,对研究场景涉及的相关符号进行解释.
1.2. 多智能体强化学习环境
1.2.1. 马尔科夫决策过程
为了实现CAVs、HDVs和行人安全、高效通过交叉口,将CAVs、HDVs和行人的博弈过程视为完全合作型MARL. CAVs和HDVs的决策通常依赖于局部观测信息,采用MARL方法解决此问题时,需引入Dec-POMDP. Dec-POMDP可表征为
对于所有
基于上述理论建立的MARL过程如图2所示.
图 2
1.2.2. MAPPO算法
PPO[16]相较于传统策略梯度方法,通过引入重要性采样评估新旧策略差异,采用裁剪机制约束策略更新幅度,有效缓解训练不稳定问题,同时确保学习性能. MAPPO算法将PPO的策略优化机制引入多智能体系统,能够在协作、竞争以及混合场景中实现更高效的策略学习[17]. MAPPO的核心特征在于在线策略(on-policy)学习范式,即直接利用当前策略实时交互产生的经验进行策略优化,它通常具有更高的稳定性和更低的估计偏差. 因MAPPO算法策略更新完全基于当前策略的数据,能更及时地响应环境动态变化,这一特性使MAPPO算法尤为适配自动驾驶控制. MAPPO算法的核心架构采用CTDE范式,框架如图3所示. 在该架构下,每个智能体维护独立的Actor网络,但共享一个中心化Critic网络. 在训练阶段,Critic网络基于全局状态
图 3
在时间步
策略的更新幅度为
式中:
式中:
式中:
式中:
策略优化过程采用裁剪式目标函数进行参数更新,裁剪式目标函数核心机制是通过最小化负向策略损失实现策略改进. 策略网络参数
式中:B为训练批次大小,表征单次参数更新所使用的样本数量.
对于价值网络的优化,采用均方误差损失函数衡量价值预测偏差:
该损失函数的优化目标为最小化状态价值估计
MAPPO算法中单个智能体的完整训练流程如图4所示.
图 4
图 4
MAPPO算法中第
Fig.4
Training episode of
1.3. MPC算法
如图1所示,每个移动路径
0 东-西直行:东西直行车流和行人通行;
1 南-北直行:南北直行车流和行人通行;
2 东-西左转:东西左转车流,行人不通行;
3 南-北左转:南北左转车流,行人不通行.
MPC定义每个移动路径的压强为进口道与出口道车辆数量的差:
式中:在
每次切换相位调整至最大压强的移动路径所对应的相位,即
时刻
MPC的核心目标是优先释放最大压强对应的交通流,以此降低交叉口的总压强
2. MAPPO-MPC控制方法构建
2.1. 协同控制方法框架
图5是新提出的混行交叉口协同控制框架. 本框架将HDVs和信号灯作为协同智能体,与CAVs进行联合决策规划. 利用仿真软件生成多智能体交互轨迹数据并存储至经验回放池;通过经验数据,迭代训练Actor-Critic网络. 设计融合多维优化目标的奖励函数,包括安全性(最小化碰撞风险)、通行效率(最小化交叉口压强)、交通规则依从性,并引入折扣因子以平衡即时奖励与长期收益.
图 5
图 5 混行交叉口管理方法框架图
Fig.5 Framework diagram for mixed-traffic intersections management
2.2. 状态空间设计
针对异构智能体类型CAVs、HDVs与交通信号灯,分别设计集中式评论家网络. 在训练阶段,利用全局信息进行价值评估.
a) CAVs智能体评论家输入状态:包含车辆本身位置、航向、速度、车道、信号灯状态,以及感知范围内车辆的信息等,构成36维状态向量.
b) HDVs智能体评论家输入状态:包含车辆本身位置、速度、车道、信号灯状态,以及紧邻前/后车的位置与速度等,构成9维状态向量.
c) 交通灯(traffic light, TL)智能体评论家输入状态:交叉口的拓扑坐标、当前相位时序、各进口道和出口道车辆数量及平均速度等,构成20维状态向量.
为了克服传统MARL中因传感器视场限制或动态遮挡导致的局部可观测性问题,在执行阶段引入感知扩展机制,为目标CAV智能体实时采集感知范围内多辆邻车的高精度状态向量,构建局部环境的增强观测表征. 决策生成后,系统将目标CAV的关键决策指令广播至协同车辆,使CAV能够依据全局协同优化目标动态调整局部策略. 在执行过程中:
a) CAVs智能体基于状态向量,实时输出离散动作指令(如加速度、转向角);
b) HDVs智能体基于状态向量,实时输出离散动作指令(如基于IDM的加速度);
c) TL智能体基于状态向量,实时输出离散动作指令(如相位切换和时长增减).
该状态空间与执行机制设计旨在使CAVs更有效地建模周边参与者的行为意图,HDVs智能体观测周边交通条件,交通灯则可更精确地捕捉交叉口各进口道车辆状态特征.
2.3. 动作空间设计
表 1 动作空间参数表
Tab.1
| 智能体 | 动作 | 控制参数 | 描述 |
| CAVs | 0~20 | 目标速度[0,2,···,40] m/s | 离散速度档位动态调整加速度 |
| TL | 0 | 相位保持 | 维持或调整当前绿灯相位时长 |
| 1 | 相位顺序切换 | 按预设顺序切换至下一相位 | |
| 2 | 相位优先切换 | 激活最大压强车道的绿灯相位 | |
| HDVs | 0~4 | IDM计算的加速度 | 车速保持、加速、减速等动态调整 |
2.4. 奖励函数设计
在奖励函数设计上,CAVs以防御性驾驶为主,侧重安全性和通行效率的平衡. 奖励函数构建以目标导向与安全约束为核心框架,加入防御性驾驶奖励,CAVs智能体的奖励函数为
式中:
式中:
式中:
式中:
式中:
式中:
式中:
式中:
HDVs的奖励函数须设计得更为灵活,应考虑驾驶员个体特征,例如对激进型驾驶员可设置较低的碰撞惩罚系数. 同时应引入视野局限奖励,使激进型驾驶员只关注前方范围内的车辆与行人. HDVs与CAVs既存在共同奖励项(如车道保持,但对CAVs需更严格),也存在差异:CAVs须强化交通规则遵守(如红灯停),HDVs可引入“侥幸心理”奖励,例如轻微超速未被捕获时给予正收益. HDVs的奖励函数可通过与CAVs共享结构但差异化参数来实现:
式中:
式中:
式中:
式中:
式中:
式中:
式中:
TL智能体的奖励函数以优化
式中:
作为对比,同时设计以通行效率最优为目标的传统奖励函数(用于MAPPO和MADDPG),通过高流量疏散奖励来激励信号灯动态调整配时,增强交通流疏散能力. 为了量化控制效果,将排队长度和总等待时间作为负向惩罚项,并引入相位切换惩罚,以抑制频繁切换、保持控制稳定性. TL智能体的传统奖励函数为
式中:
3. 仿真设置
3.1. 仿真条件设置
采用 Python 3.10 和 PyTorch 框架实现多智能体强化学习算法,基于SUMO微观交通仿真平台构建可配置道路拓扑、信号方案与交通流参数的仿真环境. 该环境通过内置跟驰与换道模型,生成符合现实交通特征的动态交互场景,如图6所示. 利用TraCI接口实现SUMO与MARL算法的实时交互,构建状态感知、决策与奖励反馈的闭环系统. 仿真环境包含CAVs、HDVs、行人及信号灯,以增强真实性. 分别基于MAPPO-MPC算法,CAVs通过输出加减速指令实现碰撞避免;HDVs通过输出跟驰参数实现协同行驶;TL通过动态调整信号相位以优化交叉口压强,所有基线模型(Webster、MADDPG、MAPPO、MADDPG-MPC)均在相同仿真环境(场景为典型十字混行交叉口,各进口道与出口道均设3条车道,宽3.5 m,长500 m,人行横道尺寸为21 m×6 m)下运行. 初始信号配时由Webster方法生成,黄灯时长3 s,全红时长1 s. 具体信号配时如表2所示.车辆与行人随机进入场景,交通需求按低、中、高3种流量条件设置,具体数值见表3.
图 6
表 2 交叉口基础信号配时
Tab.2
| 场景 | 周期/s | t/s | |||
| 东西直行 | 东西左转 | 南北直行 | 南北左转 | ||
| 低流量 | 72 | 22 +4 | 24 +4 | 38 +4 | 40 +4 |
| 中流量 | 105 | 36 +4 | 39 +4 | 44 +4 | 47 +4 |
| 高流量 | 130 | 42 +4 | 45 +4 | 50 +4 | 53 +4 |
表 3 交叉口交通流量
Tab.3
| 流量密度 | EE (veh·h−1) | SE (veh·h−1) | WE (veh·h−1) | NE (veh·h−1) | NP (per·h−1) |
| 低 | 360 | 650 | 380 | 575 | 200 |
| 中 | 810 | 890 | 400 | ||
| 高 | 995 | 600 |
3.2. 模型参数设置
所有模型参数的设置均基于深度强化学习通用准则、交通控制领域先验知识,并结合初步实验结果与已有研究成果[7,16-17]的系统对比与分析而最终确定,核心目标是平衡算法探索与利用能力、保障训练稳定性,并确保模型在不同交通流量与CAV渗透率条件下实现高效、安全的协同控制. 关键参数包括:强化学习超参数(如学习率、折扣因子、广义优势估计(generalized advantage estimation,CAE)参数和裁剪范围)依据PPO及多智能体扩展MAPPO的标准设置,以兼顾收敛速度和训练稳健性;奖励函数权重通过网格搜索和调优,赋予安全极高负奖励,同时统筹效率、舒适性及基于MPC的车流均衡优化,并引入人类驾驶行为以增强真实性;环境与物理参数则贴合仿真软件(simulation of urban mobility,SUMO)中IDM跟驰模型及实际传感器与法规要求. 所有参数经过敏感性测试与多轮实验验证,在低、中、高流量及不同渗透率场景中均表现出良好的鲁棒性与泛化能力(
表 4 训练参数表
Tab.4
| 参数 | 数值 | 参数 | 数值 | 参数 | 数值 | 参数 | 数值 | |||
| 0.5 | 0.1 | 0.1 | 40 | |||||||
| −1 000 | 2 | 0.4 | 0.04 | |||||||
| 10 | 0.2 | −1 000 | 0.05 | |||||||
| 1 | 0.05 | 5 | 0.15 | |||||||
| 0.1 | π/4 | 1 | 0.3 | |||||||
| 20 | 0.05 | 1.5 | 1 | |||||||
| 3 | −500 | 0.3 | 0.5 | |||||||
| 0.5 | 5 | 0.12 | 0.3 | |||||||
| 1.5 | 1 | 限速×1.15 | 0.1 | |||||||
| 2 | 0.5 | 0.01 | 1 | |||||||
| 0.3 | 10 | 0.02 | 0.5 | |||||||
| 0.1 | 0.05 | 0.001 | 1.2 | |||||||
| 限速 | 50 | 0.05 | 0.3 | |||||||
| 0.01 | 40 | 0.05 | 0.8 | |||||||
| 0.05 | 0.05 | 3 | 0.3 | |||||||
| 2 | 限速 | 0.1 | 0.4 | |||||||
| 0.001 | 0.1 | 0.03 | 0.99 | |||||||
| 0.1 | 0.2 | 0.05 | 学习率 | 0.000 01 | ||||||
| 0.1 | 0.05 | −500 | 总训练回合数 | 1 500 | ||||||
| 0.5 | 2 | 0.5 | 0.2 | |||||||
| 1 | 1 | 2 | SGD迭代次数 | 5 | ||||||
| 0.05 | 1 | 0.05 | 100 |
3.3. 有效性评估
选取平均排队长度、车均延误与吞吐量作为性能评估指标(measurement of effectiveness, MOE),用于比较不同混行交叉口协同控制方法在成功率、安全性和效率方面的表现.
1) 平均排队长度:指统计期内各车道车辆排队长度的平均值,值越小表明性能越好.
2) 车均延误:指统计期内总延误与总车辆数的比值,值越小代表通行效率越高.
3) 吞吐量:指单位时间内通过交叉口的车辆数.
4) 成功率、安全率与效率:
式中:
4. 仿真结果分析
4.1. 模型性能对比分析
对4种模型进行仿真对比分析:MAPPO-MPC(基于MAPPO,奖励函数为交叉口总压强与相位切换,相位变化由MPC决定)、MAPPO(基于MAPPO,奖励函数为车辆总数、排队数、总等待时间与相位切换的加权,相位由排队长度决定)、MADDPG-MPC(基于MADDPG,奖励函数同MAPPO-MPC)以及MADDPG(基于MADDPG,奖励函数同MAPPO). 训练共进行19 000回合,每10回合保存1次数据. 图7展示了各回合所有智能体的平均奖励值随训练回合数的变化情况.
图 7
图 7 不同算法训练回合平均奖励值
Fig.7 Average reward value of training rounds for different algorithms
通过多因素方差分析及Tukey事后检验初步评估不同流量条件下4个模型的性能差异. 结果显示,p 是假设检验中用于衡量结果统计显著性的关键指标. 模型类型与流量条件对奖励值存在显著影响(p < 0.001),且交互作用显著(p < 0.001). MAPPO-MPC在所有流量环境下均表现最优,奖励值显著高于MAPPO与MADDPG(p < 0.001);MADDPG-MPC在低流量条件下与MAPPO-MPC无显著差异(p > 0.05),但在中、高流量环境下显著低于MAPPO-MPC(p < 0.01),仍显著优于MAPPO与MADDPG(p < 0.001).
从图7可以看出,在奖励值R方面,MAPPO-MPC与MADDPG-MPC的整体表现优于MAPPO和MADDPG. 这主要得益于MPC机制的引入,将多智能体协同学习与交叉口全局交通状态感知相结合,使信号灯智能体在快速响应排队情况的同时,兼顾各方向交通流的均衡性,避免传统方法因过度优先某一排队方向而导致的其他流向通行能力下降问题,从而提升了系统整体协同效率和优化能力,获得更高奖励. 在收敛速度方面,MAPPO-MPC在低、中、高交通量下分别于5 000、7 500和8 000回合N左右趋于稳定,表现均优于其余方法;MADDPG-MPC因采用相同的奖励设置,收敛也优于MAPPO和MADDPG,表明以交叉口总压强和相位切换为核心的奖励设计有助于提高学习效率. 就稳定性而言,4种算法在收敛后波动均较小,其中MAPPO-MPC在整个训练过程中曲线最为平滑、波动最小.
此外,不同交通量对模型性能具有显著影响:低流量时各算法奖励值波动小、收敛快,MAPPO-MPC约在5 000回合收敛;中流量时奖励值降低、波动增大,收敛速度减慢,约在7 500回合稳定;高密度车流下,奖励值进一步降低,收敛更慢(约8 000回合),且波动显著增加,主要原因在于智能体数量增多、环境复杂性提高,导致策略学习难度加大,例如MADDPG直至12 000回合才逐渐收敛. 尽管如此,所有算法在高流量条件下仍最终实现收敛,体现出一定的鲁棒性.
为了全面评估新模型的性能,进一步对比多种算法在成功率、安全率与效率方面的表现. 如图8所示(图中结果以“均值±标准差”形式呈现),MPC算法的引入对2种基础算法(MAPPO和MADDPG)均带来显著性能提升与稳定性增强. MAPPO-MPC展现出最优的综合性能,在3种测试场景中的成功率(分别为93.23%±2.00%、90.85%±2.41%和85.5%±2.82%)和任务效率(91.48%±2.11%、89.25%±2.42%、84.2%±2.73%)均明显优于原始MAPPO (成功率:88.32%±3.75%、85.6%±4.12%、79%±4.41%;效率:85.24%±4.05%、82.4%±4.51%、77.5%±4.92%)及MADDPG系列模型,并始终保持最低的碰撞率(5.27%±1.13%、6.5%±1.42%、9.3%±2.04%). 尤为重要的是,MAPPO-MPC误差范围更小,表明多次实验结果一致,稳定性最佳. MADDPG-MPC的各项指标(如成功率:91.33%±2.55%、89.1%±3.12%、83.1%±3.54%)虽略低于MAPPO-MPC,但较基础MADDPG (成功率:85.16%±4.85%、82%±5.22%、75.2%±6.62%)有明显改善,尤其在降低碰撞率方面(7.76%±1.65%、9.05%±2.05%、12.2%±2.51% vs. 12.78%±2.71%、14.9%±3.33%、18.9%±3.51%)效果显著,且误差棒的缩短证实MPC有效地提升了MADDPG的策略稳定性.
图 8
图 8 模型成功率、安全率、效率和平均奖励值对比图
Fig.8 Comparison chart of model success rate, safety rate, efficiency, and average reward value
随着任务复杂度的增加(从左至右指标呈下降趋势),融合MPC的模型(MAPPO-MPC和MADDPG-MPC)均表现出更强的鲁棒性,性能衰减幅度明显小于对应基础模型,例如MAPPO-MPC的成功率仅下降了7.73%,而MAPPO下降了9.32%. 值得注意的是,在复杂场景中,基础算法的误差棒显著变宽,表明MAPPO性能出现较大波动且可靠性下降;相比之下,MAPPO-MPC的误差范围增长相对缓和,证明MAPPO卓越的鲁棒性和可重复性. 结果说明,MPC机制能够有效提升智能体的综合性能与策略输出的稳定性,显著改善长期累积奖励与系统安全性,该优势在不同算法架构(MAPPO与MADDPG)中均得到验证. MAPPO-MPC凭借其近端策略优化机制与MPC压强控制的有效结合,在复杂混行交通场景中表现出最稳定、最优异的任务完成效能.
4.2. 模型控制效果对比分析
如图9所示,在不同渗透率
图 9
图 9 交叉口车辆排队、延误和吞吐量对比图
Fig.9 Comparison of queuing, delay, and throughput at intersection
在缓解拥堵方面,新模型显著降低了平均排队长度Q',整体降幅为21.8%~49.3%. 以低流量场景中50%渗透率
值得注意的是,模型性能优势随着渗透率上升而持续扩大. 当渗透率低于30%时,各模型差异相对有限(例如在10%渗透率下,排队长度改善幅度仅为1.5%~7.4%);当渗透率超过50%后,新模型凭借协同决策机制与MPC控制的深度融合,展现出显著的边际收益,MAPPO-MPC行程时间指标较表现次优的MADDPG-MPC模型进一步降低了11.2%~18.1%. 对比模型虽然均能在一定程度上提升基准性能,但改善幅度呈阶梯式衰减:MADDPG-MPC平均可达新模型效果的75%~85%,MAPPO与MADDPG仅实现60%~70%的性能水平. 这一结果进一步表明,所提出的协同决策与MPC控制在混行环境中,特别是CAVs渗透率超过50%的场景中,具有关键作用与显著性能的优势.
表5系统对比不同CAVs渗透率与交通流量场景下,基准方案与4种强化学习算法(MAPPO-MPC、MADDPG-MPC、MAPPO、MADDPG)在行人控制方面的性能. 分析表明:所有强化学习算法在绝大多数场景中均显著优于基准方案,验证强化学习在混行交叉口协同控制中的有效性;融合最大压强控制(MPC)的混合架构算法(MAPPO-MPC与MADDPG-MPC)展现出整体最优性能,在低渗透率(10%~30%)与高渗透率(70%~90%)下的中低流量场景,以及全部渗透率下的高流量场景中,延迟降低效果均显著优于纯强化学习算法及基准方案. 以90%渗透率下的高流量场景为例,MAPPO-MPC将平均延迟从基准的56.7 s降至48.3 s,降幅达14.8%,优于MAPPO(53.0 s)和MADDPG(54.2 s). 该结果凸显MPC在提升交叉口车辆分布均衡性方面的重要作用,MPC显式压强优化机制有效增强了纯强化学习策略在高不确定性交通环境中的鲁棒性. 算法性能差异随渗透率与流量水平呈现非线性变化:在中低流量场景中,随着渗透率从10%升高至90%,所有算法的延迟普遍上升,集成MPC的算法始终保持更显著的优势;在高流量场景中,高渗透率(70%~90%)带来的复杂交互与不确定性加剧,导致所有方案的延迟急剧上升,混合架构算法(尤其是MAPPO-MPC)仍表现出最优的延误控制能力.
表 5 行人等待时间表
Tab.5
| 渗透率 | 流量 | t/s | ||||
| 优化前 | MAPPO- MPC | MADDPG- MPC | MAPPO | MADDPG | ||
| 10% | 低 | 45.0 | 39.8 | 41.3 | 42.8 | 43.5 |
| 中 | 55.0 | 53.5 | 53.8 | 54.2 | 54.5 | |
| 高 | 65.0 | 63.8 | 64.0 | 64.3 | 64.5 | |
| 30% | 低 | 41.8 | 32.5 | 35.2 | 37.8 | 38.5 |
| 中 | 54.7 | 52.2 | 52.8 | 53.5 | 53.9 | |
| 高 | 64.5 | 62.1 | 62.8 | 63.5 | 63.8 | |
| 50% | 低 | 38.4 | 24.3 | 30.3 | 33.4 | 35.0 |
| 中 | 54.5 | 51.5 | 52.2 | 53.0 | 53.5 | |
| 高 | 63.5 | 59.4 | 60.8 | 62.0 | 62.5 | |
| 70% | 低 | 35.1 | 20.7 | 26.6 | 29.7 | 31.5 |
| 中 | 53.8 | 48.2 | 49.8 | 51.2 | 52.0 | |
| 高 | 60.9 | 53.8 | 55.5 | 57.8 | 58.8 | |
| 90% | 低 | 31.7 | 17.9 | 23.6 | 26.3 | 28.0 |
| 中 | 52.5 | 43.8 | 45.8 | 48.2 | 49.5 | |
| 高 | 56.7 | 48.3 | 50.5 | 53.0 | 54.2 | |
尽管纯强化学习算法(MAPPO与MADDPG)性能逊于混合架构,稳定优于基准方案,表明MAPPO和MADDPG具备一定的环境学习与优化能力. 融合MPC的混合强化学习架构(MAPPO-MPC与MADDPG-MPC)在应对不同渗透率与动态交通流时表现出卓越的综合性能与鲁棒性,尤其在渗透率高、流量大的复杂场景中优势显著. 这一方面体现MPC理论[7]与多智能体强化学习协同的先进性,另一方面也说明其具备在实际混行交叉口控制中推广应用的处理复杂交互与不确定性问题的能力.
5. 结 论
(1) 提出“MAPPO-MPC”分层协同架构,将CAVs运动控制、HDVs跟驰引导与信号灯相位分配统一建模为Dec-POMDP,突破传统方法中单一智能体决策的局限性;设计异构智能体状态-动作空间(CAV:36维状态+21维动作/HDV:9维状态+5维动作/信号灯:20维状态+3维动作),结合多目标奖励函数(安全性、效率性、规则依从性)等,实现跨模态智能体的策略协同优化.
(2) MAPPO-MPC方法显著提升了混行交叉口的综合性能:吞吐量最高提升了44.3%,平均排队长度降低了49.3%,车均延误减少了43.2%,行人等待时间缩短了43.5%. 当CAVs渗透率超过50%时,该模型表现出更显著的性能优势,印证协同控制在高CAVs渗透场景中的必要性. 在与传统Webster方法以及MADDPG-MPC、MADDPG和MAPPO等基线模型的对比中,MAPPO-MPC在多个方面均表现出最优性能,包括更快的收敛速度(低流量场景下仅需5 000回合即可收敛)、更高的稳定性(训练曲线波动最小)以及更强的鲁棒性(高流量下性能衰减幅度最低). 引入MPC机制有效地提升了交叉口内车辆分布的均衡性,避免传统信号控制中因偏向某一方向而导致的交通流失衡问题. 分层状态设计与多智能体协同决策机制显著地增强了系统在不同流量条件和渗透率下的高动态混行环境适应能力.
模型验证最大压强控制与多智能体强化的耦合机制可有效解决混行交叉口的“均衡-效率”矛盾,通过压强最小化实现交通流空间均衡分布,弥补传统信号优化中“绿灯时长-排队长度”局部优化的缺陷;尽管MAPPO-MMC方法在交叉口协同控制中展现出良好的性能,但该模型仍存在一定的局限性. 例如,当前研究尚未充分考虑高动态环境(如突发交通事故或极端天气)对系统性能的潜在影响,也未涉及CAVs与HDVs之间在通信延迟和感知误差等实际约束下的交互影响. 未来的工作除了将引入长短期记忆神经网络以增强模型对真实环境中通信延迟等不确定性的动态适应能力之外,还将进一步拓展至多交叉口自适应协同控制等复杂场景.
参考文献
Uncertainty-aware model-based reinforcement learning: methodology and application in autonomous driving
[J].
Deep reinforcement learning for autonomous driving: a survey
[J].
多智能体强化学习控制与决策研究综述
[J].DOI:10.16383/j.aas.c240392 [本文引用: 1]
Survey on multi-agent reinforcement learning for control and decision-making
[J].DOI:10.16383/j.aas.c240392 [本文引用: 1]
Connected autonomous vehicles for improving mixed traffic efficiency in unsignalized intersections with deep reinforcement learning
[J].
基于MAPPO的无信号灯交叉口自动驾驶决策
[J].DOI:10.3969/j.issn.1671-5896.2024.05.003 [本文引用: 1]
Autonomous driving decision-making at signal-free intersections based on MAPPO
[J].DOI:10.3969/j.issn.1671-5896.2024.05.003 [本文引用: 1]
Distributed multiagent coordinated learning for autonomous driving in highways based on dynamic coordination graphs
[J].DOI:10.1109/TITS.2019.2893683 [本文引用: 1]
多智能体深度强化学习研究综述
[J].
Overview of multi-agent deep reinforcement learning
[J].
Multi-agent reinforcement learning for cooperative lane changing of connected and autonomous vehicles in mixed traffic
[J].DOI:10.1007/s43684-021-00019-7 [本文引用: 1]
Multi-agent reinforcement learning for highway platooning
[J].
The surprising effectiveness of PPO in cooperative multi-agent games
[J].
Multi-agent reinforcement learning as a rehearsal for decentralized planning
[J].DOI:10.1016/j.neucom.2016.01.031 [本文引用: 1]
/
| 〈 |
|
〉 |

