浙江大学学报(工学版), 2026, 60(8): 1819-1831 doi: 10.3785/j.issn.1008-973X.2026.08.021

交通工程

集成多智能体强化学习和最大压强控制的混行交叉口协同控制

曹宁博,, 万启超, 赵利英,, 李梓萌, 黄宝林

1. 长安大学 运输工程学院,陕西 西安 710061

2. 西安理工大学 经济与管理学院,陕西 西安 710048

Collaborative control of mixed traffic intersections integrating multi-agent reinforcement learning and maximum pressure control

CAO Ningbo,, WAN Qichao, ZHAO Liying,, LI Zimeng, HUANG Baolin

1. College of Transportation Engineering, Chang’an University, Xi’an 710061, China

2. School of Economics and Management, Xi’an University of Technology, Xi’an 710048, China

通讯作者: 赵利英,女,讲师. orcid.org/0000-0002-3954-9258. E-mail:lyzhao@xaut.edu.cn

收稿日期: 2025-07-14  

基金资助: 中央高校基本科研业务资助项目(300102345602);陕西省自然科学基础研究计划资助项目(2024JC-YBMS-376);陕西省社会科学基金资助项目(2021R025);陕西省教育厅科学研究计划资助项目(23JK0557);陕西省社会科学基金资助项目(2022R028).

Received: 2025-07-14  

Fund supported: 中央高校基本科研业务资助项目(300102345602);陕西省自然科学基础研究计划资助项目(2024JC-YBMS-376);陕西省社会科学基金资助项目(2021R025);陕西省教育厅科学研究计划资助项目(23JK0557);陕西省社会科学基金资助项目(2022R028).

作者简介 About authors

曹宁博(1987—),男,讲师,从事自动驾驶汽车和行人安全研究.orcid.org/0000-0002-6630-0466.E-mail:819868226@qq.com , E-mail:819868226@qq.com

摘要

针对混行交叉口包含网联自动驾驶车(CAVs)、人驾车辆(HDVs)及行人的交通控制问题,提出融合多智能体近端策略优化(MAPPO)与最大压强控制(MPC)的协同控制方法. 通过构建分布式部分可观测马尔可夫决策过程(Dec-POMDP),设计分层状态空间与动作空间,并引入能够同时考虑安全性、通行效率、相位切换频率及规则依从性的奖励函数. 采用集中式训练与分布式执行框架,基于SUMO仿真平台在低、中、高交通流量场景下对模型性能进行验证. 结果表明,所提出的MAPPO-MPC方法能够显著提升吞吐量(最高提升44.3%),降低排队长度(最高降低49.3%)、车辆平均延误(最高降低43.2%)和行人等待时间(最高降低43.53%),且在CAV渗透率超过50%时表现出更显著的性能优势,优于传统Webster方法以及基线模型.

关键词: 交通运输工程 ; 混行交叉口 ; 多智能体强化学习 ; 最大压强控制

Abstract

A collaborative control approach integrating multi-agent proximal policy optimization (MAPPO) and maximum pressure control (MPC) was developed to address traffic control challenges at mixed traffic intersections involving connected autonomous vehicles (CAVs), human-driven vehicles (HDVs), and pedestrians. A hierarchical state space and an action space were designed through the formulation of a decentralized partially observable Markov decision process (Dec-POMDP). Reward functions considering the balance among safety, traffic efficiency, phase switching frequency, and regulatory compliance were introduced. The proposed model was validated under low, medium, and high traffic flow conditions using a centralized training with decentralized execution framework on the SUMO simulation platform. Experimental results demonstrated that the proposed MAPPO-MPC method significantly improved the throughput (by up to 44.3%) while reducing the queue length (by up to 49.3%), average vehicle delay (by up to 43.2%), and pedestrian waiting time (by up to 43.53%). Moreover, the model exhibited more substantial performance advantages when the CAV penetration rate exceeded 50%, outperforming the traditional Webster-based methods and the baseline models.

Keywords: transportation engineering ; mixed traffic intersection ; multi-agent reinforcement learning ; maximum pressure control

PDF (1505KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

曹宁博, 万启超, 赵利英, 李梓萌, 黄宝林. 集成多智能体强化学习和最大压强控制的混行交叉口协同控制. 浙江大学学报(工学版)[J], 2026, 60(8): 1819-1831 doi:10.3785/j.issn.1008-973X.2026.08.021

CAO Ningbo, WAN Qichao, ZHAO Liying, LI Zimeng, HUANG Baolin. Collaborative control of mixed traffic intersections integrating multi-agent reinforcement learning and maximum pressure control. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(8): 1819-1831 doi:10.3785/j.issn.1008-973X.2026.08.021

随着自动驾驶技术的快速发展,交通系统正转向CAVs-HDVs-行人混行模式. 作为城市路网的关键节点,混行交叉口的协同控制面临决策主体异构性及安全-效率平衡等核心挑战. 传统方法依赖于定时信号控制方案,难以适应交通流的动态特性,也无法配合CAVs实现高效管理. 多智能体强化学习(multi-agent reinforcement learning, MARL)凭借对复杂决策问题的自适应优化能力,成为突破这一瓶颈的重要方法.

自动驾驶与交通控制优化早期聚焦于单智能体强化学习(reinforcement learning,RL). Wu等[1]提出不确定性感知模型,通过动作条件集成来评估环境不确定性,增强动态场景中的决策鲁棒性. Kiran等[2]系统综述深度RL在自动驾驶中的演进,指出多任务协同是核心挑战. Zhao等[3]设计Shield SARSA算法,通过安全屏蔽机制约束高速列车轨迹优化,为安全验证提供新范式. RL难以建模多主体交互复杂性,针对混行交叉口存在协同机制缺失的固有局限.

MARL通过分布式决策实现全局优化,成为解决混行交叉口控制难题的新途径. 罗彪等[4]指出MARL可通过协同博弈来建模智能体间策略耦合,但在混行交叉口的应用仍存空白. 在无信号控制方面,Peng等[5]将深度强化学习(deep reinforcement learning, DRL)应用于CAVs协同,证明少量CAVs通过速度协调可提升通行效率,但未整合HDVs、信号控制与行人要素. 许曼晨等[6]基于多智能体近端策略优化(multi-agent proximal policy optimization, MAPPO)实现无信号交叉口车辆决策,设计多目标奖励函数提升安全性,但未涉及信号灯. 在信号控制优化方面,Wei等[7]提出PressLight算法,将最大压强控制(maximum pressure control, MPC)与RL结合,通过最小化路网压强来提升效率,为奖励设计奠定基础,但未考虑车辆控制且难以迁移至混行场景.

现有研究存在3个主要局限:1)控制维度单一性. Bdeir等[8]基于Q-learning优化CAVs轨迹,忽视与HDVs、信号灯的协同. 2)场景鲁棒性不足. Sharif等[9]评测表明多数DRL算法在动态城市环境中泛化性较差. 3)多智能体协同机制缺失. Yu等[10]提出动态协调图来建模多车交互,但未扩展至信号控制系统. 孙彧等[11]强调传统方法如多智能体深度确定性策略梯度(multi-agent deep deterministic policy gradient, MADDPG)因离线策略特性难以解决环境非平稳性问题. 在车辆协同方面,Zhang等[12]采用MARL实现多车协作换道. Zhou等[13]设计多目标奖励函数优化混流高速路的换道安全性与能效. Mate等[14]结合近端策略优化(proximal policy optimization, PPO)实现高速编队协同. Schester等[15]基于博弈论和自博弈训练合流车辆控制,扩展多车交互规模. 上述研究均未解决信号灯-CAVs-HDVs-行人的协同问题.

针对上述不足,提出融合MAPPO与MPC的混行交叉口分层协同框架. 理论层面借鉴Schulman等[16]的PPO裁剪机制与Yu等[17]的集中式训练与分布式执行(centralized training with decentralized execution, CTDE)范式,构建Dec-POMDP模型[18]解决策略耦合与非平稳性问题;方法层面引入Wei等[7]的压强最小化目标设计信号灯奖励函数,结合车辆安全、效率多目标优化,实现CAVs-HDVs-信号灯-行人协同管理;验证层面采用SUMO仿真平台[19],在低、中、高流量场景下验证模型的泛化性,填补现有研究场景单一缺陷. 对混行交叉口协同控制理论体系的系统性拓展,为智能网联交通系统提供可工程化的解决方案.

1. 问题描述和理论基础

1.1. 研究场景和问题描述

研究场景为CAVs、HDVs与行人共存的交叉口,如图1所示. 在该混行场景中,行人行为可通过信号配时优化实现相对高效的时空分离与控制. 车辆通行的控制问题较为复杂. 车辆与信号灯的协同控制同时受到交通供给(如车道布局与信号相位设置)和交通需求(如CAVs与HDVs的混合比例及交通流波动)的共同制约. 不仅须在仿真环境中精确构建与实际路口一致的拓扑结构及信号逻辑(包括能够随交通需求动态调整的自适应信号控制机制),还须嵌入信号约束下的CAVs与HDVs运动行为模型. CAVs除完成自身速度规划与信号协同外,还须借助协同决策机制实时引导HDVs的运行,从而在保障安全性的前提下提升整体交通效率. 必须在仿真与实际场景一致的建模框架下,系统分析多模态交通需求与智能信号控制之间的动态交互关系,在建模过程中对部分复杂因素(如车辆混合比例)进行合理简化.

图 1

图 1   混行交叉口示意图

Fig.1   Schematic diagram of mixed-traffic intersection


图1为例,对研究场景涉及的相关符号进行解释. $ L $为所有道路集合,由车辆道路和行人道路2个子集构成,$ {L^z},z \in \left\{ {{\text{veh,ped}}} \right\} $,进口道集合为$ {L_{{\text{in}}}} $,出口道集合为$ {L_{{\text{out}}}} $. $ \varGamma _i^ - $$ \varGamma _i^+$分别表示与车辆/行人道路$ i $相连的道路集合,例如,如果道路$ j $$ i $相连,可表述为$ j \in \varGamma _i^ - $$ j \in \varGamma _i^+$. 2条相邻道路的组合$ (i,j) $描述车辆/行人从道路$ i $进入$ j $的移动路径,所有可能的此类移动路径集合记为M. $ L_1^{{\text{ped}}}, \cdots ,L_8^{{\text{ped}}} $为路侧人行道,允许行人自由通行;$ L_9^{{\text{ped}}}, \cdots ,L_{12}^{{\text{ped}}} $为人行横道,行人须等待信号激活方可通行;所有车辆均受信号控制;移动路径$ (L_2^{{\text{ped}}},L_3^{{\text{ped}}}) $表示行人从路侧人行道$ L_2^{{\text{ped}}} $进入$ L_3^{{\text{ped}}} $. 若2条路侧人行道直接相连(如$ L_2^{{\text{ped}}} $$ L_3^{{\text{ped}}} $),行人可在它们之间自由移动,无须任何等待. 如果行人从$ L_2^{{\text{ped}}} $进入$ L_5^{{\text{ped}}} $,必须等待信号灯激活并途经人行横道$ L_{11}^{{\text{ped}}} $.

1.2. 多智能体强化学习环境

1.2.1. 马尔科夫决策过程

为了实现CAVs、HDVs和行人安全、高效通过交叉口,将CAVs、HDVs和行人的博弈过程视为完全合作型MARL. CAVs和HDVs的决策通常依赖于局部观测信息,采用MARL方法解决此问题时,需引入Dec-POMDP. Dec-POMDP可表征为$ \left\langle {I,S,A,P,R,O,\gamma } \right\rangle $. $ I $表示所有参与决策的多智能体集合. $ S $为所有环境状态的集合,$ {s_t} \in S $$ t $时刻的环境状态. $ A $为所有联合动作集,$ {A_{i'}} $为智能体$ i' $可执行的动作集,$ a_t^{i'} \in A $表示$ t $时刻智能体$ i' $所执行的动作. $ P(\left. {s^{\prime} } \right|s,a) $为在联合动作$ a $下环境从状态$ s $转移到$ {s^{\prime}} $的概率:

$ P\left(\left. {s^{\prime} } \right|s,a\right) = \mathop \prod \limits_{i \in I}^{} {P_{i}}\left(\left. {s_i^{'}} \right|s,{a_i}\right). $

$ R $为环境的奖励函数,$ r(s,i',a) \in {\bf{R}} $为智能体$ i' $在状态$ s $下执行动作$ a $后,从环境获得的奖励值. $ \gamma \in [0,\left. {1.0} \right) $为折扣因子. $ O $为多智能体所有获得的观测集合. 在时间步$ t $,智能体$ i' $得到局部观测$ o_t^{i'} $,基于随机策略$ {\text{π}} _\theta ^{i'} $选择下一步将要执行的动作$ a_t^{i'} $. 所有智能体的策略组合成联合策略$ {\text{π}} = \left\{ {{\text{π}} ^1}, {{\text{π}} ^2}, \cdots , \right. \left.{{\text{π}} ^n} \right\} \in \varPi $,智能体i'状态值函数为

$ V_{i'}^{\text{π}} (s) = {E_{{\text{π}} ,P}}\left[ { \displaystyle \sum\limits_{t = 0}^\infty {{\gamma ^t}{R_{i'}}\left. {({s_t},{a_t},{s_{t+1}})} \right|{s_0} = s} } \right]. $

对于所有$ i' \in I $,存在$ V_{i'}^{({\text{π}} _{i'}^*,{\text{π}} _{ - i'}^*)}(s) \geqslant V_{i'}^{({{\text{π}} _{i'}},{\text{π}} _{ - i'}^*)}(s) $$ {\text{π}} _{ - i'}^* $表示其他智能体的最优策略.

基于上述理论建立的MARL过程如图2所示.

图 2

图 2   多智能体强化学习过程

Fig.2   Process of multi-agent reinforcement learning


1.2.2. MAPPO算法

PPO[16]相较于传统策略梯度方法,通过引入重要性采样评估新旧策略差异,采用裁剪机制约束策略更新幅度,有效缓解训练不稳定问题,同时确保学习性能. MAPPO算法将PPO的策略优化机制引入多智能体系统,能够在协作、竞争以及混合场景中实现更高效的策略学习[17]. MAPPO的核心特征在于在线策略(on-policy)学习范式,即直接利用当前策略实时交互产生的经验进行策略优化,它通常具有更高的稳定性和更低的估计偏差. 因MAPPO算法策略更新完全基于当前策略的数据,能更及时地响应环境动态变化,这一特性使MAPPO算法尤为适配自动驾驶控制. MAPPO算法的核心架构采用CTDE范式,框架如图3所示. 在该架构下,每个智能体维护独立的Actor网络,但共享一个中心化Critic网络. 在训练阶段,Critic网络基于全局状态$ {s_t} $和联合动作$ {a_t} $计算价值函数$ {V_\phi }({s_t}) $,通过整合全局信息提升价值估计的准确性;在执行阶段,各智能体仅依赖局部观测$ o_t^{i'} $和自身策略$ {\text{π}} _\theta ^{i'} $生成动作$ a_t^{i'} $,实现分布式决策. 在训练过程中,智能体与环境交互产生的状态转移数据存储至经验回放池$ D $中. 在每次训练迭代时,算法从池中采样数据并计算广义优势估计(generalized advantage estimation, GAE) $ {A_{i'}} $,进而更新网络参数:a) 策略网络更新:采用裁剪机制,通过约束策略更新比率的偏移范围,限制策略梯度幅度以稳定训练过程,输出裁剪函数$ L_{{\text{clip}}}^{i'} $;b) 价值网络更新:通过最小化价值函数的时序差分残差平方更新Critic参数.

图 3

图 3   MAPPO算法框架

Fig.3   Framework diagram of MAPPO algorithm


在时间步$ t $时,第$ i' $个智能体的状态价值函数和随机策略分别用$ {V_\phi }(s_t^{i'}) $$ \pi _\theta ^{i'} $表示,$ \phi $$ \theta $分别为价值网络和策略网络的参数. 该策略目标函数损失函数为

$ {L}_{\text{clip}}^{i{'}}\text{}(\theta )=-{E}_{t}\left[{\mathrm{min}}\left\{\begin{array}{l}{r}_{t}^{i{'}}\text{}(\theta ){A}_{t}^{i{'}},\\{\mathrm{clip}}\;({r}_{t}^{i{'}}\text{}(\theta ),1- \epsilon ,1+ \epsilon){A}_{t}^{i{'}}\end{array}\right\}\right]. $

策略的更新幅度为

$ r_t^{i'}(\theta ) = \frac{{{\pi} _\theta ^{i'}\left( {a_t^{i'}\mid s_t^{i'}} \right)}}{{{\pi} _{{\theta _{{\text{old}}}}}^{i'}\left( {a_t^{i'}\mid s_t^{i'}} \right)}}. $

式中:$ \pi _\theta ^{i'}\left( {a_t^{i'}\mid s_t^{i'}} \right) $为智能体$ i' $在当前策略参数$ \theta $下,于状态$ s_t^{i'} $执行动作 $ a_t^{i'} $的概率密度函数值,$ \pi _{{\theta _{{\text{old}}}}}^{i'} \left( {a_t^{i'}\mid s_t^{i'}} \right) $对应旧策略参数$ {\theta _{{\text{old}}}} $下的同名概率值. 为了实现策略更新步长的量化控制,引入裁剪函数$ {\mathrm{clip}}\;({r}_{t}^{i{'}}\text{}(\theta ), 1- \epsilon ,1+ \epsilon) $将比率$ r_t^{i'}(\theta ) $约束于区间内,超参数$ \epsilon $用于调节裁剪强度.

$ A_t^{i'} $$ t $时刻智能体$ i' $在策略$ {\text{π}} (t) $下的优势函数. 为了抑制策略更新过程中的梯度爆炸风险并保障优化稳定性,需对更新幅度实施双轨约束机制. 优势函数的标准化为

$ A_t^{i'} = \frac{{\delta _t^{i'} - {\mu _\delta }}}{{{\sigma _\delta }+\psi }}. $

式中:$ \delta _t^{i'} $为时序差分残差,$ {\mu _\delta } $$ {\sigma _\delta } $分别为残差序列的均值与标准差,$ \psi $为数值稳定性常数. 通过比较裁剪前后的策略比率与优势函数乘积,最终选取保守更新方向以平衡探索与利用性能.

$ \delta _t^{i'} = r_t^{i'}+\gamma {V_\phi }(s_{t+1}^{i'}) - {V_\phi }(s_t^{i'}).{\text{ }} $

式中:$ {V_\phi }(s_t^{i'}) $为参数化价值网络(参数为$ \phi $)对智能体$ i' $$ t $时刻状态$ s_t^{i'} $的期望累积回报估计.

$ {V_\phi }(s_t^{i'}) = {E_{\text{π}} }\left[ {\sum\limits_{k = 0}^\infty {{\gamma ^k}} r_{t+k}^{i'}\mid {s_t} = s_t^{i'}} \right].{\text{ }} $

式中:$ r_t^{i'} $为智能体 $ i' $$ t $时刻的即时奖励;$ r_{t+k}^{i'} $$ t+k $时刻的即时奖励;$ \gamma \in \left[ {0,1.0} \right) $为折扣因子,用于量化未来奖励的时间衰减效应;$ {E_{\text{π}} } $为基于策略$ {\text{π}} $的数学期望算子.

策略优化过程采用裁剪式目标函数进行参数更新,裁剪式目标函数核心机制是通过最小化负向策略损失实现策略改进. 策略网络参数$ \theta $的更新梯度为

$ \Delta \theta = \dfrac{1}{B} \displaystyle \sum\limits_{i' = 1}^B {{\nabla _\theta }} \left( - L_{{\text{clip}}}^{i'}(\theta )\right).{\text{ }} $

式中:B为训练批次大小,表征单次参数更新所使用的样本数量.

对于价值网络的优化,采用均方误差损失函数衡量价值预测偏差:

$ L_{{\text{critic}}}^{i'}(\phi ) = \frac{1}{2}{\left( {{V_\phi }(s_t^{i'}) - R_t^{i'}} \right)^2}. $

该损失函数的优化目标为最小化状态价值估计$ {V_\phi }(s_t^{i'}) $与目标回报$ R_t^{i'} $之间的偏差,从而提升累积奖励估计精度. 价值网络参数$ \phi $的更新梯度为

$ \Delta \phi = \frac{1}{B}\sum\limits_{i = 1}^B {{\nabla _\phi }} L_{{\text{critic}}}^{i'}(\phi ). $

MAPPO算法中单个智能体的完整训练流程如图4所示.

图 4

图 4   MAPPO算法中第$ i' $个智能体的训练回合

Fig.4   Training episode of $ i' $th agent in MAPPO algorithm


1.3. MPC算法

图1所示,每个移动路径$ \left( {i,j} \right) $上的交通流均对应1个交通信号,$ {p_{\text{h}}}(i,j) $表示该路径上的交通流的信号灯状态. $ {p_{\text{h}}}(i,j) = 1 $表示绿灯;$ {p_{\text{h}}}(i,j) = 0 $表示红灯. 相位$ {P_{\text{h}}} = \left\{ {\left. {(i,j)} \right|{p_{\text{h}}}(i,j) = 1,i \in {L_{{\text{in}}}},j \in {L_{{\text{out}}}}} \right\} $. 图1交叉口信号控制方案包括以下4个相位.

0 东-西直行:东西直行车流和行人通行;

1 南-北直行:南北直行车流和行人通行;

2 东-西左转:东西左转车流,行人不通行;

3 南-北左转:南北左转车流,行人不通行.

MPC定义每个移动路径的压强为进口道与出口道车辆数量的差:

$ {w_{ij}}(t) = {x_i}(t) - {x_j}(t). $

式中:在$ t $时刻,$ {x_i}(t) $为进口道$ i $上的车辆数,$ {x_j}(t) $为出口道$ j $上的车辆数.

每次切换相位调整至最大压强的移动路径所对应的相位,即

${S^*}(t) = \arg \mathop {\max }\limits_{} \left\{ { \displaystyle \sum\limits_{(i,j) \in M} {{w_{ij}}} } \right\}.$

$ {S^*}(t) $表示相位方案. 交叉口总压强为

$ {P_{\text{r}}} = \left| {\sum\limits_{(i,j) \in M} {{w_{ij}}} (t)} \right|.{\text{ }} $

时刻$ t $,交叉口智能体$ i' $观测环境状态$ o_t^{i'} $,包括各进口道和出口道的车辆数量与信号相位.

MPC的核心目标是优先释放最大压强对应的交通流,以此降低交叉口的总压强$ {P_{\text{r}}} $,为了将这一目标融入强化学习框架,智能体的目标是执行最优动作(即选择最优相位),即将$ - {P_{\text{r}}} $奖励最大化. 作为信号灯智能体奖励函数的主体项,引导智能体选择能降低交叉口总压强的相位方案.

2. MAPPO-MPC控制方法构建

2.1. 协同控制方法框架

图5是新提出的混行交叉口协同控制框架. 本框架将HDVs和信号灯作为协同智能体,与CAVs进行联合决策规划. 利用仿真软件生成多智能体交互轨迹数据并存储至经验回放池;通过经验数据,迭代训练Actor-Critic网络. 设计融合多维优化目标的奖励函数,包括安全性(最小化碰撞风险)、通行效率(最小化交叉口压强)、交通规则依从性,并引入折扣因子以平衡即时奖励与长期收益.

图 5

图 5   混行交叉口管理方法框架图

Fig.5   Framework diagram for mixed-traffic intersections management


2.2. 状态空间设计

针对异构智能体类型CAVs、HDVs与交通信号灯,分别设计集中式评论家网络. 在训练阶段,利用全局信息进行价值评估.

a) CAVs智能体评论家输入状态:包含车辆本身位置、航向、速度、车道、信号灯状态,以及感知范围内车辆的信息等,构成36维状态向量.

b) HDVs智能体评论家输入状态:包含车辆本身位置、速度、车道、信号灯状态,以及紧邻前/后车的位置与速度等,构成9维状态向量.

c) 交通灯(traffic light, TL)智能体评论家输入状态:交叉口的拓扑坐标、当前相位时序、各进口道和出口道车辆数量及平均速度等,构成20维状态向量.

为了克服传统MARL中因传感器视场限制或动态遮挡导致的局部可观测性问题,在执行阶段引入感知扩展机制,为目标CAV智能体实时采集感知范围内多辆邻车的高精度状态向量,构建局部环境的增强观测表征. 决策生成后,系统将目标CAV的关键决策指令广播至协同车辆,使CAV能够依据全局协同优化目标动态调整局部策略. 在执行过程中:

a) CAVs智能体基于状态向量,实时输出离散动作指令(如加速度、转向角);

b) HDVs智能体基于状态向量,实时输出离散动作指令(如基于IDM的加速度);

c) TL智能体基于状态向量,实时输出离散动作指令(如相位切换和时长增减).

该状态空间与执行机制设计旨在使CAVs更有效地建模周边参与者的行为意图,HDVs智能体观测周边交通条件,交通灯则可更精确地捕捉交叉口各进口道车辆状态特征.

2.3. 动作空间设计

表1为车辆智能体与交通信号灯智能体的离散动作集. CAVs智能体的动作空间维度为21,其动作输出对应于1组离散的目标速度指令集(范围:0 ~40 m/s,离散间隔:2 m/s),车辆通过约束加速度实现速度指令间的平滑过渡. HDVs智能体根据智能驾驶员‌模型(intelligent driver model,IDM)和输入状态,实时计算下一个时刻的动作(加速度),实现平滑过渡. TL智能体采用3维离散动作空间,包含3种相位控制策略:维持当前相位、按预设顺序切换至下一个相位、基于实时检测赋予最大压强车道通行优先权. 具体的动作参数定义详见表1.

表 1   动作空间参数表

Tab.1  Action space parameter list

智能体动作控制参数描述
CAVs0~20目标速度[0,2,···,40] m/s离散速度档位动态调整加速度
TL0相位保持维持或调整当前绿灯相位时长
1相位顺序切换按预设顺序切换至下一相位
2相位优先切换激活最大压强车道的绿灯相位
HDVs0~4IDM计算的加速度车速保持、加速、减速等动态调整

新窗口打开| 下载CSV


2.4. 奖励函数设计

在奖励函数设计上,CAVs以防御性驾驶为主,侧重安全性和通行效率的平衡. 奖励函数构建以目标导向与安全约束为核心框架,加入防御性驾驶奖励,CAVs智能体的奖励函数为

$ \begin{split}& {R_{{\text{CAV}}}}(t) = {w_{\mathrm{s}}} \cdot {R_{{\text{safety}}}}(t)+{w_{\mathrm{e}}} \cdot {R_{{\text{efficiency}}}}(t)+\\& \quad {w_{\mathrm{r}}} \cdot {R_{{\text{rule}}}}(t)+{w_{\mathrm{c}}} \cdot {R_{{\text{comfort}}}}(t)+{w_{\mathrm{p}}} \cdot {R_{{\text{ped}}}}(t)+ \\& \quad {w_{\mathrm{l}}} \cdot {R_{{\text{light}}}}(t)+{w_{{\mathrm{co}}}} \cdot {R_{{\text{coop}}}}(t).\end{split} $

式中:$ {w}_{{\mathrm{s}}},{w}_{{\mathrm{e}}},{w}_{{\mathrm{r}}},{w}_{{\mathrm{c}}},{w}_{{\mathrm{p}}},{w}_{{\mathrm{l}}},{w}_{{\mathrm{co}}} $为CAVs智能体的各奖励项的权重系数;$ {R_{{\text{safety}}}}(t) $为CAVs智能体的安全奖励,考虑与其他车辆和行人的碰撞避免;$ {R_{{\text{efficiency}}}}(t) $为CAVs智能体的效率奖励,鼓励车辆高效行驶;$ {R_{{\text{rule}}}}(t) $为CAVs智能体的规则遵守奖励,鼓励遵守交通规则,如车道保持、信号灯;$ {R_{{\text{comfort}}}}(t) $为CAVs智能体的舒适性奖励,减少急加速、急刹车和急转向;$ {R_{{\text{ped}}}}(t) $为CAVs智能体与行人的交互奖励,与行人安全交互;$ {R_{{\text{light}}}}(t) $为CAVs智能体与信号灯交互奖励,奖励对信号灯的响应;$ {R_{{\text{coop}}}}(t) $为CAVs智能体间的协同奖励,奖励与其他智能体的协同.

$ \begin{split}& {R_{{\text{safety}}}}(t) = \left\{ {\begin{array}{*{20}{l}} { - {C_{{\text{col}}}}},&{{\text{if collision}}} \\ 0,&{{\text{otherwise}}} \end{array}} \right. +\\& \quad \displaystyle \sum\limits_{i'' = 1}^{{N_{\text{v}}}} {\left\{ {\begin{array}{*{20}{l}} { - \dfrac{{{k_{{\text{dist}}}}}}{{{{({d_{i''}} - {d_{{\text{min}}}}+\zeta )}^2}}}},&{{\text{if }}{d_{i''}} \lt {d_{{\text{safe}}}}} \\ 0,&{{\text{otherwise}}} \end{array}} \right.} + \\& \quad \displaystyle \sum\limits_{j'' = 1}^{{N_{\text{p}}}} {\left\{ {\begin{array}{*{20}{l}} { - \dfrac{{{k_{{\text{ped}}}}}}{{{{({d_{j''}} - {d_{{\text{ped\_min}}}})}^3}}}},&{{\text{if }}{d_{j''}} \lt {d_{{\text{ped\_safe}}}}} \\ 0,&{{\text{otherwise}}}. \end{array}} \right.} \end{split}$

式中:$ {C_{{\text{col}}}} $为碰撞惩罚,$ {N_{\text{v}}} $为CAVs检测范围内的所有车辆数量,$ {k_{{\text{dist}}}} $为车辆距离惩罚系数,$ {d_{{\text{safe}}}} $为车辆安全距离,$ {d_{i''}} $为车本身与检测范围内其他车辆$ {i^{''}} $之间的距离,$ {d_{{\text{min}}}} $为最小车辆距离,$ {N_{\text{p}}} $为CAVs检测范围内所有行人数量,$ \zeta $为平滑因子,$ {k_{{\text{ped}}}} $为行人距离惩罚系数,$ {d_{{\text{ped\_safe}}}} $为行人安全距离,$ {d_{j''}} $为车辆本身与检测范围内其他行人$ {j^{''}} $之间的距离,$ {d_{{\text{ped\_min}}}} $为最小行人距离.

$ \begin{split} {R_{{\text{efficiency}}}}(t) =& {k_v} \cdot \min\; (v,{v_{{\text{target}}}})+{k_{_{{\text{prog}}}}} \cdot \Delta s -\\& {k_{{\text{idle}}}} \cdot I_{v \lt {v_{\min }}}^{'}+{k_{{\text{route}}}} \cdot (1 - {d_{{\text{remaining}}}}/{d_{\text{total}}}).\end{split}$

式中:$ {k_v} $为速度奖励系数,$ v $为车辆本身当前速度;$ {v_{{\text{target}}}} $为道路限速;$ {k_{{\text{idle}}}} $为怠速惩罚系数;$ I_{v \lt {v_{\min }}}^{'} $为怠速指示器,取值为1或0;$ {k_{_{{\text{prog}}}}} $为进度奖励系数;$ \Delta s $为时间步内行驶距离;$ {v_{\min }} $为最低速度;$ {k_{{\text{route}}}} $为路径奖励系数;$ {d_{{\text{remaining}}}} $为剩余路径长度;$ {d_{\mathrm{total}}} $为总路径长度.

$ \begin{split} {R_{{\text{rule}}}}(t) =& - {k_{{\text{lane}}}} \cdot |y - {y_{{\text{center}}}}|+{k_{{\text{signal}}}} \cdot I_{{\text{signal-match}}}^{'} -\\& {k_{{\text{illegal}}}} \cdot I_{{\text{illegal-maneuver}}}^{'}. \end{split}$

式中:$ {k_{{\text{lane}}}} $为车道偏离惩罚;$ y $为车辆横向位置;$ {y_{{\text{center}}}} $为车道中心;$ {k_{{\text{signal}}}} $为转向灯一致性奖励;$ I_{{\text{signal-match}}}^{'} $为转向灯与行为一致指示,取值为1或0;$ {k_{{\text{illegal}}}} $为非法操作惩罚;$ I_{{\text{illegal-maneuver}}}^{'} $为非法操作指示,取值为1或0.

$ \begin{split} {R_{{\text{comfort}}}}(t) =& - {k_{{\text{acc}}}} \cdot \max\;(0,|a| - {a_{\mathrm{th}}}) - \\& {k_{{\text{jerk}}}} \cdot |{\mathrm{jerk}}| - {k_\delta } \cdot |\delta /{\delta _{\max }}|.\end{split}$

式中:$ {k_{{\text{acc}}}} $为加速度惩罚系数,$ a $为自车当前加速度,$ {a_{{\mathrm{th}}}} $为加速度阈值,$ {k_{{\text{jerk}}}} $为加速度惩罚系数,jerk为加速度增量,$ {k_\delta } $为转向惩罚系数,$ \delta $为方向盘转角,$ {\delta _{\max }} $为最大方向盘转角.

$ \begin{split} {R_{{\text{light}}}}(t) =& \left\{ {\begin{array}{*{20}{l}} { - {C_{{\text{red}}}}{{\mathrm{e}}^{v/{v_{{\mathrm{max}}}}}}},&{{\text{if red violation}}} \\ {{k_{{\text{green}}}}\min \;(v,{v_{{\text{lim}}}})},&{{\text{if green pass}}} \\ { - {k_{{\text{yellow}}}}|a|},&{{\text{if yellow hard accel}}} \\ 0,&{{\text{otherwise}}} \end{array}} \right. + \\& {k_{{\text{antic}}}}\left(1 - \dfrac{{{t_{{\text{rem}}}}}}{{{t_{{\text{total}}}}}}\right) - {k_{{\text{sudden}}}}|a|. \\[-5pt]\end{split} $

式中:$ {C_{{\text{red}}}} $为闯红灯惩罚,$ {v_{\max }} $为最大速度,$ {k_{{\text{green}}}} $表示绿灯通行奖励系数,$ {v_{{\text{lim}}}} $为道路限速,$ {k_{{\text{yellow}}}} $为黄灯急加速惩罚,$ {k_{{\text{antic}}}} $为信号预判奖励系数,$ {t_{{\text{rem}}}} $为信号灯剩余时间,$ {t_{{\text{total}}}} $为对应信号时长,$ {k_{{\text{sudden}}}} $为突然变速惩罚系数.

$ \begin{split} &{R_{{\text{ped}}}}(t) = \left\{ {\begin{array}{*{20}{l}} { - {C_{{\text{ped}}}}},&{{\text{if hit pedestrian}}} \\ 0,&{{\text{otherwise}}} \end{array}} \right.+{k_{{\text{yield}}}}I_{{\text{yield}}}^{'} - \\ &\quad {k_{{\text{honk}}}}I_{{\text{honk}}}^{'} + {k_{{\text{pred}}}}\exp \left[ { - {{\left( {\dfrac{{{d_{{\text{ped\_cross}}}} - {d_{{\text{cross\_safe}}}}}}{\sigma }} \right)}^2}} \right]. \end{split} $

式中:$ {C_{{\text{ped}}}} $为碰撞行人惩罚;$ {k_{{\text{yield}}}} $为礼让行人奖励;$ I_{{\text{yield}}}^{'} $为是否让行指示,取值为1或0;$ {k_{{\text{honk}}}} $为鸣笛惩罚;$ I_{{\text{honk}}}^{'} $为是否鸣笛指示,取值为1或0;$ {k_{{\text{pred}}}} $为行人过街预测奖励系数;$ {d_{{\text{ped\_cross}}}} $为行人过街距离;$ {d_{{\text{cross\_safe}}}} $为安全过街距离;$\sigma $为尺度参数,控制着奖励随距离偏差衰减的速率.

$ \begin{split}& {R_{{\text{coop}}}}(t) = {k_{{\text{v2x}}}} \cdot I_{{\text{V2x - success}}}^{'}+{k_{{\text{cross}}}} \cdot I_{{\text{cross}}}^{'} - \\& \quad {k_{{\text{block}}}} \cdot I_{{\text{block - crosswalk}}}^{'}+{k_{{\text{flow}}}} \cdot (1 - |{v_{{\text{avg}}}} - {v_{{\text{t}}\arg {\text{et}}}}|/{v_{{\text{t}}\arg {\text{et}}}}).\end{split} $

式中:$ {k_{{\text{v2x}}}} $为车辆与任何事物的联系V2X协同成功奖励;$ I_{{\text{V2x - success}}}^{'} $为V2X协同成功指示,取值为1或0;$ {k_{{\text{cross}}}} $为行人通行奖励;$ I_{{\text{cross}}}^{'} $为行人是否成功指示,取值为1或0;$ {k_{{\text{block}}}} $为阻挡斑马线惩罚;$ I_{{\text{block - crosswalk}}}^{'} $为阻挡斑马线指示,取值为1或0;$ {k_{{\text{flow}}}} $为车流匹配奖励系数;$ {v_{{\text{avg}}}} $为平均速度.

HDVs的奖励函数须设计得更为灵活,应考虑驾驶员个体特征,例如对激进型驾驶员可设置较低的碰撞惩罚系数. 同时应引入视野局限奖励,使激进型驾驶员只关注前方范围内的车辆与行人. HDVs与CAVs既存在共同奖励项(如车道保持,但对CAVs需更严格),也存在差异:CAVs须强化交通规则遵守(如红灯停),HDVs可引入“侥幸心理”奖励,例如轻微超速未被捕获时给予正收益. HDVs的奖励函数可通过与CAVs共享结构但差异化参数来实现:

$\begin{split} & {R_{{\text{HDV}}}}(t) = {w_{{\mathrm{s}}'}} \cdot {R_{{\text{safety}}'}}(t)+{w_{{\mathrm{e}}'}} \cdot {R_{{\text{efficiency}}'}}(t)+ \\ & \quad {w_{{\mathrm{c}}'}} \cdot {R_{{\text{comfort}}'}}(t)+{w_{{\mathrm{p}}'}} \cdot {R_{{\text{ped}}'}}(t)+\\ & \quad {w_{{\mathrm{l}}'}} \cdot {R_{{\text{light}}'}}(t)+{w_{\mathrm{h}}} \cdot {R_{{\text{human}}}}(t). \end{split}$

式中:$ {w_{{\mathrm{s}}'}}、{w_{{\mathrm{e}}'}}、{w_{{\mathrm{c}}'}}、{w_{{\mathrm{p}}'}}、{w_{{\mathrm{l}}'}}、{w_{\mathrm{h}}} $为HDVs奖励函数的各奖励项权重系数,$ {R_{{\text{safety}}'}}(t) $为HDVs奖励函数的安全奖励,$ {R_{{\text{efficiency}}'}}(t) $为效率权重,$ {R_{{\text{comfort}}'}}(t) $为舒适性奖励,$ {R_{{\text{ped}}'}}(t) $为行人交互奖励,$ {R_{{\text{light}}'}}(t) $为信号灯交互奖励,$ {R_{{\text{human}}}}(t) $为HDVs人类特性奖励.

$ \begin{split}& {R_{{\text{safet}}{{\text{y}}^\prime }}}(t) = \left\{ {\begin{array}{*{20}{l}} { - {C_{{\text{co}}{{\text{l}}^\prime }}}},&{{\text{if collision}}} \\ 0,&{{\text{otherwise}}} \end{array}} \right. + \\& \quad \displaystyle \sum\limits_{i \in {\text{VisibleVehicles}}} {\left\{ {\begin{array}{*{20}{l}} { - \dfrac{{{k_{{\text{dis}}{{\text{t}}^\prime }}}}}{{{{({d_i} - {d_{{{\min }^\prime }}}+\varepsilon )}^2}}}},& {{\text{if }}{d_i} \lt {d_{{\text{saf}}{{\text{e}}^\prime }}}}\\ 0,& {{\text{otherwise}}}. \end{array}} \right.} \end{split} $

式中:$ {C_{{\text{co}}{{\text{l}}^\prime }}} $为碰撞惩罚,$ {k_{{\text{dis}}{{\text{t}}^\prime }}} $为车辆距离惩罚系数,$ {d_i} $为自车与可视范围内的车辆$ i $的距离,$ {d_{{\text{saf}}{{\text{e}}^\prime }}} $为车辆安全距离,$ {d_{{{\min }^\prime }}} $为最小车辆距离,$ \varepsilon $为平滑因子.

$ \begin{split}&{R_{{\text{efficienc}}{{\text{y}}^\prime }}}(t) = {k_{v'}} \cdot \min (v,{v_{{\text{pref}}}})+{k_{{\text{pro}}{{\text{g}}^\prime }}} \cdot \Delta s -\\& \quad {k_{{\text{delay}}}} \cdot I_{v \lt ({v_{{\text{pref}}}} - 5)}^{'} - {k_{{\text{detour}}}} \cdot \left| {{d_{{\text{traveled}}}} - {d_{{\text{shortest}}}}} \right|. \end{split} $

式中:$ {k_{v'}} $为速度奖励系数,$ {v_{{\text{pref}}}} $为偏好速度,$ {k_{{\text{pro}}{{\text{g}}^\prime }}} $为进度奖励系数,$ {k_{{\text{delay}}}} $为延误惩罚系数,$ {k_{{\text{detour}}}} $为绕行惩罚系数,$ {d_{{\text{traveled}}}} $为已行驶距离,$ {d_{{\text{shortest}}}} $为最短路径距离.

$ \begin{split}& {R_{{\text{comfor}}{{\text{t}}^\prime }}}(t) = - k_{{\text{acc}}}^{'} \cdot \max \left( {0,\left| a \right| - {a_{{\text{t}}{{\text{h}}^\prime }}}} \right)- \\& \quad k_{{\text{jerk}}}^{'} \cdot \left| {{\text{jerk}}} \right| - {k_{\delta '}} \cdot \left| {\frac{\delta }{{{\delta _{\max }}}}} \right|. \end{split} $

式中:$ k_{{\text{acc}}}^{'} $为加速度惩罚系数,$ {a_{{\text{t}}{{\text{h}}^\prime }}} $为加速度阈值,$ k_{{\text{jerk}}}^{'} $为加速度惩罚系数,$ {k_{\delta '}} $为转向惩罚系数.

$ \begin{split}& {R_{{\text{pe}}{{\text{d}}^\prime }}}(t) = \left\{ {\begin{array}{*{20}{l}} { - {C_{{\text{pe}}{{\text{d}}^\prime }}}},&{{\text{if hit pedestrian}}} \\ 0,&{{\text{otherwise}}} \end{array}} \right. + \\& \quad \left\{ {\begin{array}{*{20}{l}} {-{k_{{\text{hon}}{{\text{k}}^\prime }}} \cdot I_{{\text{honk}}}^{'}},&{{\text{if honk at pedestrian}}} \\ 0,&{{\text{otherwise}}} \end{array}} \right. + \\&\quad{k_{{\text{ped}} - {\text{avoid}}}} \cdot I_{{\text{avoid}} - {\text{ped}}}^{'}.\end{split} $

式中:$ {C_{{\text{pe}}{{\text{d}}^\prime }}} $为碰撞行人惩罚;$ {k_{{\text{hon}}{{\text{k}}^\prime }}} $为鸣笛惩罚;$ I_{{\text{honk}}}^{'} $为是否鸣笛指示,取值为0或1;$ {k_{{\text{ped}} - {\text{avoid}}}} $为避让行人奖励;$ I_{{\text{avoid-ped}}}^{'} $为是否让行行人指示,取值为1或0.

$ \begin{split}& {R_{{\text{ligh}}{{\text{t}}^\prime }}}(t) = \\& \quad \left\{ {\begin{array}{*{20}{l}} { - {C_{{\text{re}}{{\text{d}}^\prime }}} \cdot \left( {1+\dfrac{v}{{{v_{\max }}}}} \right)},&{{\text{if run red light}}} ;\\ {{k_{{\text{gree}}{{\text{n}}^\prime }}} \cdot v},&{{\text{if pass on green}}} ;\\ { - {k_{{\text{sudde}}{{\text{n}}^\prime }}} \cdot |a|},&{{\text{if sudden brake on yellow}}} ;\\ 0,&{{\text{otherwise}}} .\end{array}} \right.\end{split} $

式中:$ {C_{{\text{re}}{{\text{d}}^\prime }}} $为闯红灯惩罚基数,$ {k_{{\text{gree}}{{\text{n}}^\prime }}} $为绿灯通行奖励系数,$ {k_{{\text{sudde}}{{\text{n}}^\prime }}} $为急刹车惩罚.

$ \begin{split}& {R_{{\text{human}}}}(t) = \lambda \left[ {{k_{{\text{run - yellow}}}}I_{{\text{run-yellow}}}^{'} - {k_{{\text{stop-green}}}}I_{{\text{stop-green}}}^{'}} \right]+ \\& \quad (1 - \lambda ){k_{{\text{honk-ped}}}}I_{{\text{honk-at-ped}}}^{'} - {k_{{\text{distract}}}}I_{{\text{distract}}}^{'}.\\[-1pt]\end{split} $

式中:$ {k_{{\text{run-yellow}}}} $为抢黄灯奖励;$ I_{{\text{run-yellow}}}^{'} $为抢黄灯指示,取值为1或0;$ {k_{{\text{stop-green}}}} $为绿灯不行驶惩罚;$ I_{{\text{stop-green}}}^{'} $为绿灯停车指示,取值为1或0;$ {k_{{\text{honk-ped}}}} $为对行人鸣笛奖励;$ I_{{\text{honk-at-ped}}}^{'} $为对行人鸣笛指示;$ \lambda $为驾驶员类型参数(0~1之间,0代表保守,1代表激进);$ {k_{{\text{distract}}}} $为分心惩罚;$ I_{{\text{distract}}}^{'} $为分心指示,取值为1或0.

TL智能体的奖励函数以优化$ {P_N} $为目标,同时引入相位切换惩罚机制,约束频繁切换相位以避免短周期切换导致的交通混乱:

$ {R_{{\text{traffic - light}}}} = - {w_{\Pr }}{P_{\text{r}}} - {w_{{\text{phase - change}}}}I_{{\text{phase - change}}}^{'}. $

式中:$ {w_{\Pr }}、{w_{{\text{phase-change}}}} $为TL各项权重系数;$ I_{{\text{phase-change}}}^{'} $为相位切换指示函数,取值为1或0.

作为对比,同时设计以通行效率最优为目标的传统奖励函数(用于MAPPO和MADDPG),通过高流量疏散奖励来激励信号灯动态调整配时,增强交通流疏散能力. 为了量化控制效果,将排队长度和总等待时间作为负向惩罚项,并引入相位切换惩罚,以抑制频繁切换、保持控制稳定性. TL智能体的传统奖励函数为

$ \begin{split}& R_{{\text{traffic - light}}}^{'} = {w_{{\text{throughput}}}}{n_{{\text{throughput}}}}+{w_{{\text{emergency}}}}{\varepsilon _{{\text{emergency}}}}- \\& {w_{{\text{queue}}}}{n_{{\text{queue}}}} - {w_{{\text{wait}}}}{t_{{\text{wait}}}} - w_{{\text{phase - change}}}^{'}I_{{\text{phase-change}}}^{'}.\\[-3pt]\end{split} $

式中:$ {w}_{\text{throughput}}、 {w}_{\text{emergency}}、 {w}_{\text{queue}}、 {w}_{\text{wait}}、 {w}_{\text{phase-change}}^{{'}} $为各奖励项的权重系数;$ {n_{{\text{throughput}}}} $为通过车辆总数;$ {\varepsilon _{{\text{emergency}}}} $为紧急车辆优先通行调节系数;$ {n_{{\text{queue}}}} $为所有控制车道的排队车辆总数;$ {t_{{\text{wait}}}} $为所有车道的总等待时间;$ I_{{\text{phase - change}}}^{'} $为相位切换指示函数,切换时为1,否则为0.

3. 仿真设置

3.1. 仿真条件设置

采用 Python 3.10 和 PyTorch 框架实现多智能体强化学习算法,基于SUMO微观交通仿真平台构建可配置道路拓扑、信号方案与交通流参数的仿真环境. 该环境通过内置跟驰与换道模型,生成符合现实交通特征的动态交互场景,如图6所示. 利用TraCI接口实现SUMO与MARL算法的实时交互,构建状态感知、决策与奖励反馈的闭环系统. 仿真环境包含CAVs、HDVs、行人及信号灯,以增强真实性. 分别基于MAPPO-MPC算法,CAVs通过输出加减速指令实现碰撞避免;HDVs通过输出跟驰参数实现协同行驶;TL通过动态调整信号相位以优化交叉口压强,所有基线模型(Webster、MADDPG、MAPPO、MADDPG-MPC)均在相同仿真环境(场景为典型十字混行交叉口,各进口道与出口道均设3条车道,宽3.5 m,长500 m,人行横道尺寸为21 m×6 m)下运行. 初始信号配时由Webster方法生成,黄灯时长3 s,全红时长1 s. 具体信号配时如表2所示.车辆与行人随机进入场景,交通需求按低、中、高3种流量条件设置,具体数值见表3.

图 6

图 6   混行信号控制交叉口仿真场景

Fig.6   Simulation scenario of mixed signalized intersection


表 2   交叉口基础信号配时

Tab.2  Intersection basic signal timing

场景周期/st/s
东西直行东西左转南北直行南北左转
低流量7222 +424 +438 +440 +4
中流量10536 +439 +444 +447 +4
高流量13042 +445 +450 +453 +4

新窗口打开| 下载CSV


表 3   交叉口交通流量

Tab.3  Traffic flow at intersections

流量密度EE
(veh·h−1)
SE
(veh·h−1)
WE
(veh·h−1)
NE
(veh·h−1)
NP
(per·h−1)
360650380575200
81011408901120400
995153010801580600

新窗口打开| 下载CSV


3.2. 模型参数设置

所有模型参数的设置均基于深度强化学习通用准则、交通控制领域先验知识,并结合初步实验结果与已有研究成果[7,16-17]的系统对比与分析而最终确定,核心目标是平衡算法探索与利用能力、保障训练稳定性,并确保模型在不同交通流量与CAV渗透率条件下实现高效、安全的协同控制. 关键参数包括:强化学习超参数(如学习率、折扣因子、广义优势估计(generalized advantage estimation,CAE)参数和裁剪范围)依据PPO及多智能体扩展MAPPO的标准设置,以兼顾收敛速度和训练稳健性;奖励函数权重通过网格搜索和调优,赋予安全极高负奖励,同时统筹效率、舒适性及基于MPC的车流均衡优化,并引入人类驾驶行为以增强真实性;环境与物理参数则贴合仿真软件(simulation of urban mobility,SUMO)中IDM跟驰模型及实际传感器与法规要求. 所有参数经过敏感性测试与多轮实验验证,在低、中、高流量及不同渗透率场景中均表现出良好的鲁棒性与泛化能力(19000回合训练),全面保障算法在混合交通环境中的收敛性、稳定性及控制效能. 为了保证对比的客观性,新模型、MADDPG-MPC、MADDPG和MAPPO均使用相同的强化学习超参数和环境与物理参数,奖励函数权重等模型根据模型差异分别进行设置. 详细的仿真参数如表4所示.

表 4   训练参数表

Tab.4  Description of training parameters

参数数值参数数值参数数值参数数值
$ {w_{\mathrm{s}}} $0.5$ {k_{{\text{acc}}}} $/(s2·m−1)0.1$ {k_{{\text{flow}}}} $0.1$ {C_{{\text{re}}{{\text{d}}^\prime }}} $40
$ {C_{{\text{col}}}} $−1 000$ {a_{{\text{th}}}} $/(m·s2)2$ {w_{{\mathrm{s}}'}} $0.4$ {k_{{\text{gree}}{{\text{n}}^\prime }}} $/(s·m−1)0.04
$ {k_{{\text{dist}}}} $/m−210$ {k_{{\text{jerk}}}} $/(s4·m−1)0.2$ {C_{{\text{co}}{{\text{l}}^\prime }}} $−1 000$ {k_{{\text{sudde}}{{\text{n}}^\prime }}} $/(s2·m−1)0.05
$ {d_{{\text{min}}}} $/m1$ {k_\delta } $0.05$ {k_{{\text{dis}}{{\text{t}}^\prime }}} $/m−25$ {w_{\mathrm{h}}} $0.15
$ \epsilon $/m0.1$ {\delta _{\max }} $/radπ/4$ {d_{{{\min }^\prime }}} $/m1$ \lambda $0.3
$ {k_{{\text{ped}}}} $/m−320$ {w_{\mathrm{p}}} $0.05$ {d_{{\text{saf}}{{\text{e}}^\prime }}} $/m1.5$ {k_{{\text{run - yellow}}}} $1
$ {d_{{\text{ped\_safe}}}} $/m3$ {C_{{\text{ped}}}} $−500$ {w_{{\mathrm{e}}'}} $0.3$ {k_{{\text{stop - green}}}} $0.5
$ {d_{{\text{ped\_min}}}} $/m0.5$ {k_{{\text{yield}}}} $5$ {k_{{\mathrm{v}}'}} $/(s·m−1)0.12$ {k_{{\text{honk - ped}}}} $0.3
$ {t_{{\text{react}}}} $/s1.5$ {k_{{\text{honk}}}} $1$ {v_{{\text{pref}}}} $/(m·s−1)限速×1.15$ {k_{{\text{distract}}}} $0.1
$ {d_0} $/m2$ {k_{{\text{pred}}}} $/m−20.5$ {k_{{\text{pro}}{{\text{g}}^\prime }}} $/m−10.01$ {w_{\Pr }} $1
$ {w_{\mathrm{e}}} $0.3$ {d_{{\text{cross\_safe}}}} $/m10$ {k_{{\text{delay}}}} $/s−10.02$ {w_{{\text{phase - change}}}} $0.5
$ {k_{\mathrm{v}}} $/(s·m−1)0.1$ {w_{\mathrm{l}}} $0.05$ {k_{{\text{detour}}}} $/m−10.001$ {w_{{\text{throughput}}}} $1.2
$ {v_{{\text{target}}}} $/(m·s−1)限速$ {C_{{\text{red}}}} $50$ {w_{{\mathrm{c}}'}} $0.05$ {w_{{\text{emergency}}}} $0.3
$ {k_{{\text{prog}}}} $/m−10.01$ {v_{\max }} $/(m·s−1)40$ k_{{\text{acc}}}^{'} $/(s2·m−1)0.05$ {w_{{\text{queue}}}} $0.8
$ {k_{{\text{idle}}}} $/s−10.05$ {k_{{\text{green}}}} $/(s·m−1)0.05$ {a_{{\text{t}}{{\text{h}}^\prime }}} $/(m·s−2)3$ {w_{{\text{wait}}}} $0.3
$ {v_{\min }} $/(m·s−1)2$ {v_{{\text{lim}}}} $/(m·s−1)限速$ k_{{\text{jerk}}}^{'} $/(s4·m−1)0.1$ w_{{\text{phase - change}}}^{'} $0.4
$ {k_{{\text{route}}}} $/ m−10.001$ {k_{{\text{yellow}}}} $/(s2·m−1)0.1$ {k_{\delta '}} $0.03$ \gamma $0.99
$ {w_{\mathrm{r}}} $0.1$ {k_{{\text{antic}}}} $0.2$ {w_{{\mathrm{p}}'}} $0.05学习率0.000 01
$ {k_{{\text{lane}}}} $/ m−10.1$ {w_{{\mathrm{co}}}} $0.05$ {C_{{\text{pe}}{{\text{d}}^\prime }}} $−500总训练回合数1 500
$ {k_{{\text{signal}}}} $0.5$ {k_{{\text{v2x}}}} $2$ {k_{{\text{hon}}{{\text{k}}^\prime }}} $0.5$ \epsilon $0.2
$ {k_{{\text{illegal}}}} $1$ {k_{{\text{cross}}}} $1$ {k_{{\text{ped}}\_{\text{avoid}}}} $2SGD迭代次数5
$ {w_{\mathrm{c}}} $0.05$ {k_{{\text{block}}}} $1$ {w_{{\mathrm{l}}'}} $0.05$ B $100

新窗口打开| 下载CSV


3.3. 有效性评估

选取平均排队长度、车均延误与吞吐量作为性能评估指标(measurement of effectiveness, MOE),用于比较不同混行交叉口协同控制方法在成功率、安全性和效率方面的表现.

1) 平均排队长度:指统计期内各车道车辆排队长度的平均值,值越小表明性能越好.

2) 车均延误:指统计期内总延误与总车辆数的比值,值越小代表通行效率越高.

3) 吞吐量:指单位时间内通过交叉口的车辆数.

4) 成功率、安全率与效率:

$ {B_{{\text{success}}}} = {N_{{\text{success}}}}/N, $

$ {B_{{\text{collision}}}} = {N_{{\text{collision}}}}/N, $

$ {B_{{\text{efficiency}}}} = ({N_{{\text{success}}}} - {N_{{\text{failure}}}})/T. $

式中:$ {B_{{\text{success}}}} $为成功率,$ {B_{{\text{collision}}}} $为碰撞率,$ {B_{{\text{efficiency}}}} $为效率,$ N $为车辆总数,$ {N_{{\text{success}}}} $为成功通过交叉口的车辆数,$ {N_{{\text{collision}}}} $为发生碰撞的车辆数,$ {N_{{\text{failure}}}} $为失败的车辆数,$ T $为总时间步.

4. 仿真结果分析

4.1. 模型性能对比分析

对4种模型进行仿真对比分析:MAPPO-MPC(基于MAPPO,奖励函数为交叉口总压强与相位切换,相位变化由MPC决定)、MAPPO(基于MAPPO,奖励函数为车辆总数、排队数、总等待时间与相位切换的加权,相位由排队长度决定)、MADDPG-MPC(基于MADDPG,奖励函数同MAPPO-MPC)以及MADDPG(基于MADDPG,奖励函数同MAPPO). 训练共进行19 000回合,每10回合保存1次数据. 图7展示了各回合所有智能体的平均奖励值随训练回合数的变化情况.

图 7

图 7   不同算法训练回合平均奖励值

Fig.7   Average reward value of training rounds for different algorithms


通过多因素方差分析及Tukey事后检验初步评估不同流量条件下4个模型的性能差异. 结果显示,p 是假设检验中用于衡量结果统计显著性的关键指标. 模型类型与流量条件对奖励值存在显著影响(p < 0.001),且交互作用显著(p < 0.001). MAPPO-MPC在所有流量环境下均表现最优,奖励值显著高于MAPPO与MADDPG(p < 0.001);MADDPG-MPC在低流量条件下与MAPPO-MPC无显著差异(p > 0.05),但在中、高流量环境下显著低于MAPPO-MPC(p < 0.01),仍显著优于MAPPO与MADDPG(p < 0.001).

图7可以看出,在奖励值R方面,MAPPO-MPC与MADDPG-MPC的整体表现优于MAPPO和MADDPG. 这主要得益于MPC机制的引入,将多智能体协同学习与交叉口全局交通状态感知相结合,使信号灯智能体在快速响应排队情况的同时,兼顾各方向交通流的均衡性,避免传统方法因过度优先某一排队方向而导致的其他流向通行能力下降问题,从而提升了系统整体协同效率和优化能力,获得更高奖励. 在收敛速度方面,MAPPO-MPC在低、中、高交通量下分别于5 000、7 500和8 000回合N左右趋于稳定,表现均优于其余方法;MADDPG-MPC因采用相同的奖励设置,收敛也优于MAPPO和MADDPG,表明以交叉口总压强和相位切换为核心的奖励设计有助于提高学习效率. 就稳定性而言,4种算法在收敛后波动均较小,其中MAPPO-MPC在整个训练过程中曲线最为平滑、波动最小.

此外,不同交通量对模型性能具有显著影响:低流量时各算法奖励值波动小、收敛快,MAPPO-MPC约在5 000回合收敛;中流量时奖励值降低、波动增大,收敛速度减慢,约在7 500回合稳定;高密度车流下,奖励值进一步降低,收敛更慢(约8 000回合),且波动显著增加,主要原因在于智能体数量增多、环境复杂性提高,导致策略学习难度加大,例如MADDPG直至12 000回合才逐渐收敛. 尽管如此,所有算法在高流量条件下仍最终实现收敛,体现出一定的鲁棒性.

为了全面评估新模型的性能,进一步对比多种算法在成功率、安全率与效率方面的表现. 如图8所示(图中结果以“均值±标准差”形式呈现),MPC算法的引入对2种基础算法(MAPPO和MADDPG)均带来显著性能提升与稳定性增强. MAPPO-MPC展现出最优的综合性能,在3种测试场景中的成功率(分别为93.23%±2.00%、90.85%±2.41%和85.5%±2.82%)和任务效率(91.48%±2.11%、89.25%±2.42%、84.2%±2.73%)均明显优于原始MAPPO (成功率:88.32%±3.75%、85.6%±4.12%、79%±4.41%;效率:85.24%±4.05%、82.4%±4.51%、77.5%±4.92%)及MADDPG系列模型,并始终保持最低的碰撞率(5.27%±1.13%、6.5%±1.42%、9.3%±2.04%). 尤为重要的是,MAPPO-MPC误差范围更小,表明多次实验结果一致,稳定性最佳. MADDPG-MPC的各项指标(如成功率:91.33%±2.55%、89.1%±3.12%、83.1%±3.54%)虽略低于MAPPO-MPC,但较基础MADDPG (成功率:85.16%±4.85%、82%±5.22%、75.2%±6.62%)有明显改善,尤其在降低碰撞率方面(7.76%±1.65%、9.05%±2.05%、12.2%±2.51% vs. 12.78%±2.71%、14.9%±3.33%、18.9%±3.51%)效果显著,且误差棒的缩短证实MPC有效地提升了MADDPG的策略稳定性.

图 8

图 8   模型成功率、安全率、效率和平均奖励值对比图

Fig.8   Comparison chart of model success rate, safety rate, efficiency, and average reward value


随着任务复杂度的增加(从左至右指标呈下降趋势),融合MPC的模型(MAPPO-MPC和MADDPG-MPC)均表现出更强的鲁棒性,性能衰减幅度明显小于对应基础模型,例如MAPPO-MPC的成功率仅下降了7.73%,而MAPPO下降了9.32%. 值得注意的是,在复杂场景中,基础算法的误差棒显著变宽,表明MAPPO性能出现较大波动且可靠性下降;相比之下,MAPPO-MPC的误差范围增长相对缓和,证明MAPPO卓越的鲁棒性和可重复性. 结果说明,MPC机制能够有效提升智能体的综合性能与策略输出的稳定性,显著改善长期累积奖励与系统安全性,该优势在不同算法架构(MAPPO与MADDPG)中均得到验证. MAPPO-MPC凭借其近端策略优化机制与MPC压强控制的有效结合,在复杂混行交通场景中表现出最稳定、最优异的任务完成效能.

4.2. 模型控制效果对比分析

图9所示,在不同渗透率$\rho $(10%~90%)条件下,协同控制模型相比基线模型(Webster)及主流模型(MADDPG-MPC、MAPPO与MADDPG)均展现出系统性的性能优势. 在效率方面,新模型在整个渗透率区间内持续提升交叉口吞吐量. 尤其在70%的高渗透率场景下,吞吐量VL增幅达12.8%~44.3%. 例如,在高流量条件下,渗透率$\rho $为70%时,吞吐量VL从基准的0.70 veh·s−1提升至1.01 veh·s−1,显著高于MADDPG-MPC、MAPPO和MADDPG所达到的0.88、0.82和0.76 veh·s−1.

图 9

图 9   交叉口车辆排队、延误和吞吐量对比图

Fig.9   Comparison of queuing, delay, and throughput at intersection


在缓解拥堵方面,新模型显著降低了平均排队长度Q',整体降幅为21.8%~49.3%. 以低流量场景中50%渗透率$\rho $为例,平均排队长度从34.0 m降至21.5 m,优于MADDPG-MPC (26.8 m)、MAPPO (29.6 m)和MADDPG (32.4 m)的结果. 在行程时间指标上,新模型对单车平均延误D'的优化尤为突出. 当渗透率达到90%时,在3种测试场景中延误分别减少了43.2% (85 s → 48.25 s)、36.3% (145 s → 92.4 s)和35.6% (195 s → 125.5 s). 这一降幅均明显高于对比模型,表现次优的MADDPG模型最优仅实现34.9%的延误降低.

值得注意的是,模型性能优势随着渗透率上升而持续扩大. 当渗透率低于30%时,各模型差异相对有限(例如在10%渗透率下,排队长度改善幅度仅为1.5%~7.4%);当渗透率超过50%后,新模型凭借协同决策机制与MPC控制的深度融合,展现出显著的边际收益,MAPPO-MPC行程时间指标较表现次优的MADDPG-MPC模型进一步降低了11.2%~18.1%. 对比模型虽然均能在一定程度上提升基准性能,但改善幅度呈阶梯式衰减:MADDPG-MPC平均可达新模型效果的75%~85%,MAPPO与MADDPG仅实现60%~70%的性能水平. 这一结果进一步表明,所提出的协同决策与MPC控制在混行环境中,特别是CAVs渗透率超过50%的场景中,具有关键作用与显著性能的优势.

表5系统对比不同CAVs渗透率与交通流量场景下,基准方案与4种强化学习算法(MAPPO-MPC、MADDPG-MPC、MAPPO、MADDPG)在行人控制方面的性能. 分析表明:所有强化学习算法在绝大多数场景中均显著优于基准方案,验证强化学习在混行交叉口协同控制中的有效性;融合最大压强控制(MPC)的混合架构算法(MAPPO-MPC与MADDPG-MPC)展现出整体最优性能,在低渗透率(10%~30%)与高渗透率(70%~90%)下的中低流量场景,以及全部渗透率下的高流量场景中,延迟降低效果均显著优于纯强化学习算法及基准方案. 以90%渗透率下的高流量场景为例,MAPPO-MPC将平均延迟从基准的56.7 s降至48.3 s,降幅达14.8%,优于MAPPO(53.0 s)和MADDPG(54.2 s). 该结果凸显MPC在提升交叉口车辆分布均衡性方面的重要作用,MPC显式压强优化机制有效增强了纯强化学习策略在高不确定性交通环境中的鲁棒性. 算法性能差异随渗透率与流量水平呈现非线性变化:在中低流量场景中,随着渗透率从10%升高至90%,所有算法的延迟普遍上升,集成MPC的算法始终保持更显著的优势;在高流量场景中,高渗透率(70%~90%)带来的复杂交互与不确定性加剧,导致所有方案的延迟急剧上升,混合架构算法(尤其是MAPPO-MPC)仍表现出最优的延误控制能力.

表 5   行人等待时间表

Tab.5  Pedestrian waiting time list

渗透率流量t/s
优化前MAPPO-
MPC
MADDPG-
MPC
MAPPOMADDPG
10%45.039.841.342.843.5
55.053.553.854.254.5
65.063.864.064.364.5
30%41.832.535.237.838.5
54.752.252.853.553.9
64.562.162.863.563.8
50%38.424.330.333.435.0
54.551.552.253.053.5
63.559.460.862.062.5
70%35.120.726.629.731.5
53.848.249.851.252.0
60.953.855.557.858.8
90%31.717.923.626.328.0
52.543.845.848.249.5
56.748.350.553.054.2

新窗口打开| 下载CSV


尽管纯强化学习算法(MAPPO与MADDPG)性能逊于混合架构,稳定优于基准方案,表明MAPPO和MADDPG具备一定的环境学习与优化能力. 融合MPC的混合强化学习架构(MAPPO-MPC与MADDPG-MPC)在应对不同渗透率与动态交通流时表现出卓越的综合性能与鲁棒性,尤其在渗透率高、流量大的复杂场景中优势显著. 这一方面体现MPC理论[7]与多智能体强化学习协同的先进性,另一方面也说明其具备在实际混行交叉口控制中推广应用的处理复杂交互与不确定性问题的能力.

5. 结 论

(1) 提出“MAPPO-MPC”分层协同架构,将CAVs运动控制、HDVs跟驰引导与信号灯相位分配统一建模为Dec-POMDP,突破传统方法中单一智能体决策的局限性;设计异构智能体状态-动作空间(CAV:36维状态+21维动作/HDV:9维状态+5维动作/信号灯:20维状态+3维动作),结合多目标奖励函数(安全性、效率性、规则依从性)等,实现跨模态智能体的策略协同优化.

(2) MAPPO-MPC方法显著提升了混行交叉口的综合性能:吞吐量最高提升了44.3%,平均排队长度降低了49.3%,车均延误减少了43.2%,行人等待时间缩短了43.5%. 当CAVs渗透率超过50%时,该模型表现出更显著的性能优势,印证协同控制在高CAVs渗透场景中的必要性. 在与传统Webster方法以及MADDPG-MPC、MADDPG和MAPPO等基线模型的对比中,MAPPO-MPC在多个方面均表现出最优性能,包括更快的收敛速度(低流量场景下仅需5 000回合即可收敛)、更高的稳定性(训练曲线波动最小)以及更强的鲁棒性(高流量下性能衰减幅度最低). 引入MPC机制有效地提升了交叉口内车辆分布的均衡性,避免传统信号控制中因偏向某一方向而导致的交通流失衡问题. 分层状态设计与多智能体协同决策机制显著地增强了系统在不同流量条件和渗透率下的高动态混行环境适应能力.

模型验证最大压强控制与多智能体强化的耦合机制可有效解决混行交叉口的“均衡-效率”矛盾,通过压强最小化实现交通流空间均衡分布,弥补传统信号优化中“绿灯时长-排队长度”局部优化的缺陷;尽管MAPPO-MMC方法在交叉口协同控制中展现出良好的性能,但该模型仍存在一定的局限性. 例如,当前研究尚未充分考虑高动态环境(如突发交通事故或极端天气)对系统性能的潜在影响,也未涉及CAVs与HDVs之间在通信延迟和感知误差等实际约束下的交互影响. 未来的工作除了将引入长短期记忆神经网络以增强模型对真实环境中通信延迟等不确定性的动态适应能力之外,还将进一步拓展至多交叉口自适应协同控制等复杂场景.

参考文献

WU J, HUANG Z, LV C

Uncertainty-aware model-based reinforcement learning: methodology and application in autonomous driving

[J]. IEEE Transactions on Intelligent Vehicles, 2022, 8 (1): 194- 203

[本文引用: 1]

KIRAN B R, SOBH I, TALPAERT V, et al

Deep reinforcement learning for autonomous driving: a survey

[J]. IEEE Transactions on Intelligent Transportation Systems, 2021, 23 (6): 1- 18

[本文引用: 1]

ZHAO Z, XUN J, WEN X, et al. Safe reinforcement learning for single train trajectory optimization via shield SARSA [J]. IEEE Transactions on Intelligent Transportation Systems, 24(1), 412–428.

[本文引用: 1]

罗彪, 胡天萌, 周育豪, 等

多智能体强化学习控制与决策研究综述

[J]. 自动化学报, 2025, 51 (3): 510- 539

DOI:10.16383/j.aas.c240392      [本文引用: 1]

LUO Biao, HU Tianmeng, ZHOU Yuhao, et al

Survey on multi-agent reinforcement learning for control and decision-making

[J]. Acta Automat Sin, 2025, 51 (3): 510- 539

DOI:10.16383/j.aas.c240392      [本文引用: 1]

PENG B, KESKIN M F, KULCSÁR B, et al

Connected autonomous vehicles for improving mixed traffic efficiency in unsignalized intersections with deep reinforcement learning

[J]. Communications in Transportation Research, 2021, 1 (1): 5- 17

[本文引用: 1]

许曼晨, 于镝, 赵理, 等

基于MAPPO的无信号灯交叉口自动驾驶决策

[J]. 吉林大学学报: 信息科学版, 2024, 42 (5): 790- 798

DOI:10.3969/j.issn.1671-5896.2024.05.003      [本文引用: 1]

XU Manchen, YU Di, ZHAO Li, et al

Autonomous driving decision-making at signal-free intersections based on MAPPO

[J]. Journal of Jilin University: Information Science Edition, 2024, 42 (5): 790- 798

DOI:10.3969/j.issn.1671-5896.2024.05.003      [本文引用: 1]

WEI H, CHEN C, ZHENG G, et al. Presslight: learning max pressure control to coordinate traffic signals in arterial network [C]// 2019 ACM 25th SIGKDD International Conference on Knowledge Discovery and Data Mining. Anchorage: ACM, 2019: 1290–1298.

[本文引用: 4]

BDEIR A, BOEDER S, DERNEDDE T, et al. RP-DQN: An application of Q-learning to vehicle routing problems [C]// German Conference on Artificial Intelligence. Cham: Springer, 2021: 3–16.

[本文引用: 1]

SHARIF A, MARIJAN D. Evaluating the robustness of deep reinforcement learning for autonomous policies in a multi-agent urban driving environment [C]// 2022 IEEE 22th International Conference on Software Quality, Reliability and Security. Guangzhou: IEEE, 2022: 785–796.

[本文引用: 1]

YU C, WANG X, XU X, et al

Distributed multiagent coordinated learning for autonomous driving in highways based on dynamic coordination graphs

[J]. IEEE Transactions on Intelligent Transportation Systems, 2020, 21 (2): 735- 748

DOI:10.1109/TITS.2019.2893683      [本文引用: 1]

孙彧, 曹雷, 陈希亮, 等

多智能体深度强化学习研究综述

[J]. 计算机工程与应用, 2020, 56 (5): 13- 24

[本文引用: 1]

SUN Yu, CAO Lei, CHEN Xiliang, et al

Overview of multi-agent deep reinforcement learning

[J]. Computer Engineering and Applications, 2020, 56 (5): 13- 24

[本文引用: 1]

ZHANG X, LI S, WANG B, et al. Multi-vehicle collaborative lane changing based on multi-agent reinforcement learning [C]// 2024 IEEE Intelligent Vehicles Symposium. Jeju Island: IEEE, 2024: 1214–1221.

[本文引用: 1]

ZHOU W, CHEN D, YAN J, et al

Multi-agent reinforcement learning for cooperative lane changing of connected and autonomous vehicles in mixed traffic

[J]. Autonomous Intelligent Systems, 2022, 2 (1): 1- 11

DOI:10.1007/s43684-021-00019-7      [本文引用: 1]

MATE K, BECSI T

Multi-agent reinforcement learning for highway platooning

[J]. Electronics, 2023, 12 (24): 1–13

[本文引用: 1]

SCHESTER L, ORTIZ L E. A systematic study of multi-agent deep reinforcement learning for safe and robust autonomous highway ramp entry [EB/OL]. [2025–01–17]. https://arxiv.org/pdf/2411.14593.

[本文引用: 1]

SCHULMAN J , WOLSKI F, Dhariwal P, et al. Proximal policy optimization algorithms [EB/OL]. [2025–07–10]. https://arxiv.org/pdf/1707.06347.

[本文引用: 3]

YU C, VELU A, VINITSKY E, et al

The surprising effectiveness of PPO in cooperative multi-agent games

[J]. Advances in Neural Information Processing Systems, 2021, 35: 24611- 24624

[本文引用: 3]

KRAEMER L, BANERJEE B

Multi-agent reinforcement learning as a rehearsal for decentralized planning

[J]. Neurocomputing, 2016, 190: 82- 94

DOI:10.1016/j.neucom.2016.01.031      [本文引用: 1]

MAMOND, A. W, KUNDROO, M, YOO, S. E, et al. FLDQN: cooperative multi-agent federated reinforcement learning for solving travel time minimization problems in dynamic environments using SUMO simulation [J]. Sensors, 25(3), 1–23.

[本文引用: 1]

/