基于混合空洞注意力机制的图卷积强化学习
Graph convolutional reinforcement learning via hybrid dilated attention mechanism
通讯作者:
收稿日期: 2025-08-17
| 基金资助: |
|
Received: 2025-08-17
| Fund supported: | 浙江省自然科学基金联合基金资助项目(LHZSD24F020001);国家自然科学基金资助项目(62306275,U20B2066);浙江大学上海高等研究院繁星科学基金资助项目(SN-ZJU-SIAS-001);中央高校基本科研业务费专项资金资助项目(226-2023-00048). |
作者简介 About authors
宋莉(1991—),女,博士,从事图多智能体强化学习算法研究.orcid.org/0000-0003-2616-5156.E-mail:
针对复杂高动态多智能体强化学习中多样化动态信息捕捉困难、计算复杂的难题,提出基于混合空洞注意力的多智能体图卷积强化学习算法,以平衡计算复杂度和感受野大小,提高学习效率. 获取能够捕捉多智能体动态交互的图动态矩阵. 混合空洞注意力机制利用Bagging融合了多头注意力和多尺度空洞注意力机制的优点,使模型有效地学习不同类型特征. 在损失函数中添加正则化项以促进模型稳定性并解决过拟合问题. 为了平衡动作的探索与利用,采用改进的暂时拓展贪心方法选择多智能体动作. 仿真结果表明,在复杂动态环境中,所提方法的策略优化准确性和稳定性优于现有方法.
关键词:
A multi-agent graph convolutional reinforcement learning based on hybrid dilated attention was proposed to address the challenges of capturing diverse dynamic information and computational complexity in complex high-dynamic multi-agent reinforcement learning. The multi-agent graph convolutional reinforcement learning with ensemble-based hybrid dilated attention was proposed to balance computational complexity and receptive field size in order to enhance learning efficiency. The dynamics matrix of the underlying graph was obtained to capture the dynamic interactions of multiple agents. The hybrid dilated attention mechanism used the Bagging method to combine the advantages of the multi-head attention and the multi-scale dilated attention mechanisms in order to enable the model to effectively learn different types of features. A regularization was added into the loss function to enhance the stability of the model and address the overfitting problem. The improved temporally extended greedy method was utilized to choose the multi-agent’s actions in order to achieve the exploration and exploitation trade-off of actions. The simulation results demonstrate that the proposed method achieves higher accuracy and greater stability in policy optimization than the existing approaches in complex dynamic environments.
Keywords:
本文引用格式
宋莉, 宛袁玉, 宋明黎.
SONG Li, WAN Yuanyu, SONG Mingli.
多智能体图强化学习(multi-agent graph reinforcement learning, MAGRL)通过图结构显示建模多智能体间的交互,以解决智能体间关系复杂且动态变化的协作或竞争问题[1-3]. 该算法凭借其独特优势,广泛应用于决策领域,如多智能体游戏、多机器人协作、智能交通控制等[4-5]. 然而,MAGRL固有的建模复杂性,以及手动设计规则的泛化性差,严重制约其在多智能体决策领域的进一步发展[6-7]. 当前MAGRL研究多采用图神经网络以建模智能体间的交互关系,进而优化协同策略[8-10]. 在复杂非平稳环境中,各智能体不仅要考虑自身的行动和奖励,还要考虑其他智能体的动态策略,从而导致其感知信息动态变化,极大地增加了学习稳定策略的难度[11].
为了解决该难题,研究人员致力于为智能体构建更强大的环境感知与交互模型. 其中,图卷积强化学习(graph convolutional reinforcement learning, GCRL)通过将多智能体系统建模为图结构,旨在增强多个智能体之间交互关系的抽象表示,为理解和应对环境非平稳性提供重要的表征基础. 为提升对多智能体动态关系的适应性,基于图卷积的强化学习方法通过关联表示来提取多智能体间的交互信息[12-13]. 为了减少计算时间,新颖的图卷积编码器和多头注意力解码器网络利用层次特征进行学习[14]. 为提高策略优化性能,基于演员-评论家框架的GCRL利用集中式评论家网络的集合进行动作值估计[15]. 非策略性动作-批评型多智能体强化学习算法利用图神经网络的信息提取能力,在图上训练分布式协调策略[16]. 尽管已有研究在GCRL领域取得显著进展[17],然而当智能体规模扩大、环境动态性增强时,智能体间的交互关系呈现出高度的时变性,难以在短时间内保持稳定不变. 这种交互拓扑结构的不稳定,导致系统无法获取多样化的动态信息,为多智能体的策略优化带来严峻挑战.
为了应对该挑战,提出基于多尺度空洞注意力(multi-scale dilated attention, MSDA)的图卷积强化学习方法GCRL-MSDA,获取不同类型特征,提高学习效率. 为了增强算法的性能,提出基于集成混合空洞注意力的多智能体图卷积强化学习方法(multi-agent graph convolutional reinforcement learning with ensemble dilated attention, GCRL-EDA),利用Bagging融合MSDA和多头注意力(multi-head attention, MHA)机制的优点. 该方法通过改进的混合注意力构建多智能体之间的动态交互关系模型,以获取多尺度的上下文信息,从而在获得更大感知范围的同时降低计算复杂度. 因此,在复杂高动态环境中,GCRL-EDA可以更轻松地获取随时间和节点对变化的卷积核权重矩阵,捕捉图结构的变化特性. 在GCRL-EDA中,引入损失函数的正则化和改进的暂时拓展贪心方法,以提高算法的准确性和稳定性.
1. 相关工作
在多智能体环境中,图强化学习的人工设计规则的泛化能力差,且所有智能体之间的复杂交互需要处理大量信息,建模过程复杂,计算复杂度高. 为从根本上克服上述局限性,将图卷积神经网络引入到多智能体强化学习框架中,实现更高效、更通用的协同策略学习[18-19]. 近年来,GCRL算法受到广泛关注,并催生了许多相关的算法、规则和框架. 例如,图卷积Q网络将GCRL整合到Q学习中,使智能体能够在图结构表示的多智能体系统中学习最优策略[20];基于深度Q网络的图生成算法通过扩展深度Q网络框架,利用图卷积神经网络(graph convolutional neural network, GCN)处理图结构化的输入数据,以解决分子优化和组合优化等问题[21];基于演员-评论家的图卷积强化学习将GCN与演员-评论家框架结合,利用图结构来改进复杂环境中的策略学习[22]. 以上算法主要侧重于利用静态的图拓扑结构来引导学习,即图中的连接关系在任务执行期间是固定不变的. 为应对环境中的动态关系挑战,进一步增强模型表达能力,基于知识图的强化学习扩展了传统的GCN以处理连接关系复杂的数据,使其适用于智能体和其间关系可能变化的强化学习任务[23]. 此外,稀疏图注意力网络引入注意力机制扩展GCN,以聚焦于多智能体图强化学习过程中最相关的部分[24].
为了在更本质的层面上应对多智能体系统中交互关系的动态性,研究焦点转向如何使图结构本身能够随环境状态而演化. 这一方向的典型代表是基于MHA机制的图卷积强化学习GCRL-MHA算法[25]. 该算法将多智能体系统抽象为动态图,其中每个节点
式中:
式中:
在动态图网络中,多智能体的交互关系在短时间内很难维持稳定不变,无法获取
2. 基于改进混合注意力机制的图卷积强化学习
2.1. 基于多尺度空洞注意力的图强化学习
在GCRL中,增加卷积层的数量可以扩大感受野,从而增强中心性并减轻环境复杂、高动态对算法性能的影响. 然而,较多的卷积层会增加计算成本. 为有效扩大感受野和降低计算成本,所提出的GCRL-EDA算法在GCRL中创新性地引入MSDA模块. 该模块利用滑动窗口空洞注意力(sliding window dilated attention, SWDA)来提取不同尺度的特征信息. 这种方法能够获取多尺度的上下文信息,同时降低计算复杂度. 基于MSDA的GCRL由3个模块组成:观察编码模块、卷积层模块和Q网络模块.
2.1.1. 观测编码模块
将具有MSDA的GCRL问题表述为去中心化的部分观测马尔可夫决策过程,其中每个智能体
2.1.2. 卷积层模块
在卷积层中,为实现图卷积,当前节点会利用注意力机制根据相邻节点的信息更新其状态. 随着卷积层数量的增加,当前节点获取的信息量增多,从而实现对远处节点信息的有效感知. 每个卷积层的数据代表了不同感知范围的信息,所有卷积层的输出最终被合并,继而输入到Q网络中. 每个智能体的数量和位置会随时间变化,底层图持续演化,对图卷积操作的稳定性构成挑战. 为更好地整合关于相邻节点的信息,引入基于SWDA的MSDA模块,用于提取不同尺度的特征信息. 该方法可以获取多尺度上下文信息,有效降低计算复杂度.
在MSDA中,特征图沿着通道维度被划分为M个“头”. 在不同的头中使用不同的空洞率对查询周围的模块进行采样,以计算自注意力. 将不同“头”的自注意力结果进行拼接,并将拼接结果输入到线性层中计算. MSDA的高空洞率可以使模型捕获大范围内的上下文信息,但采样点数量可能减少,稀疏性增加,计算量降低. 综合考虑感受野和计算量,滑动窗口的大小设定为
矩阵中的每一行代表特征向量. 对于位置
SWDA的输出量
式中:
式中:
对每个MSDA的头进行拼接的计算过程为
在GCRL-MSDA中,SWDA不仅能够及时有效地提取不同尺度的信息,减少全局注意力计算中的冗余,而且具备稀疏性特点,可以通过稀疏地选取与查询相关键值对以减少计算量. 基于MSDA的卷积层增加智能体的感受野,扩大智能体间的交互范围,从而使GCRL-MSDA很好地平衡感受野大小和计算复杂度之间的关系.
2.1.3. Q网络模块
(O,A,O',R,C)分别表示当前时刻的观察集
式中:
2.2. 基于改进混合注意力机制的图强化学习
GCRL-MSDA算法的全局交互能力较弱,对远距离直接依赖的建模可能存在困难,导致GCRL-MSDA的分数在学习过程中低于GCRL-MHA的分数. 在学习过程中,为提高算法的准确性和稳定性,将Bagging理论融入算法中,集成MHA和MSDA的优点,减少结果的方差,降低过拟合的风险. 在GCRL-EDA中,采用Bagging理论对这些相互独立的弱学习器进行并行学习,然后提取同构的弱学习器,并与最大值进行组合.
GCRL-EDA算法框架如图1所示. 首先,分别基于MHA机制和MSDA机制构建图卷积强化学习弱学习器模型. 正如第2.1节的理论分析所述,GCRL-MHA和GCRL-MSDA均包含观察编码模块、卷积层模块和Q值网络模块. 对于GCRL-MHA,输入的是观测值
图 1
图 1 基于混合空洞注意力机制的多智能体强化学习框架
Fig.1 Framework of multi-agent reinforcement learning with hybrid dilated attention
在GCRL-MHA中,卷积层使用MHA机制作为卷积核,能够最小化Q网络与目标网络之间的损失函数. 同样地,在GCRL-MSDA中,卷积层通过MSDA机制,实时提取特征,在扩大感受野、捕获多尺度上下文信息的同时,减少计算量. 将GCRL-MHA和GCRL-MSDA作为弱学习器,可以获得多样弱学习器. 采用Bagging理论将构建的弱学习器集成为强学习器,以进行多智能体的智能决策. 在决策阶段,集成后的强学习器动态地选择当前最值得信赖的弱学习器输出,将其作为最终结果,减小模型的方差并提高模型的整体稳定性.
在GCRL-EDA中,MHA模块的时间复杂度为
2.3. 正则化和探索策略的引入
在多个智能体间的实际协作交互中,GCRL-EDA将预测输出的概率分布与真实标签的概率分布进行比较,以计算交叉熵损失. 为了保持注意力机制在时序上的一致性,GCRL-EDA通过最小化当前时刻注意力权重分布与下一时刻注意力权重分布的KL散度,促使注意力权重在较短时间内保持稳定,从而增强交互关系的连续性. 随着网络层数加深,模型所获取的感知域范围扩大,能够学习到更多层次的特征信息. 因此,对最后1个卷积层的注意力权重分布采用图正则化方法进行优化. 为进一步降低模型过拟合风险,对
式中:
为了解决在复杂动态环境中多个智能体所面临的探索与利用的矛盾问题,通常会使用
式中:
此外,探索概率
式中:
综上,GCRL-EDA的主要目标不仅是使所有智能体的累计奖励总和最大化,而且要实现多智能体系统的总体目标,推动多智能体之间的合作与竞争. GCRL-EDA算法的过程总结如下.
算法1 GCRL-EDA 算法伪代码
输入:观测空间O,动作空间A,转移概率P,当前观测oi,当前邻接矩阵ci,当前奖励ri,智能体的数量n,隐藏层维度D,动作的数目Na,目标注意力attenT,q值的期望qe,参数正则化L2,探索参数ε
输出:优化的策略π
1: For 回合tstep=1 to n_episode do
2: 初始化经验回放缓存器BU=[]和当前动作ai=[]
3: For step=1 to max_step do
4: For na=1 to Na do
5: 计算最优策略π利用暂时拓展εz-贪心算法
6: 增加
7: 通过深度Q网络(deep Q-network, DQN)计算
8: For e=1 to n_epoch do
9: q值q和注意力atten:
10: KL损失:
11: 损失:
12: End for
13: End for
14: End for
15: End for
3. 实验和仿真
3.1. Surviving环境
利用图2所示的部分Surviving环境评估所提出算法在大规模多智能体任务下的性能. 该多智能体环境配置100个能与周围环境进行交互的智能体. 每个智能体对应1个网格,该网格提供不同的有限局部观察,其观测区域是以智能体为中心的3×3网格方形框. 智能体可以在由7×7网格定义的方形区域内与相邻多个智能体进行通信. 在每个时间步长内,每个智能体可以移动到其相邻4个网格中的1个,或者吃掉其所在位置的食物. 智能体初始健康值为10,每执行一步,健康值减少1,吃掉食物增加1. 若智能体的健康值达到0,获得–0.2的奖励;否则,奖励为0.4. 在本次实验中,损失函数系数
图 2
GCRL-EDA、GCRL-MSDA、GCRL-MHA以及传统GCRL的分数如图3所示. 分数是智能体在完成任务或达到目标的学习过程中多次独立运行获得的奖励函数累加的平均,即
图 3
图 3 所提算法与基准算法的分数对比
Fig.3 Comparison of scores between proposed algorithms and benchmark algorithms
结果表明,传统GCRL的分数最低,这是由于GCRL采用的标准卷积方法无法有效地捕捉动态矩阵. 尽管GCRL-MHA在算法收敛时表现良好,但其收敛速度较慢. GCRL-MSDA的收敛速度较快,但在算法收敛时分数低于GCRL-MHA的分数. 所提出的GCRL-EDA集成GCRL-MSDA和GCRL-MHA的优势,获取多尺度上下文信息,降低了计算需求,解决了过拟合问题,因此获得了最高分数和最快收敛速度.
理论分析表明,GCRL-EDA通过引入图正则化以聚焦未来学习中处于通信范围内的智能体,从而增强团队合作的一致性. 适当的图正则化能够加快学习进程. 将式(8)中图正则化系数λ1设置为1.5、1.5×10–1、1.5×10–3、1.5×10–5、1.5×10–9,以验证GCRL-EDA的性能. 在不同的λ1下,GCRL-EDA的分数如图4所示. 实验结果表明,当λ1=1.5×10–3时,GCRL-EDA的分数最高,收敛速度最快,而过小或过大的图正则化都会影响算法的学习精度.
图 4
图 4 不同图正则化系数下所提出算法的分数
Fig.4 Scores of proposed algorithm under different graph regularization coefficients
为进一步评估所提出算法的性能,在KL-损失kl_loss、注意力值atten和q值3方面对GCRL-EDA与GCRL-MHA进行比较. 图5所示的实验结果表明,与GCRL-MHA相比,GCRL-EDA在学习多智能体策略的过程中具有更低的KL-loss和atten,并且具有更高的q值. 因此,GCRL-EDA的性能优于GCRL-MHA.
图 5
图 5 Surviving环境中所提算法和基准算法的结果
Fig.5 Results of proposed algorithm and benchmark algorithm in surviving environment
在Surviving环境中算法收敛时,传统GCRL、GCRL-MHA、GCRL-MSDA和GCRL-EDA的结果如表1所示. 成功率为多智能体实现目标的回合数在所有回合数的占比. 与其他算法相比,GCRL-EDA不仅表现出更低的损失值、KL-loss和atten,而且q值和成功率也更高,其表现显著优于传统GCRL、GCRL-MHA和GCRL-MSDA.
表 1 所提算法与基准算法收敛时的实验结果
Tab.1
| 算法 | 损失值 | KL-loss | atten | q | 成功率 |
| 传统GCRL | 6.15×1016 | 3.99×1016 | –3.93×1015 | 8.80 | 0.68 |
| GCRL-MHA | 7.54×1013 | 5.02×1016 | –4.87×1015 | 9.21 | 0.71 |
| GCRL-MSDA | 6.82×1010 | 4.58×1016 | –4.89×1015 | 11.59 | 0.89 |
| GCRL-EDA | 6.88×107 | 4.54×1016 | –4.93×1015 | 12.02 | 0.92 |
为验证GCRL-EDA中暂时拓展
图 6
图 6 不同策略和图正则化的消融实验结果
Fig.6 Results of ablation experiments with different policies and graph regularization
3.2. 路由器环境
路由器网络由L个路由器组成. 每个路由器随机连接到一定数量的其他路由器(在实验中为3个),并且网络拓扑结构是固定的. 有N个随机大小的数据包,每个数据包都随机分配1个源路由器和1个目标路由器. 如果多个数据包的总大小超过1条链路的带宽,它们就不能同时通过该链路. 在本实验中,将每个数据包视为1个“智能体”,其目标是快速到达目的地并避免拥塞. 在每个时间步长内,观察内容包括数据包的自身属性(即当前位置、目的地和数据大小)、与其当前位置相连的边属性(即负载、长度)以及相邻的数据包(在相连的边或路由器上). 本实验设置N=20和L=20,并对2 000组模型进行训练.
为直观地展示路由器在训练过程中的学习情况,在训练过程中,随着路由器的学习进程推进,选取数据学习过程中动态节点的变化图,如图7所示.
图 7
图 7 学习过程中变化图的动态节点
Fig.7 Variation graphs of dynamic nodes in learning processes
表2展示了当迭代轮次分别为1、10、20、30时,3种算法的分数情况. 可以看出,在学习过程中,随着轮次的增加,GCRL-EDA的分数低于GCRL-MHA和GCRL-MSDA. 这是因为GCRL-EDA使用了Bagging理论来获取多尺度信息,其性能优于其他算法.
表 2 GCRL-MHA、GCRL-MSDA、GCRL-EDA的分数
Tab.2
| 轮次 | scores | ||
| GCRL-MHA | GCRL-MSDA | GCRL-EDA | |
| 1 | 69.56 | 118.05 | 130.85 |
| 10 | 76.10 | 79.94 | 54.12 |
| 20 | 20.45 | 25.36 | 21.26 |
| 30 | 24.13 | 22.87 | 22.41 |
3.3. 高速公路驾驶环境
为进一步评估所提出算法的性能,针对复杂高速公路场景下的汽车自主驾驶任务进行实验. 在核心场景highway-v0中,自动驾驶车辆的目标为高速行驶、避免碰撞其他观察车辆以及靠右行驶. 环境的默认设置为四车道高速公路,通过建立智能驾驶员模型以模拟真实的车辆跟随和变道逻辑. 观察到的状态包括车辆的位置、速度、转向角度等. 观察范围涵盖周围车辆的动态信息. 各自动驾驶车辆的离散操作包括:静止(保持当前状态)、左转(变更车道至左侧)、右转(变更车道至右侧)、加速和减速. 此外,奖励函数综合考虑了速度奖励(速度在设定范围内时,奖励随速度线性增加)、车道位置奖励(在右侧车道行驶可以获得更高的奖励)以及碰撞惩罚(发生碰撞时,比赛立即终止并给予负奖励). 该环境的运行参数如下:总时间步数为20 000,折扣因子为0.99,加速区间为[–3.5,3.5],在路奖励为0.1,缓存大小为1×106,速度区间为[10,25],车辆数目为50,高速度奖励为0.5,碰撞奖励为–1.
在highway-v0环境中,为评估所提出的GCRL-EDA的性能,将其与多智能体近端策略优化(multi-agent proximal policy optimization, MAPPO)[27]和GCRL-MHA进行对比实验. 所得到的损失、价值差异和梯度结果如图8(a)所示. 与MAPPO和GCRL-MHA相比,GCRL-EDA能够充分利用多尺度信息,并很好地平衡探索与利用,解决过拟合问题. 因此,GCRL-EDA的损失和价值差异更小,梯度更大. 为进一步评估该算法的性能,在高速公路highway-fast-v0环境中进行实验,实验结果如图8(b)所示. 其核心目标是提高模拟速度,以满足深度强化学习的大规模训练需求. 代价是部分降低模拟精度,即通过简化物理计算或减少环境细节来实现加速. 与图8(a)的分析类似,图8(b)的结果表明,在highway-fast-v0环境中,GCRL-EDA的性能优于GCRL-MHA和MAPPO.
图 8
图 8 高速路环境下所提算法与基准算法的实验结果
Fig.8 Results of proposed algorithm and benchmark algorithms in highway environments
在highway-fast-v0环境中,MAPPO、GCRL-MHA和GCRL-EDA运行时,总时间步数分别为100 608、9 599和3 478. 因此,GCRL-EDA的时间复杂度低于MAPPO和GCRL-MHA.
采用复杂的交汇路口环境Intersection-v0来评估GCRL-MHA和GCRL-EDA的性能. 图9所示结果显示,GCRL-EDA的q值和学习率αl高于GCRL-MHA,且收敛更快. 因此,GCRL-EDA能够更好地平衡探索和利用,其性能优于GCRL-MHA.
图 9
图 9 交汇路口环境中所提算法与基准算法的q值和学习率
Fig.9 q value and learning rate of proposed algorithm and benchmark algorithm in Intersection-v0
在highway-v0和highway-fast-v0汽车驾驶环境中,获得了与学习率、损失函数、价值函数、GPU温度、GPU利用率等相关结果. 为增强实验结果的全面性和说服力,图10列出了DGN-EDA算法在highway-fast-v0环境下的αl、q值、GPU温度θGPU、GPU利用率us. 从图10(a)可见,在学习过程中,GCRL-EDA的αl不断降低,说明暂时拓展
图 10
图 10 所提出算法在快速高速路环境下的学习率、q值、GPU温度及利用率
Fig.10 Learning rate, q value, GPU temperature and utilization of proposed algorithm in highway-fast-v0 environment
3.4. 复杂城市道路自主驾驶环境
高速公路一般为单向多车道的封闭环境,交通规则简单,且高速公路上主要为同质化的机动车,行为相对可预测;车辆交互多为纵向(前后车),且大多数路段为弱交互,高速公路实验相对简单. 在城市道路环境中,道路结构复杂(如十字路口、环岛),交通规则繁多(如交通信号灯、停车标志、让行规则等),交通参与者类型多样(如机动车、公交车),行为意图多变,使得城市道路环境更为复杂. 在3.3节高速公路自主驾驶环境验证所提出算法性能的基础上,设计复杂城市场景十字路口,以验证GCRL-EDA的稳健性. 十字路口城市车辆间的部分交互图如图11所示. 为验证所提算法的稳健性,设置不同复杂度的车辆驾驶环境:在双向四车道中分别设置同时存在10、20、40辆车,对应低密度、中等密度、高密度3种十字路口环境En1、En2、En3. 高密度的十字路口环境通常会出现拥堵,通行效率下降,博弈行为变得极其复杂. 图11展示了十字路口的部分截图,包括1条双向四车道公路与部分车辆. 车辆目标是安全地穿过繁忙的十字路口. 该环境的运行参数如下:总时间步数为200 000,折扣因子为0.99,训练批次大小为128,预训练时间步数为1 000,重放内存缓冲区大小1×106.
图 11
图 11 十字路口城市车辆间的部分交互图网络
Fig.11 Partial interaction graph network between urban vehicles at intersection
在En1、En2、En3这3种不同复杂度的十字路口环境中,所获得的奖励值分别为3.45、3.73、3.46,损失函数值分别为0.486、0.592、0.726,平均历经时间分别为1 148、1 196、1 258 min. GCRL-EDA在3种环境中的奖励值较为集中. 随着车辆数量增加,算法性能未出现任何崩溃或显著下降,说明GCRL-EDA学到的决策策略具有普适性与稳健性. 在更复杂的环境中,决策优化难度随之提高,损失值相应增大,平均历经时间也相应延长. 损失值和历经时间随着环境复杂度增加而上升,符合预期. 尽管损失升高,历经时间增长,算法最终仍能保持良好的整体性能并获得高奖励,进一步证明了GCRL-EDA所得最优策略的有效性和鲁棒性.
4. 结 语
提出基于混合空洞注意力机制的集成多智能体图卷积强化学习方法(GCRL-EDA),以获取底层图的动态矩阵. 在GCRL-EDA中,通过Bagging理论集成多头注意力机制和多尺度空洞注意力机制,以获取多尺度的上下文信息并减少计算量. 在GCRL-EDA中引入图正则化以促进模型稳定性和缓解过拟合问题. 为实现探索与利用之间的平衡,采用深度探索贪婪算法进行多智能体动作选择. 实验结果表明,在复杂高动态环境中,所提出算法的决策性能明显优于现有基线方法. 为验证所提算法GCRL-EDA的实用价值,下一步的核心任务是将GCRL-EDA与复杂真实场景中的群体交通系统数据(例如与高德地图接洽,获取“宁波市环路摄像头数据”)进行集成,构建高保真实验环境.
参考文献
结合领域经验的深度强化学习信号控制方法
[J].
Deep reinforcement learning approach to signal control combined with domain experience
[J].
Traffic signal control using end-to-end off-policy deep reinforcement learning
[J].
基于个性化联邦强化学习的异构多微网能量调度
[J].DOI:10.16383/j.aas.c250130 [本文引用: 1]
Energy scheduling of heterogeneous multi-microgrid based on personalized federated reinforcement learning
[J].DOI:10.16383/j.aas.c250130 [本文引用: 1]
Deep Q-learning-based dynamic management of a robotic cluster
[J].DOI:10.1109/TASE.2022.3205651 [本文引用: 1]
Make smart decisions faster: deciding D2D resource allocation via stackelberg game guided multi-agent deep reinforcement learning
[J].DOI:10.1109/TMC.2021.3085206 [本文引用: 1]
Challenges and opportunities in deep reinforcement learning with graph neural networks: a comprehensive review of algorithms and applications
[J].DOI:10.1109/tnnls.2023.3283523 [本文引用: 1]
多目标深度强化学习驱动的数据库系统参数优化技术
[J].DOI:10.13328/j.cnki.jos.007405 [本文引用: 1]
Technique for database system parameter optimization using multi-objective deep reinforcement learning
[J].DOI:10.13328/j.cnki.jos.007405 [本文引用: 1]
Attention enhanced reinforcement learning for multi agent cooperation
[J].DOI:10.1109/TNNLS.2022.3146858
集中训练分布执行下的多智能体强化学习综述
[J].DOI:10.7641/CTA.2025.50009 [本文引用: 1]
Review of multi-agent reinforcement learning under centralized training with decentralized execution
[J].DOI:10.7641/CTA.2025.50009 [本文引用: 1]
A graph reinforcement learning-based decision-making platform for real-time charging navigation of urban electric vehicles
[J].DOI:10.1109/TII.2022.3210264 [本文引用: 1]
Temporal difference-aware graph convolutional reinforcement learning for multi-intersection traffic signal control
[J].
A graph convolutional encoder and multi-head attention decoder network for tsp via reinforcement learning
[J].DOI:10.1016/j.engappai.2022.104848 [本文引用: 1]
A contrastive enhanced ensemble framework for efficient multi-agent reinforcement learning
[J].DOI:10.1016/j.eswa.2024.123158 [本文引用: 1]
Graph soft actor-critic reinforcement learning for large-scale distributed multirobot coordination
[J].DOI:10.1109/TNNLS.2023.3329530 [本文引用: 1]
ET-HF: a novel information sharing model to improve multi-agent cooperation
[J].DOI:10.1016/j.knosys.2022.109916 [本文引用: 1]
基于残差图卷积网络与深度强化学习的需求可拆分车辆路径优化算法
[J].DOI:10.7641/CTA.2023.21040 [本文引用: 1]
The split delivery vehicle routing optimization with the residual graph convolutional network and deep reinforcement learning
[J].DOI:10.7641/CTA.2023.21040 [本文引用: 1]
Graph convolutional network based multi-objective meta-deep Q-learning for eco-routing
[J].DOI:10.1109/TITS.2023.3348034 [本文引用: 1]
Deep Q-learning-based molecular graph generation for chemical structure prediction from infrared spectra
[J].DOI:10.1109/TAI.2023.3287947 [本文引用: 1]
Multi-agent reinforcement learning with graph convolutional neural networks for optimal bidding strategies of generation units in electricity markets
[J].DOI:10.1016/j.eswa.2023.120010 [本文引用: 2]
Maintenance planning recommendation of complex industrial equipment based on knowledge graph and graph neural network
[J].DOI:10.1016/j.ress.2022.109068 [本文引用: 1]
Sparse graph attention networks
[J].DOI:10.1109/TKDE.2021.3072345 [本文引用: 1]
Graph convolutional reinforcement learning for collaborative queuing agents
[J].DOI:10.1109/tnsm.2022.3226605 [本文引用: 2]
/
| 〈 |
|
〉 |

