浙江大学学报(工学版), 2026, 60(9): 1980-1990 doi: 10.3785/j.issn.1008-973X.2026.09.015

计算机技术、自动控制技术

基于混合空洞注意力机制的图卷积强化学习

宋莉,, 宛袁玉,, 宋明黎

1. 浙大城市学院 计算机与计算科学学院,浙江 杭州 310015

2. 浙江大学 计算机科学与技术学院,浙江 杭州 310027

3. 浙江大学 软件学院,浙江 宁波 315100

Graph convolutional reinforcement learning via hybrid dilated attention mechanism

SONG Li,, WAN Yuanyu,, SONG Mingli

1. School of Computer and Computing Science, Hangzhou City University, Hangzhou 310015, China

2. College of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China

3. School of Software Technology, Zhejiang University, Ningbo 315100, China

通讯作者: 宛袁玉,男,研究员. orcid.org/0000-0002-3577-5186. E-mail:wanyy@zju.edu.cn

收稿日期: 2025-08-17  

基金资助: 浙江省自然科学基金联合基金资助项目(LHZSD24F020001);国家自然科学基金资助项目(62306275, U20B2066);浙江大学上海高等研究院繁星科学基金资助项目(SN-ZJU-SIAS-001);中央高校基本科研业务费专项资金资助项目(226-2023-00048).

Received: 2025-08-17  

Fund supported: 浙江省自然科学基金联合基金资助项目(LHZSD24F020001);国家自然科学基金资助项目(62306275,U20B2066);浙江大学上海高等研究院繁星科学基金资助项目(SN-ZJU-SIAS-001);中央高校基本科研业务费专项资金资助项目(226-2023-00048).

作者简介 About authors

宋莉(1991—),女,博士,从事图多智能体强化学习算法研究.orcid.org/0000-0003-2616-5156.E-mail:slili516@zjsru.edu.cn , E-mail:slili516@zjsru.edu.cn

摘要

针对复杂高动态多智能体强化学习中多样化动态信息捕捉困难、计算复杂的难题,提出基于混合空洞注意力的多智能体图卷积强化学习算法,以平衡计算复杂度和感受野大小,提高学习效率. 获取能够捕捉多智能体动态交互的图动态矩阵. 混合空洞注意力机制利用Bagging融合了多头注意力和多尺度空洞注意力机制的优点,使模型有效地学习不同类型特征. 在损失函数中添加正则化项以促进模型稳定性并解决过拟合问题. 为了平衡动作的探索与利用,采用改进的暂时拓展贪心方法选择多智能体动作. 仿真结果表明,在复杂动态环境中,所提方法的策略优化准确性和稳定性优于现有方法.

关键词: 多智能体 ; 图强化学习 ; 混合空洞注意力机制 ; 暂时拓展贪心方法 ; 策略优化

Abstract

A multi-agent graph convolutional reinforcement learning based on hybrid dilated attention was proposed to address the challenges of capturing diverse dynamic information and computational complexity in complex high-dynamic multi-agent reinforcement learning. The multi-agent graph convolutional reinforcement learning with ensemble-based hybrid dilated attention was proposed to balance computational complexity and receptive field size in order to enhance learning efficiency. The dynamics matrix of the underlying graph was obtained to capture the dynamic interactions of multiple agents. The hybrid dilated attention mechanism used the Bagging method to combine the advantages of the multi-head attention and the multi-scale dilated attention mechanisms in order to enable the model to effectively learn different types of features. A regularization was added into the loss function to enhance the stability of the model and address the overfitting problem. The improved temporally extended greedy method was utilized to choose the multi-agent’s actions in order to achieve the exploration and exploitation trade-off of actions. The simulation results demonstrate that the proposed method achieves higher accuracy and greater stability in policy optimization than the existing approaches in complex dynamic environments.

Keywords: multi-agent ; graph reinforcement learning ; hybrid dilated attention mechanism ; temporally-extended greedy method ; policy optimization

PDF (1974KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

宋莉, 宛袁玉, 宋明黎. 基于混合空洞注意力机制的图卷积强化学习. 浙江大学学报(工学版)[J], 2026, 60(9): 1980-1990 doi:10.3785/j.issn.1008-973X.2026.09.015

SONG Li, WAN Yuanyu, SONG Mingli. Graph convolutional reinforcement learning via hybrid dilated attention mechanism. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(9): 1980-1990 doi:10.3785/j.issn.1008-973X.2026.09.015

多智能体图强化学习(multi-agent graph reinforcement learning, MAGRL)通过图结构显示建模多智能体间的交互,以解决智能体间关系复杂且动态变化的协作或竞争问题[1-3]. 该算法凭借其独特优势,广泛应用于决策领域,如多智能体游戏、多机器人协作、智能交通控制等[4-5]. 然而,MAGRL固有的建模复杂性,以及手动设计规则的泛化性差,严重制约其在多智能体决策领域的进一步发展[6-7]. 当前MAGRL研究多采用图神经网络以建模智能体间的交互关系,进而优化协同策略[8-10]. 在复杂非平稳环境中,各智能体不仅要考虑自身的行动和奖励,还要考虑其他智能体的动态策略,从而导致其感知信息动态变化,极大地增加了学习稳定策略的难度[11].

为了解决该难题,研究人员致力于为智能体构建更强大的环境感知与交互模型. 其中,图卷积强化学习(graph convolutional reinforcement learning, GCRL)通过将多智能体系统建模为图结构,旨在增强多个智能体之间交互关系的抽象表示,为理解和应对环境非平稳性提供重要的表征基础. 为提升对多智能体动态关系的适应性,基于图卷积的强化学习方法通过关联表示来提取多智能体间的交互信息[12-13]. 为了减少计算时间,新颖的图卷积编码器和多头注意力解码器网络利用层次特征进行学习[14]. 为提高策略优化性能,基于演员-评论家框架的GCRL利用集中式评论家网络的集合进行动作值估计[15]. 非策略性动作-批评型多智能体强化学习算法利用图神经网络的信息提取能力,在图上训练分布式协调策略[16]. 尽管已有研究在GCRL领域取得显著进展[17],然而当智能体规模扩大、环境动态性增强时,智能体间的交互关系呈现出高度的时变性,难以在短时间内保持稳定不变. 这种交互拓扑结构的不稳定,导致系统无法获取多样化的动态信息,为多智能体的策略优化带来严峻挑战.

为了应对该挑战,提出基于多尺度空洞注意力(multi-scale dilated attention, MSDA)的图卷积强化学习方法GCRL-MSDA,获取不同类型特征,提高学习效率. 为了增强算法的性能,提出基于集成混合空洞注意力的多智能体图卷积强化学习方法(multi-agent graph convolutional reinforcement learning with ensemble dilated attention, GCRL-EDA),利用Bagging融合MSDA和多头注意力(multi-head attention, MHA)机制的优点. 该方法通过改进的混合注意力构建多智能体之间的动态交互关系模型,以获取多尺度的上下文信息,从而在获得更大感知范围的同时降低计算复杂度. 因此,在复杂高动态环境中,GCRL-EDA可以更轻松地获取随时间和节点对变化的卷积核权重矩阵,捕捉图结构的变化特性. 在GCRL-EDA中,引入损失函数的正则化和改进的暂时拓展贪心方法,以提高算法的准确性和稳定性.

1. 相关工作

在多智能体环境中,图强化学习的人工设计规则的泛化能力差,且所有智能体之间的复杂交互需要处理大量信息,建模过程复杂,计算复杂度高. 为从根本上克服上述局限性,将图卷积神经网络引入到多智能体强化学习框架中,实现更高效、更通用的协同策略学习[18-19]. 近年来,GCRL算法受到广泛关注,并催生了许多相关的算法、规则和框架. 例如,图卷积Q网络将GCRL整合到Q学习中,使智能体能够在图结构表示的多智能体系统中学习最优策略[20];基于深度Q网络的图生成算法通过扩展深度Q网络框架,利用图卷积神经网络(graph convolutional neural network, GCN)处理图结构化的输入数据,以解决分子优化和组合优化等问题[21];基于演员-评论家的图卷积强化学习将GCN与演员-评论家框架结合,利用图结构来改进复杂环境中的策略学习[22]. 以上算法主要侧重于利用静态的图拓扑结构来引导学习,即图中的连接关系在任务执行期间是固定不变的. 为应对环境中的动态关系挑战,进一步增强模型表达能力,基于知识图的强化学习扩展了传统的GCN以处理连接关系复杂的数据,使其适用于智能体和其间关系可能变化的强化学习任务[23]. 此外,稀疏图注意力网络引入注意力机制扩展GCN,以聚焦于多智能体图强化学习过程中最相关的部分[24].

为了在更本质的层面上应对多智能体系统中交互关系的动态性,研究焦点转向如何使图结构本身能够随环境状态而演化. 这一方向的典型代表是基于MHA机制的图卷积强化学习GCRL-MHA算法[25]. 该算法将多智能体系统抽象为动态图,其中每个节点$ i $表示1个智能体. 每个节点的特征反映相应智能体所观察到的状态. 每个智能体的邻居集合由距离或其他指标确定,该邻接集合会根据环境状态和时间的变化(例如第$ i $个智能体的局部观察和通信范围)而变化,而边则将每个智能体与其相邻的智能体连接起来. 每个节点都可以与相邻节点进行通信,且每个智能体对其相邻节点的影响会随着距离的增加而减弱[25]. GCRL-MHA包含3个模块:观察编码模块、卷积层模块和Q网络模块. 在卷积层中,采用MHA机制以加权的方式来计算相邻节点对当前节点的影响. 其中,每个头代表一种关系,而每种关系都会计算相邻节点的权重. 对每个智能体$ i $,令$ {B}_{+i} $表示$ {B}_{i} $$ i $. 每个智能体的输入特征通过独立的注意力头,被投影为查询矩阵$ \boldsymbol{Q} $、键矩阵$ \boldsymbol{K} $和值矩阵$ \boldsymbol{V} $. 对于第m个注意力头,邻接节点$ j\in {B}_{+i} $的权重为

$ \alpha _{ij}^{m}=\dfrac{\exp \left(\tau \cdot \boldsymbol{W}_{\boldsymbol{Q}}^{m}{\boldsymbol{h}}_{i}\cdot {\left(\boldsymbol{W}_{\boldsymbol{K}}^{m}{\boldsymbol{h}}_{j}\right)}\right)}{\displaystyle\sum\limits_{j\in {B}_{+i}}\exp \left(\tau \cdot \boldsymbol{W}_{\boldsymbol{Q}}^{m}{\boldsymbol{h}}_{i}\cdot {\left(\boldsymbol{W}_{\boldsymbol{K}}^{m}{\boldsymbol{h}}_{j}\right)}\right)}. $

式中:$ \boldsymbol{W}_{\boldsymbol{Q}}^{m} $$\boldsymbol{W}_{\boldsymbol{K}}^{m} $为注意力机制中的线性映射,分别对应查询矩阵$ \boldsymbol{Q} $和键矩阵$ \boldsymbol{K} $$ \boldsymbol{h} $为特征,$ \tau $为缩放因子. GCRL-MHA利用MHA机制来捕获智能体之间的交互关系,并且每个头能捕获不同类型的交互关系. 依据所得关系权重$ {\alpha }^{m} $M个注意力头的输出进行拼接. 最终,采用全连接网络和非线性激活函数修正线性单元对卷积层的输出结果进行以下变换:

$ \boldsymbol{h}_{i}^{\prime}=\sigma \left(\mathrm{concat}\left[\displaystyle\sum\limits_{j\in B+i}\alpha _{ij}^{m}\boldsymbol{W}_{\boldsymbol{V}}^{m}{\boldsymbol{h}}_{j},\forall m\in M\right]\right). $

式中:$ \sigma $表示Sigmoid函数.

在动态图网络中,多智能体的交互关系在短时间内很难维持稳定不变,无法获取$ \boldsymbol{W}_{\boldsymbol{Q}}^{m} $$ \boldsymbol{W}_{\boldsymbol{K}}^{m}$$ \boldsymbol{W}_{\boldsymbol{V}}^{m} $组成的权重矩阵和多样化信息. 所有智能体间的相互作用导致卷积过程中的全局图信息复杂度增加,使得邻域聚合的计算难度增大.

2. 基于改进混合注意力机制的图卷积强化学习

2.1. 基于多尺度空洞注意力的图强化学习

在GCRL中,增加卷积层的数量可以扩大感受野,从而增强中心性并减轻环境复杂、高动态对算法性能的影响. 然而,较多的卷积层会增加计算成本. 为有效扩大感受野和降低计算成本,所提出的GCRL-EDA算法在GCRL中创新性地引入MSDA模块. 该模块利用滑动窗口空洞注意力(sliding window dilated attention, SWDA)来提取不同尺度的特征信息. 这种方法能够获取多尺度的上下文信息,同时降低计算复杂度. 基于MSDA的GCRL由3个模块组成:观察编码模块、卷积层模块和Q网络模块.

2.1.1. 观测编码模块

将具有MSDA的GCRL问题表述为去中心化的部分观测马尔可夫决策过程,其中每个智能体$ i $获取局部观测$ o_{i}^{t} $(即节点$ i $的属性),执行动作$ a_{i}^{t} $,并获得奖励$ r_{i}^{t} $. 每个智能体的目标是最大化自身的累积奖励. 为获得低维输入,每个节点观测$ o_{i}^{t} $通过多层感知机网络(multi-layer perceptron, MLP)编码为特征$ \boldsymbol{h}_{i}^{t} $.

2.1.2. 卷积层模块

在卷积层中,为实现图卷积,当前节点会利用注意力机制根据相邻节点的信息更新其状态. 随着卷积层数量的增加,当前节点获取的信息量增多,从而实现对远处节点信息的有效感知. 每个卷积层的数据代表了不同感知范围的信息,所有卷积层的输出最终被合并,继而输入到Q网络中. 每个智能体的数量和位置会随时间变化,底层图持续演化,对图卷积操作的稳定性构成挑战. 为更好地整合关于相邻节点的信息,引入基于SWDA的MSDA模块,用于提取不同尺度的特征信息. 该方法可以获取多尺度上下文信息,有效降低计算复杂度.

在MSDA中,特征图沿着通道维度被划分为M个“头”. 在不同的头中使用不同的空洞率对查询周围的模块进行采样,以计算自注意力. 将不同“头”的自注意力结果进行拼接,并将拼接结果输入到线性层中计算. MSDA的高空洞率可以使模型捕获大范围内的上下文信息,但采样点数量可能减少,稀疏性增加,计算量降低. 综合考虑感受野和计算量,滑动窗口的大小设定为$ 3\times 3 $,空洞率设定为$ {\eta }=1,2,3 $,以控制稀疏度。这2种设置有助于提高计算效率,增强MSDA的非线性表达能力,有效平衡局部性与感受野的关系. MSDA的每个“头”都可以表示为SWDA,其中键和值从以查询模块为中心的滑动窗口中稀疏采样获得,随后进行自注意力计算,计算公式为

$ {\boldsymbol{h}}_{i}=\mathrm{SWDA}\left({\boldsymbol{Q}}_{i},{\boldsymbol{K}}_{i},{\boldsymbol{V}}_{i},{\eta }_{i}\right);\quad 1\leqslant i\leqslant n. $

矩阵中的每一行代表特征向量. 对于位置$ \left(i,j\right) $的查询,SWDA会从大小为$ \omega \times \omega $的滑动窗口中稀疏地选择键和值,并进行基于查询矩阵的自注意力计算. 此外,在式(3)中,MSDA定义了空洞率$ \eta \in {\bf{N} }^{+} $来控制稀疏程度.

SWDA的输出量$ \boldsymbol{X} $在位置$ \left(i,j\right) $处的值为$ {\boldsymbol{x}}_{ij} $

$ \begin{split} {{\boldsymbol{x}}_{ij}} = & \mathrm{Attention} \left( {q_{ij},{\boldsymbol{K}_{\eta} },{\boldsymbol{V}_{\eta} }} \right)= \mathrm{Softmax} \left( {\dfrac{{q_{ij}{\boldsymbol{K}_\eta} ^{\mathrm{T}}}}{{\sqrt {d_{\bf{K}}} }}} \right){\boldsymbol{V}_{\eta}};\\& 1 \leqslant i \leqslant \varOmega ,\;1 \leqslant j \leqslant H. \end{split} $

式中:$ H $$ \mathit{\Omega } $分别为特征图的高度和宽度;$ {\boldsymbol{K}}_{\eta} $$ {\boldsymbol{V}}_{\eta} $分别为从$ \boldsymbol{K} $$ \boldsymbol{V} $中采样得到的值;$ q_{{}_{ij}}^{a} $为查询矩阵$ \boldsymbol{Q} $中位于$ \left(i,j\right) $处的值;$ {d}_{\bf{k}} $为键向量的维度,以对结果进行缩放,避免出现梯度方面的问题. 给定$ {x}_{ij} $,将选择以下坐标集合$ \left({i}^{\prime},{j}^{\prime}\right) $的键和值来计算自注意力:

$ \left\{\left(i',j'\right)|\;i'=i+{p}_{\mathrm{shift},{X}}\times \eta ,\;j'=j+{p}_{\mathrm{shift},{Y}}\times \eta \right\}. $

式中:$ {p}_{\mathrm{shift},{X}} $$ {p}_{\mathrm{shift},{Y}} $为位置偏移量,$ {p}_{\mathrm{shift},{X}}\geqslant -{\omega /2}, {p}_{\mathrm{shift},{Y}}\leqslant {\omega/2} $.

对每个MSDA的头进行拼接的计算过程为

$ \boldsymbol{X}=\mathrm{Linear}\left(\;\mathrm{Concat}\;\left[{\boldsymbol{h}}_{1},\cdots ,{\boldsymbol{h}}_{M}\right]\right). $

在GCRL-MSDA中,SWDA不仅能够及时有效地提取不同尺度的信息,减少全局注意力计算中的冗余,而且具备稀疏性特点,可以通过稀疏地选取与查询相关键值对以减少计算量. 基于MSDA的卷积层增加智能体的感受野,扩大智能体间的交互范围,从而使GCRL-MSDA很好地平衡感受野大小和计算复杂度之间的关系.

2.1.3. Q网络模块

O,A,O',R,C)分别表示当前时刻的观察集$ O=\left\{{o}_{i},\cdots ,{o}_{n}\right\} $、动作集A、下一刻的观察集O'、奖励集R、邻接矩阵集$ C=\left\{{\boldsymbol{c}}_{1},{\boldsymbol{c}}_{2},\cdots ,{\boldsymbol{c}}_{n}\right\} $. 该网络从记忆缓存器中随机抽取大小为S的小批量样本,并最小化损失$ L\left(\theta \right) $.

$ \left.\begin{array}{c}L\left(\theta \right)=\dfrac{1}{S}\displaystyle\sum\limits_{S}\left(\dfrac{1}{n}\displaystyle\sum\limits_{i=1}^{n}{\left({y}_{i}-Q\left({O}_{i,C},{a}_{i};\theta \right)\right)}^{2}\right),\\\begin{array}{l}{y}_{i}={r}_{i}+\gamma {\max }_{{{a}^{\prime}}}{Q}^{\prime}\left(O_{i,C}^{\prime},a_{i}^{\prime};{\theta }^{\prime}\right),\\{\theta }^{\prime}=\beta \theta +\left(1-\beta \right){\theta }^{\prime}.\end{array}\end{array}\right\} $

式中:$ S $为批次大小,$ n $为智能体数量,$ {y}_{i} $为目标值,$ \gamma $为折扣因子,$ \beta $为控制参数更新的平滑因子;$ \theta $为当前目标网络参数,$ {\theta }^{\prime} $为更新后的网络参数,$ {O}_{i,C} $为每个卷积层输出的堆叠结果,$ Q\left(\cdot ;\theta \right) $为当前目标网络的q值,$ {Q}^{\prime}\left(\cdot ;{\theta }^{\prime}\right) $为更新后的目标网络的q值. 通过更新目标网络保持目标值稳定并防止过拟合,从而提高训练过程的稳定性.

2.2. 基于改进混合注意力机制的图强化学习

GCRL-MSDA算法的全局交互能力较弱,对远距离直接依赖的建模可能存在困难,导致GCRL-MSDA的分数在学习过程中低于GCRL-MHA的分数. 在学习过程中,为提高算法的准确性和稳定性,将Bagging理论融入算法中,集成MHA和MSDA的优点,减少结果的方差,降低过拟合的风险. 在GCRL-EDA中,采用Bagging理论对这些相互独立的弱学习器进行并行学习,然后提取同构的弱学习器,并与最大值进行组合.

GCRL-EDA算法框架如图1所示. 首先,分别基于MHA机制和MSDA机制构建图卷积强化学习弱学习器模型. 正如第2.1节的理论分析所述,GCRL-MHA和GCRL-MSDA均包含观察编码模块、卷积层模块和Q值网络模块. 对于GCRL-MHA,输入的是观测值$ \left(o_{1}^{\prime},o_{2}^{\prime},\cdots ,o_{n}^{\prime}\right) $,然后通过多层感知器对低维输入或卷积神经网络的视觉输入进行编码,将其转换为$ \boldsymbol{h}_{i}^{t} $. 接下来,节点(即智能体)$ i $的特征向量$ \boldsymbol{h}_{i}^{t} $及其邻接集合$ {B}_{i} $通过卷积层进行处理,以生成潜在特征向量$ \boldsymbol{h}_{i}^{'t} $. 堆叠的卷积层越多,智能体的感知范围越大,能够获取更多的交互信息和更广的通信范围. 换句话说,通过堆叠1个卷积层,智能体$ i $可以直接从一跳(即$ {B}_{i} $)的编码观测值中获得特征向量. 此外,通过堆叠2个卷积层,节点$ i $可以获取一跳范围内节点的第1个卷积层的输出,从而获得与2层邻接节点相关的交互信息. 随着卷积层数量的增加,当前节点的较远邻接节点的交互信息减少,即较远的邻接节点对当前节点的影响降低.

图 1

图 1   基于混合空洞注意力机制的多智能体强化学习框架

Fig.1   Framework of multi-agent reinforcement learning with hybrid dilated attention


在GCRL-MHA中,卷积层使用MHA机制作为卷积核,能够最小化Q网络与目标网络之间的损失函数. 同样地,在GCRL-MSDA中,卷积层通过MSDA机制,实时提取特征,在扩大感受野、捕获多尺度上下文信息的同时,减少计算量. 将GCRL-MHA和GCRL-MSDA作为弱学习器,可以获得多样弱学习器. 采用Bagging理论将构建的弱学习器集成为强学习器,以进行多智能体的智能决策. 在决策阶段,集成后的强学习器动态地选择当前最值得信赖的弱学习器输出,将其作为最终结果,减小模型的方差并提高模型的整体稳定性.

在GCRL-EDA中,MHA模块的时间复杂度为$ O \left(M\left| E\right| d+Mn{d}^{2}\right) $,其中$ \left| E\right| $为边数,$d $为特征向量的维度,$ O\left(M\left| E\right| d\right) $为每头计算注意力权重的时间复杂度,$ O\left(Mn{d}^{2}\right) $为特征变换的复杂度;$ {I } $种空洞率的多尺度空洞注意力的时间复杂度为$ O\left({I}\left|E_{\eta}\right|d+{In}d^{2}\right) $,其中$ \left| {E}_{\eta }\right| $为空洞稀疏化后的边数;Bagging理论的集成操作复杂度为$ O\left(n\right. \left. \left(M+{I }\right)\right) $. 总复杂度为$ O\left(M\left| E\right| d+ \left(M+{I }\right)n{d}^{2}+ {I }\left| {E}_{\eta}\right| d\right) $.

2.3. 正则化和探索策略的引入

在多个智能体间的实际协作交互中,GCRL-EDA将预测输出的概率分布与真实标签的概率分布进行比较,以计算交叉熵损失. 为了保持注意力机制在时序上的一致性,GCRL-EDA通过最小化当前时刻注意力权重分布与下一时刻注意力权重分布的KL散度,促使注意力权重在较短时间内保持稳定,从而增强交互关系的连续性. 随着网络层数加深,模型所获取的感知域范围扩大,能够学习到更多层次的特征信息. 因此,对最后1个卷积层的注意力权重分布采用图正则化方法进行优化. 为进一步降低模型过拟合风险,对$ \theta $施加正则化约束. 整个算法的总体损失函数为

$ \begin{split} {L}_{\mathrm{To}}\left(\theta \right)= & L\left(\theta \right)+{\lambda }_{1}\dfrac{1}{M}\displaystyle\sum\limits_{m=1}^{M}{D}_{{\mathrm{KL}}}\left(g_{m}^{\kappa }\left({O}_{i,C};\theta \right)||g_{m}^{\kappa }\left(O_{i,C}^{\prime};\theta \right)\right)+ \\& \dfrac{{\lambda }_{2}}{2m}\displaystyle\sum\limits_{j=1}^{n}\theta _{j}^{2}.\end{split} $

式中:$ {\lambda }_{1} $为权重分布正则化系数,$ {\lambda }_{2} $为参数正则化系数,$ g_{m}^{\kappa }\left({O}_{i,C};\theta \right) $为在卷积层$ \kappa $中智能体$ i $的注意力头m的关系表示的注意力权重分布.

为了解决在复杂动态环境中多个智能体所面临的探索与利用的矛盾问题,通常会使用$ \varepsilon $-贪心策略来探索行动.

$ \pi \left(a|s\right)=\left\{\begin{array}{l} 1-\varepsilon +\dfrac{\varepsilon }{\left| A\left(s\right)\right| }, \quad a={a}^{*};\\\dfrac{\varepsilon }{\left| A\left(s\right)\right| }, \quad a\neq {a}^{*}.\end{array}\right.$

式中:$ \varepsilon \in \left(0,\;1.0\right) $用于决定何时进行探索,其核心思想是以概率$ \varepsilon $随机选择动作,以概率$ 1-\varepsilon $选择当前最优的动作,实现探索与利用的平衡. 然而,式(9)所示传统$ \varepsilon $-贪心算法在探索过程中对所有行动的选择都采用相同可能性,而忽略相应奖励,未能充分利用可用的信息. 该算法在每个时间步都进行探索决策,这在高维或连续动作空间中可能导致智能体频繁切换动作,难以完成连贯、有意义的探索序列. 为提高通过探索带来更高回报的动作概率,提出改进的暂时拓展$ \varepsilon {\textit{z}} $-贪心算法. 在传统算法中添加参数$ {\textit{z}} $,以控制探索动作时的执行步骤数目,平衡探索深度和策略稳定性. 参数$ {\textit{z}} $设置过大,可以实现充分探索,适合高延迟奖励场景,但可能陷入次优动作过久;参数$ {\textit{z}} $设置过小,可以灵活调整动作,但难以适合动态环境,探索不充分. 在生存环境、机器人控制等长周期环境,$ {\textit{z}} $需要覆盖关键延迟. 若智能体到达目标的最优路径平均需要Oa步,参数z设置为z ≈ 0.3Oa~0.5Oa,以确保动作探索能够覆盖部分有效路径.

此外,探索概率$ \varepsilon $需协同考虑. 在训练初期,设置较大的初始$ {\varepsilon }_{\mathrm{initial}}=0.99 $,鼓励充分探索. 随着训练进行,$ \varepsilon $逐步衰减至$ {\varepsilon }_{\mathrm{min}}=0.01 $,最终策略趋于稳定和利用. $ \varepsilon $的线性衰减公式定义为

${\varepsilon }_{t}=\max \left({\varepsilon }_{\mathrm{min}},{\varepsilon }_{\mathrm{ini}t\mathrm{ial}}-\dfrac{{t_{\mathrm{step}}}}{T}\left({\varepsilon }_{\mathrm{initial}}-{\varepsilon }_{\mathrm{min}}\right)\right).$

式中:$ t_{\mathrm{step}} $为当前训练步数,$ {\varepsilon }_{t} $为第$ t_{\mathrm{step}} $步时的探索率,$ T $为总运行步数. 式 (10)可以使智能体在学习前期倾向于探索,在学习后期倾向于利用. 因此,暂时拓展$ \varepsilon {\textit{z}} $-贪心算法能够迅速探索更广泛的区域.

综上,GCRL-EDA的主要目标不仅是使所有智能体的累计奖励总和最大化,而且要实现多智能体系统的总体目标,推动多智能体之间的合作与竞争. GCRL-EDA算法的过程总结如下.

算法1 GCRL-EDA 算法伪代码

输入:观测空间O,动作空间A,转移概率P,当前观测oi,当前邻接矩阵ci,当前奖励ri,智能体的数量n,隐藏层维度D,动作的数目Na,目标注意力attenTq值的期望qe,参数正则化L2,探索参数ε

输出:优化的策略π

1: For 回合tstep=1 to n_episode do

2: 初始化经验回放缓存器BU=[]和当前动作ai=[]

3: For step=1 to max_step do

4: For na=1 to Na do

5:  计算最优策略π利用暂时拓展εz-贪心算法

6:  增加$ {o}_{i,{{n}_{a}}},{\boldsymbol{c}}_{i,{{n}_{a}}},{r}_{i,{{n}_{a}}},{a}_{i,{{n}_{a}}} $到BU

7:  通过深度Q网络(deep Q-network, DQN)计算$ {o}_{i,{{n}_{a}}+1} $,邻接矩阵$ {\boldsymbol{c}}_{i,{{n}_{a}}+1} $,奖励$ {r}_{i,{{n}_{a}}+1} $

$ {o}_{i,{{n}_{a}}+1},{\boldsymbol{c}}_{i,{{n}_{a}}+1},{r}_{i,{{n}_{a}}+1}=\mathrm{DQN}\left({o}_{i,{{n}_{a}}+1},{a}_{i,{{n}_{a}}+1}\right) $

8:  For e=1 to n_epoch do

9:  qq和注意力atten:$ q,\mathrm{atten} = \mathrm{GCRL}\left(n,O,D,{N}_{a}\right) $

10:  KL损失:$ \mathrm{kl}\_ \mathrm{loss}=\mathrm{kl}\_ \mathrm{divergence}(\mathrm{atten},\mathrm{atte}{\mathrm{n}}_{T}) $

11:   损失:$ \mathrm{loss}=\left(q-{q}_{e}\right)+{\lambda }_{1}*\mathrm{kl}\_ \mathrm{loss}+{\lambda }_{2}*{L}_{2} $

12:  End for

13: End for

14: End for

15: End for

3. 实验和仿真

在多智能体Surviving环境、路由器任务、高速公路以及城市道路汽车驾驶任务中,将GCRL-EDA与3个最新的基准模型进行比较:文献[22]所提出的传统多智能体图卷积强化学习(传统GCRL)、文献[26]所提出的GCRL-MHA、本研究所提出的GCRL-MSDA. 由于动作选择随机性和环境动态性,每次实验的值可能有差异,所有实验独立运行5次,取均值.

3.1. Surviving环境

利用图2所示的部分Surviving环境评估所提出算法在大规模多智能体任务下的性能. 该多智能体环境配置100个能与周围环境进行交互的智能体. 每个智能体对应1个网格,该网格提供不同的有限局部观察,其观测区域是以智能体为中心的3×3网格方形框. 智能体可以在由7×7网格定义的方形区域内与相邻多个智能体进行通信. 在每个时间步长内,每个智能体可以移动到其相邻4个网格中的1个,或者吃掉其所在位置的食物. 智能体初始健康值为10,每执行一步,健康值减少1,吃掉食物增加1. 若智能体的健康值达到0,获得–0.2的奖励;否则,奖励为0.4. 在本次实验中,损失函数系数$ \lambda $=0.9,折扣因子$ \gamma $=0.99,$ \varepsilon {\textit{z}} $-贪心算法阈值为0.9,批量大小为64,缓存器大小为650 000,回合数为800,每个回合最大步数为500,隐藏层维度为64.

图 2

图 2   Surviving环境

Fig.2   Surviving environment


GCRL-EDA、GCRL-MSDA、GCRL-MHA以及传统GCRL的分数如图3所示. 分数是智能体在完成任务或达到目标的学习过程中多次独立运行获得的奖励函数累加的平均,即

图 3

图 3   所提算法与基准算法的分数对比

Fig.3   Comparison of scores between proposed algorithms and benchmark algorithms


结果表明,传统GCRL的分数最低,这是由于GCRL采用的标准卷积方法无法有效地捕捉动态矩阵. 尽管GCRL-MHA在算法收敛时表现良好,但其收敛速度较慢. GCRL-MSDA的收敛速度较快,但在算法收敛时分数低于GCRL-MHA的分数. 所提出的GCRL-EDA集成GCRL-MSDA和GCRL-MHA的优势,获取多尺度上下文信息,降低了计算需求,解决了过拟合问题,因此获得了最高分数和最快收敛速度.

理论分析表明,GCRL-EDA通过引入图正则化以聚焦未来学习中处于通信范围内的智能体,从而增强团队合作的一致性. 适当的图正则化能够加快学习进程. 将式(8)中图正则化系数λ1设置为1.5、1.5×10–1、1.5×10–3、1.5×10–5、1.5×10–9,以验证GCRL-EDA的性能. 在不同的λ1下,GCRL-EDA的分数如图4所示. 实验结果表明,当λ1=1.5×10–3时,GCRL-EDA的分数最高,收敛速度最快,而过小或过大的图正则化都会影响算法的学习精度.

图 4

图 4   不同图正则化系数下所提出算法的分数

Fig.4   Scores of proposed algorithm under different graph regularization coefficients


为进一步评估所提出算法的性能,在KL-损失kl_loss、注意力值atten和q值3方面对GCRL-EDA与GCRL-MHA进行比较. 图5所示的实验结果表明,与GCRL-MHA相比,GCRL-EDA在学习多智能体策略的过程中具有更低的KL-loss和atten,并且具有更高的q值. 因此,GCRL-EDA的性能优于GCRL-MHA.

图 5

图 5   Surviving环境中所提算法和基准算法的结果

Fig.5   Results of proposed algorithm and benchmark algorithm in surviving environment


在Surviving环境中算法收敛时,传统GCRL、GCRL-MHA、GCRL-MSDA和GCRL-EDA的结果如表1所示. 成功率为多智能体实现目标的回合数在所有回合数的占比. 与其他算法相比,GCRL-EDA不仅表现出更低的损失值、KL-loss和atten,而且q值和成功率也更高,其表现显著优于传统GCRL、GCRL-MHA和GCRL-MSDA.

表 1   所提算法与基准算法收敛时的实验结果

Tab.1  Experimental results when proposed algorithm and benchmark algorithms converge

算法损失值KL-lossattenq成功率
传统GCRL6.15×10163.99×1016–3.93×10158.800.68
GCRL-MHA7.54×10135.02×1016–4.87×10159.210.71
GCRL-MSDA6.82×10104.58×1016–4.89×101511.590.89
GCRL-EDA6.88×1074.54×1016–4.93×101512.020.92

新窗口打开| 下载CSV


为验证所提出算法的时间复杂度,对算法的运行时间进行比较. 传统GCRL的运行时间为345 min. 由于MSDA模块对不同头具有不同空洞率,该算法能够有效地在接收区域中聚合不同尺度的多尺度信息,从而减少自注意力机制的冗余和全局计算成本,因此GCRL-MSDA的运行时间为240 min. 所提出的GCRL-EDA的运行时间为249 min. 虽然GCRL-EDA的运行时间不是最优的,但基于图35表1的实验结果,GCRL-EDA通过集成MSDA和MHA,既考虑了计算复杂度,又考虑了策略的准确性,因此该算法具有最佳性能.

为验证GCRL-EDA中暂时拓展$ \varepsilon {\textit{z}} $-贪心方法的有效性,进行消融实验,结果如图6(a)所示. 所提出的具有暂时拓展$ \varepsilon {\textit{z}} $-贪心算法的GCRL-EDA利用参数z来控制执行步骤数量. 此方法能够充分利用现有信息,增加能带来更高奖励的探索动作的概率. 在算法收敛时,与基于传统$ \varepsilon $-贪心方法的GCRL-EDA相比,所提出的具有深度探索的GCRL-EDA可以获得更高的分数. 为验证图正则化对GCRL-EDA影响的消融实验结果如图6(b)所示. 在所提出的GCRL-EDA中,损失函数通过不同头的注意力权重的加权平均值来计算. 这种对卷积层注意力权重分布的正则化有助于注意力权重在较短时间内保持稳定. 因此,与没有图正则化的GCRL-EDA相比,具有图正则化的GCRL-EDA取得了更高的分数.

图 6

图 6   不同策略和图正则化的消融实验结果

Fig.6   Results of ablation experiments with different policies and graph regularization


3.2. 路由器环境

路由器网络由L个路由器组成. 每个路由器随机连接到一定数量的其他路由器(在实验中为3个),并且网络拓扑结构是固定的. 有N个随机大小的数据包,每个数据包都随机分配1个源路由器和1个目标路由器. 如果多个数据包的总大小超过1条链路的带宽,它们就不能同时通过该链路. 在本实验中,将每个数据包视为1个“智能体”,其目标是快速到达目的地并避免拥塞. 在每个时间步长内,观察内容包括数据包的自身属性(即当前位置、目的地和数据大小)、与其当前位置相连的边属性(即负载、长度)以及相邻的数据包(在相连的边或路由器上). 本实验设置N=20和L=20,并对2 000组模型进行训练.

为直观地展示路由器在训练过程中的学习情况,在训练过程中,随着路由器的学习进程推进,选取数据学习过程中动态节点的变化图,如图7所示.

图 7

图 7   学习过程中变化图的动态节点

Fig.7   Variation graphs of dynamic nodes in learning processes


表2展示了当迭代轮次分别为1、10、20、30时,3种算法的分数情况. 可以看出,在学习过程中,随着轮次的增加,GCRL-EDA的分数低于GCRL-MHA和GCRL-MSDA. 这是因为GCRL-EDA使用了Bagging理论来获取多尺度信息,其性能优于其他算法.

表 2   GCRL-MHA、GCRL-MSDA、GCRL-EDA的分数

Tab.2  Scores of GCRL-MHA, GCRL-MSDA, GCRL-EDA

轮次scores
GCRL-MHAGCRL-MSDAGCRL-EDA
169.56118.05130.85
1076.1079.9454.12
2020.4525.3621.26
3024.1322.8722.41

新窗口打开| 下载CSV


3.3. 高速公路驾驶环境

为进一步评估所提出算法的性能,针对复杂高速公路场景下的汽车自主驾驶任务进行实验. 在核心场景highway-v0中,自动驾驶车辆的目标为高速行驶、避免碰撞其他观察车辆以及靠右行驶. 环境的默认设置为四车道高速公路,通过建立智能驾驶员模型以模拟真实的车辆跟随和变道逻辑. 观察到的状态包括车辆的位置、速度、转向角度等. 观察范围涵盖周围车辆的动态信息. 各自动驾驶车辆的离散操作包括:静止(保持当前状态)、左转(变更车道至左侧)、右转(变更车道至右侧)、加速和减速. 此外,奖励函数综合考虑了速度奖励(速度在设定范围内时,奖励随速度线性增加)、车道位置奖励(在右侧车道行驶可以获得更高的奖励)以及碰撞惩罚(发生碰撞时,比赛立即终止并给予负奖励). 该环境的运行参数如下:总时间步数为20 000,折扣因子为0.99,加速区间为[–3.5,3.5],在路奖励为0.1,缓存大小为1×106,速度区间为[10,25],车辆数目为50,高速度奖励为0.5,碰撞奖励为–1.

在highway-v0环境中,为评估所提出的GCRL-EDA的性能,将其与多智能体近端策略优化(multi-agent proximal policy optimization, MAPPO)[27]和GCRL-MHA进行对比实验. 所得到的损失、价值差异和梯度结果如图8(a)所示. 与MAPPO和GCRL-MHA相比,GCRL-EDA能够充分利用多尺度信息,并很好地平衡探索与利用,解决过拟合问题. 因此,GCRL-EDA的损失和价值差异更小,梯度更大. 为进一步评估该算法的性能,在高速公路highway-fast-v0环境中进行实验,实验结果如图8(b)所示. 其核心目标是提高模拟速度,以满足深度强化学习的大规模训练需求. 代价是部分降低模拟精度,即通过简化物理计算或减少环境细节来实现加速. 与图8(a)的分析类似,图8(b)的结果表明,在highway-fast-v0环境中,GCRL-EDA的性能优于GCRL-MHA和MAPPO.

图 8

图 8   高速路环境下所提算法与基准算法的实验结果

Fig.8   Results of proposed algorithm and benchmark algorithms in highway environments


在highway-fast-v0环境中,MAPPO、GCRL-MHA和GCRL-EDA运行时,总时间步数分别为100 608、9 599和3 478. 因此,GCRL-EDA的时间复杂度低于MAPPO和GCRL-MHA.

采用复杂的交汇路口环境Intersection-v0来评估GCRL-MHA和GCRL-EDA的性能. 图9所示结果显示,GCRL-EDA的q值和学习率αl高于GCRL-MHA,且收敛更快. 因此,GCRL-EDA能够更好地平衡探索和利用,其性能优于GCRL-MHA.

图 9

图 9   交汇路口环境中所提算法与基准算法的q值和学习率

Fig.9   q value and learning rate of proposed algorithm and benchmark algorithm in Intersection-v0


在highway-v0和highway-fast-v0汽车驾驶环境中,获得了与学习率、损失函数、价值函数、GPU温度、GPU利用率等相关结果. 为增强实验结果的全面性和说服力,图10列出了DGN-EDA算法在highway-fast-v0环境下的αlq值、GPU温度θGPU、GPU利用率us. 从图10(a)可见,在学习过程中,GCRL-EDA的αl不断降低,说明暂时拓展$ \varepsilon {\textit{z}} $-贪婪方法的引入有助于平衡探索与利用,使得车辆在学习过程的早期阶段更倾向于探索,在后期阶段更倾向于利用. 图10(b)中,从第600步开始,q值收敛到约25. 图10(c)~(d)分别以θGPU和us展示了算法运行期间的计算资源利用情况,算法的资源利用率整体比较稳定.

图 10

图 10   所提出算法在快速高速路环境下的学习率、q值、GPU温度及利用率

Fig.10   Learning rate, q value, GPU temperature and utilization of proposed algorithm in highway-fast-v0 environment


3.4. 复杂城市道路自主驾驶环境

高速公路一般为单向多车道的封闭环境,交通规则简单,且高速公路上主要为同质化的机动车,行为相对可预测;车辆交互多为纵向(前后车),且大多数路段为弱交互,高速公路实验相对简单. 在城市道路环境中,道路结构复杂(如十字路口、环岛),交通规则繁多(如交通信号灯、停车标志、让行规则等),交通参与者类型多样(如机动车、公交车),行为意图多变,使得城市道路环境更为复杂. 在3.3节高速公路自主驾驶环境验证所提出算法性能的基础上,设计复杂城市场景十字路口,以验证GCRL-EDA的稳健性. 十字路口城市车辆间的部分交互图如图11所示. 为验证所提算法的稳健性,设置不同复杂度的车辆驾驶环境:在双向四车道中分别设置同时存在10、20、40辆车,对应低密度、中等密度、高密度3种十字路口环境En1、En2、En3. 高密度的十字路口环境通常会出现拥堵,通行效率下降,博弈行为变得极其复杂. 图11展示了十字路口的部分截图,包括1条双向四车道公路与部分车辆. 车辆目标是安全地穿过繁忙的十字路口. 该环境的运行参数如下:总时间步数为200 000,折扣因子为0.99,训练批次大小为128,预训练时间步数为1 000,重放内存缓冲区大小1×106.

图 11

图 11   十字路口城市车辆间的部分交互图网络

Fig.11   Partial interaction graph network between urban vehicles at intersection


在En1、En2、En3这3种不同复杂度的十字路口环境中,所获得的奖励值分别为3.45、3.73、3.46,损失函数值分别为0.486、0.592、0.726,平均历经时间分别为1 148、1 196、1 258 min. GCRL-EDA在3种环境中的奖励值较为集中. 随着车辆数量增加,算法性能未出现任何崩溃或显著下降,说明GCRL-EDA学到的决策策略具有普适性与稳健性. 在更复杂的环境中,决策优化难度随之提高,损失值相应增大,平均历经时间也相应延长. 损失值和历经时间随着环境复杂度增加而上升,符合预期. 尽管损失升高,历经时间增长,算法最终仍能保持良好的整体性能并获得高奖励,进一步证明了GCRL-EDA所得最优策略的有效性和鲁棒性.

4. 结 语

提出基于混合空洞注意力机制的集成多智能体图卷积强化学习方法(GCRL-EDA),以获取底层图的动态矩阵. 在GCRL-EDA中,通过Bagging理论集成多头注意力机制和多尺度空洞注意力机制,以获取多尺度的上下文信息并减少计算量. 在GCRL-EDA中引入图正则化以促进模型稳定性和缓解过拟合问题. 为实现探索与利用之间的平衡,采用深度探索贪婪算法进行多智能体动作选择. 实验结果表明,在复杂高动态环境中,所提出算法的决策性能明显优于现有基线方法. 为验证所提算法GCRL-EDA的实用价值,下一步的核心任务是将GCRL-EDA与复杂真实场景中的群体交通系统数据(例如与高德地图接洽,获取“宁波市环路摄像头数据”)进行集成,构建高保真实验环境.

参考文献

张萌, 王殿海, 金盛

结合领域经验的深度强化学习信号控制方法

[J]. 浙江大学学报: 工学版, 2023, 57 (12): 2524- 2532

[本文引用: 1]

ZHANG Meng, WANG Dianhai, JIN Sheng

Deep reinforcement learning approach to signal control combined with domain experience

[J]. Journal of Zhejiang University: Engineering Science, 2023, 57 (12): 2524- 2532

[本文引用: 1]

CHU K F, LAM A Y, LI V O

Traffic signal control using end-to-end off-policy deep reinforcement learning

[J]. IEEE Transactions on Intelligent Transportation Systems, 2022, 23 (7): 7184- 7195

DOI:10.1109/TITS.2021.3067057     

郭方洪, 伍泽芃, 杨淏, 等

基于个性化联邦强化学习的异构多微网能量调度

[J]. 自动化学报, 2025, 51 (9): 2072- 2084

DOI:10.16383/j.aas.c250130      [本文引用: 1]

GUO Fanghong, WU Zepeng, YANG Hao, et al

Energy scheduling of heterogeneous multi-microgrid based on personalized federated reinforcement learning

[J]. Acta Automatica Sinica, 2025, 51 (9): 2072- 2084

DOI:10.16383/j.aas.c250130      [本文引用: 1]

GAUTIER P, LAURENT J, DIGUET J P

Deep Q-learning-based dynamic management of a robotic cluster

[J]. IEEE Transactions on Automation Science and Engineering, 2023, 20 (4): 2503- 2515

DOI:10.1109/TASE.2022.3205651      [本文引用: 1]

SHI D, LI L, OHTSUKI T, et al

Make smart decisions faster: deciding D2D resource allocation via stackelberg game guided multi-agent deep reinforcement learning

[J]. IEEE Transactions on Mobile Computing, 2022, 21 (12): 4426- 4438

DOI:10.1109/TMC.2021.3085206      [本文引用: 1]

MUNIKOTI S, AGARWAL D, DAS L, et al

Challenges and opportunities in deep reinforcement learning with graph neural networks: a comprehensive review of algorithms and applications

[J]. IEEE Transactions on Neural Networks and Learning Systems, 2024, 35 (11): 15051- 15071

DOI:10.1109/tnnls.2023.3283523      [本文引用: 1]

荣垂田, 田浩辉, 杜方

多目标深度强化学习驱动的数据库系统参数优化技术

[J]. 软件学报, 2025, 36 (12): 5512- 5536

DOI:10.13328/j.cnki.jos.007405      [本文引用: 1]

RONG Chuitian, TIAN Haohui, DU Fang

Technique for database system parameter optimization using multi-objective deep reinforcement learning

[J]. Journal of Software, 2025, 36 (12): 5512- 5536

DOI:10.13328/j.cnki.jos.007405      [本文引用: 1]

ZHAO X Y, WU C. Large-scale machine learning cluster scheduling via multi-agent graph reinforcement learning [C]// Thirty-Second AAAI Conference on Artificial Intelligence. Menlo Park: AAAI, 2022: 25082515.

[本文引用: 1]

PU Z Q, WANG H M, LIU Z, et al

Attention enhanced reinforcement learning for multi agent cooperation

[J]. IEEE Transactions on Neural Networks and Learning Systems, 2023, 34 (11): 8235- 8249

DOI:10.1109/TNNLS.2022.3146858     

李岳珩, 谢广明

集中训练分布执行下的多智能体强化学习综述

[J]. 控制理论与应用, 2025, 42 (11): 2114- 2124

DOI:10.7641/CTA.2025.50009      [本文引用: 1]

LI Yueheng, XIE Guangming

Review of multi-agent reinforcement learning under centralized training with decentralized execution

[J]. Control Theory and Applications, 2025, 42 (11): 2114- 2124

DOI:10.7641/CTA.2025.50009      [本文引用: 1]

XING Q, XU Y, CHEN Z, et al

A graph reinforcement learning-based decision-making platform for real-time charging navigation of urban electric vehicles

[J]. IEEE Transactions on Industrial Informatics, 2023, 19 (3): 3284- 3295

DOI:10.1109/TII.2022.3210264      [本文引用: 1]

HOUIDI O, BAKRI S, ZEGHLACHE D. Multi-agent graph convolutional reinforcement learning for intelligent load balancing [C]// NOMS 2022-2022 IEEE/IFIP Network Operations and Management Symposium. Piscataway: IEEE, 2022: 1-6.

[本文引用: 1]

LIN W Y, SONG Y Z, RUAN B K, et al

Temporal difference-aware graph convolutional reinforcement learning for multi-intersection traffic signal control

[J]. IEEE Transactions on Intelligent Transportation Systems, 2023, 25 (1): 327- 337

[本文引用: 1]

LUO J, LI C F, FAN Q Q, et al

A graph convolutional encoder and multi-head attention decoder network for tsp via reinforcement learning

[J]. Engineering Applications of Artificial Intelligence, 2022, 112: 104848

DOI:10.1016/j.engappai.2022.104848      [本文引用: 1]

DU X Q, CHEN H C, XING Y H, et al

A contrastive enhanced ensemble framework for efficient multi-agent reinforcement learning

[J]. Expert Systems with Applications, 2024, 245: 123158

DOI:10.1016/j.eswa.2024.123158      [本文引用: 1]

HU Y F, FU J J, WEN G H

Graph soft actor-critic reinforcement learning for large-scale distributed multirobot coordination

[J]. IEEE Transactions on Neural Networks and Learning Systems, 2025, 36 (1): 665- 676

DOI:10.1109/TNNLS.2023.3329530      [本文引用: 1]

XIE S R, ZHANG H, YU H, et al

ET-HF: a novel information sharing model to improve multi-agent cooperation

[J]. Knowledge-based Systems, 2022, 257: 109916

DOI:10.1016/j.knosys.2022.109916      [本文引用: 1]

罗佳, 李朝锋

基于残差图卷积网络与深度强化学习的需求可拆分车辆路径优化算法

[J]. 控制理论与应用, 2024, 41 (6): 1123- 1136

DOI:10.7641/CTA.2023.21040      [本文引用: 1]

LUO Jia, LI Chaofeng

The split delivery vehicle routing optimization with the residual graph convolutional network and deep reinforcement learning

[J]. Control Theory and Applications, 2024, 41 (6): 1123- 1136

DOI:10.7641/CTA.2023.21040      [本文引用: 1]

GOECKNER A, SUI Y Y, MARTINET N, et al. Graph neural network-based reinforcement learning for multi-agent systems [C]// Thirty-Sixth Conference on Neural Information Processing Systems. Cambridge: MIT Press, 2022: 1-8.

[本文引用: 1]

MA X, XIE Y, CHIGAN C

Graph convolutional network based multi-objective meta-deep Q-learning for eco-routing

[J]. IEEE Transactions on Intelligent Transportation Systems, 2024, 25 (7): 7323- 7338

DOI:10.1109/TITS.2023.3348034      [本文引用: 1]

ELLIS J D, IQBAL R, YOSHIMATSU K

Deep Q-learning-based molecular graph generation for chemical structure prediction from infrared spectra

[J]. IEEE Transactions on Artificial Intelligence, 2024, 5 (2): 634- 646

DOI:10.1109/TAI.2023.3287947      [本文引用: 1]

ROKHFOROZ P, MONTAZERI M, FINK O

Multi-agent reinforcement learning with graph convolutional neural networks for optimal bidding strategies of generation units in electricity markets

[J]. Expert Systems with Applications, 2023, 225: 120010

DOI:10.1016/j.eswa.2023.120010      [本文引用: 2]

XIA L Q, LIANG Y S, LENG J W, et al

Maintenance planning recommendation of complex industrial equipment based on knowledge graph and graph neural network

[J]. Reliability Engineering and System Safety, 2023, 232: 109068

DOI:10.1016/j.ress.2022.109068      [本文引用: 1]

YE Y, JI S H

Sparse graph attention networks

[J]. IEEE Transactions on Knowledge and Data Engineering, 2023, 35 (1): 905- 916

DOI:10.1109/TKDE.2021.3072345      [本文引用: 1]

FAWAZ H, LESCA J, QUANG P T, et al

Graph convolutional reinforcement learning for collaborative queuing agents

[J]. IEEE Transactions on Network and Service Management, 2023, 20 (2): 13631377

DOI:10.1109/tnsm.2022.3226605      [本文引用: 2]

JIANG J C, DUN C, HUANG T J, et al. Graph convolutional reinforcement learning [C]// International Conference on Learning Representations. Washington DC: [s.n.], 2020: 1-13.

[本文引用: 1]

WANG J C, XU Y, ZHOU Y. Cooperative hunting of unmanned surface vehicles via multi-agent proximal policy optimization algorithm [C]// 2024 IEEE International Conference on Unmanned Systems. Piscataway: IEEE, 2024: 7-12.

[本文引用: 1]

/