浙江大学学报(工学版), 2026, 60(10): 2207-2214 doi: 10.3785/j.issn.1008-973X.2026.10.013

计算机技术与控制工程

面向车联网差异化干扰的联邦强化学习资源管理

李幸星,, 杨凡, 黄杰,, 赖显智, 姚凤航, 蔡杰良, 张妮

重庆理工大学 电气与电子工程学院,重庆 400054

Federated reinforcement learning for resource management in vehicular networks with differentiated interferences

LI Xingxing,, YANG Fan, HUANG Jie,, LAI Xianzhi, YAO Fenghang, CAI Jieliang, ZHANG Ni

School of Electrical and Electronic Engineering, Chongqing University of Technology, Chongqing 400054, China

通讯作者: 黄杰,男,副教授. orcid.org/0000-0002-4826-5732. E-mail: huangjie_cq@cqut.edu.cn

收稿日期: 2025-04-14  

基金资助: 国家自然科学基金资助项目(62301094);重庆市教育委员会科技研究计划资助项目(KJQN202201157,KJQN202301135);重庆理工大学2025年研究生创新项目资助(gzlcx20253147, gzlcx20253156) .

Received: 2025-04-14  

Fund supported: 国家自然科学基金资助项目(62301094);重庆市教育委员会科技研究计划资助项目(KJQN202201157,KJQN202301135);重庆理工大学2025年研究生创新项目资助(gzlcx20253147,gzlcx20253156).

作者简介 About authors

李幸星(2001—),男,硕士生,从事无线通信理论研究.orcid.org/0009-0008-7439-183X.E-mail:2409299367@qq.com , E-mail:2409299367@qq.com

摘要

密集车联网(IoV)中车辆通信范围重叠易引发干扰,不同车辆受干扰源及强度差异形成差异化干扰,直接导致通信数据丢失、速率下降、延迟增加,显著加剧信道与功率管理挑战. 为此,提出基于联邦强化学习的资源管理框架. 该框架以接收端为中心建立干扰权值模型,并定义干扰度来量化车辆间的差异化干扰. 提出以最大化网络吞吐量和资源复用率为目标的资源分配优化问题. 将无线资源分配的组合优化问题转化为马尔可夫决策过程模型,并提出基于联邦强化学习的资源管理算法. 仿真实验表明,在密集车联网场景下,所提方法相较于传统算法展现出显著优势:网络吞吐量平均提升28.13%,信干噪比性能提高54.2%,资源复用率增幅达48.7%. 研究成果验证了基于联邦强化学习的资源管理方法能有效提升密集车联网的整体网络性能.

关键词: 密集车联网 ; 干扰权值 ; 马尔可夫决策过程 ; 联邦强化学习 ; 资源管理

Abstract

In dense Internet of Vehicles (IoV) networks, overlapping vehicular communication ranges easily cause interference. Variations in interference sources and intensities among vehicles result in differentiated interference, which directly leads to packet loss, reduced transmission rates, and increased latency, thereby significantly increasing the difficulty of channel and power management. To address this issue, a federated reinforcement learning-based resource management framework was proposed. A receiver-centric interference weight model was established and an interference metric was defined to quantify differentiated interference among vehicles. An optimization problem was formulated to maximize both network throughput and resource reuse efficiency. The combinatorial resource allocation problem was transformed into a Markov decision process, and a federated reinforcement learning-based resource management algorithm was developed. Simulation results demonstrated that in dense IoV scenarios, the proposed method exhibited significant advantages over traditional algorithms: average network throughput increased by 28.13%, signal-to-interference-plus-noise ratio performance increased by 54.2%, and resource reuse rate rised by 48.7%. These results validated that the federated reinforcement learning-based resource management approach effectively enhanced the overall network performance in dense IoV networks.

Keywords: dense internet of vehicles ; interference weight ; Markov decision process ; federated reinforcement learning ; resource management

PDF (2189KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

李幸星, 杨凡, 黄杰, 赖显智, 姚凤航, 蔡杰良, 张妮. 面向车联网差异化干扰的联邦强化学习资源管理. 浙江大学学报(工学版)[J], 2026, 60(10): 2207-2214 doi:10.3785/j.issn.1008-973X.2026.10.013

LI Xingxing, YANG Fan, HUANG Jie, LAI Xianzhi, YAO Fenghang, CAI Jieliang, ZHANG Ni. Federated reinforcement learning for resource management in vehicular networks with differentiated interferences. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(10): 2207-2214 doi:10.3785/j.issn.1008-973X.2026.10.013

随着智能交通的快速发展,车联网(Internet of Vehicles, IoV)技术日益成为现代城市交通管理的重要组成部分[1-3]. 越来越多的车辆配备先进的通信和传感能力,这些智能车辆可以通过车辆到车辆(vehicle to vehicle,V2V)链路和车辆到基础设施(vehicle to infrastructure, V2I)链路进行实时信息交换和协作,从而形成密集的车联网[4-5]. 在密集IoV中,车辆通信范围重叠易引发干扰. 尤为关键的是,不同车辆所受干扰源及强度存在差异,形成了差异化干扰[6-7]. 差异化干扰将导致通信过程中数据丢失、速率下降及延迟增加,显著加剧了密集IoV中信道与功率管理的挑战[8-10]. 因此,亟需一种有效的解决方案来减轻车辆通信范围重叠造成的差异化干扰,进而确保实现可靠通信.

近年来,车联网中通信需求与通信资源之间的矛盾日益加剧,许多研究者提出多种资源分配优化方案,以实现车联网中高效的网络资源分配. Cheng等[11]基于博弈论实现分布式频谱接入. 为了应对当前网络架构中大规模数据传输的挑战,Chien等[12]采用长短期记忆网络并结合遗传算法提出资源分配算法,极大提高了资源利用效率. Yang等[13]通过联合优化任务卸载与资源配置最大化网络吞吐量. Jia等[14]提出优化算法降低通信开销. Sun等[15]利用数字孪生优化无人机辅助车联网的资源分配. 然而,这些方案计算开销大、效率低、响应慢,无法满足车联网实时动态资源的需求.

随着机器学习的发展,强化学习已成为车联网资源智能管理的关键技术. 现有研究探索了多种强化方法:Wu等[16]提出深度强化学习混合卸载方案以优化资源利用;Xu等[17]结合双深度Q网络(double deep Q network, DDQN)与深度确定性策略梯度处理混合变量资源管理;Huang等[18]利用强化学习应对高维状态空间挑战. 然而,这些方案多采用集中式架构,未充分考虑密集动态IoV环境下的通信可靠性问题[19]. 为此,分布式与联邦式强化学习框架受到关注:Parvini等[19]开发了基于多智能体深度确定性策略梯度的分布式强化学习框架;文献[20]提出弹性联邦协同缓存方案;Zhang等[21]设计了基于联邦学习的资源负载均衡算法;Li等[22]结合联邦学习与Dueling DDQN优化空-地集成网络资源分配. 然而,这些研究并没有考虑在密集车联网差异化干扰下的信道和功率分配. 现有研究[11-22]难以应对这种差异化干扰,因此,亟需一种有效的解决方案来减轻车辆通信范围重叠造成的差异化干扰,进而确保车辆实现可靠通信.

本研究基于联邦强化学习提出了无冲突的资源分配框架,并命名为FedAvg-AC,以应对密集车联网中的差异化干扰. 主要贡献可概括为:1)定义一种新的干扰模型,称为干扰权值模型,用于分析密集车联网中的车辆差异化干扰. 2)为了量化密集车联网中的干扰程度,定义干扰度,并结合优化理论将资源管理问题转化为组合优化问题. 3)为了解决密集车联网环境下无冲突资源管理的组合优化问题,提出基于联邦强化学习的方法.

1. 系统模型

1.1. 通信网络模型

图1所示,所建立的车联网由基站和大量车辆组成,其中车辆总个数为K. 基站可以通过V2I链路与车辆交换大量数据,而每个车辆可以通过V2V链路与其他车辆通信. 该网络中存在N个V2V链路.

图 1

图 1   车联网场景图

Fig.1   Scenario diagram of Internet of Vehicles


本研究考虑一个时隙划分的准静态通信系统,在每个时隙内车辆位置保持不变,跨时隙则发生变化,信道状态也随之演化. 令系统时隙总个数为T,V2V链路总个数为N,信道总个数为M. 设自变量$ {l}_{n,m} $表示V2V链路对信道的选择,如果第n个V2V链路选择第m个信道,则$ {l}_{n,m}=1 $,反之$ {l}_{n,m}=0 $. 假设每个信道能够被复用,并且每个V2V链路在一个时隙只能选择一个信道,即

$ {l}_{n,m}=\left\{\begin{array}{ll} 1,&信道m被选择;\\0,&信道m未被选择.\end{array}\right. $

$ \sum\limits_{m\in \{1,2,\cdots ,M\}}{l}_{n,m}\leqslant1,\;\forall n\in \{1,2,\cdots, N\}. $

同样,对于发送端功率,每个发送端只能选择一个发射功率.

1.2. 信道模型

V2V无线信道遵循自由空间损耗模型,因此时隙t的信道增益可以表示为

$ h_{m}^{t}[n]=\alpha _{m}^{t}\cdot \beta _{m}^{t}[n],\;\forall n\in \{1,2,\cdots,N\}.$

式中:$ h_{m}^{t}\left[n\right] $表示t时刻第n个V2V链路在第m个信道的信道增益;$ \beta _{m}^{t}[n] $表示小尺度衰落功率分量,假设它服从指数形式的单位均值分布;$ \alpha _{m}^{t} $表示不受频率影响的大尺度衰落现象的参数.

根据瑞利衰落信道模型,信干噪比SINR可以被定义为

$ \gamma_{m}^{t}=\dfrac{P_{ {m}}^{t}\left[n\right]h_{m}^{t}\left[n\right]}{{\sigma }^{2}+ \displaystyle\sum\limits_{n\in \{1,2,\cdots,N\}}{l}_{n,m}P_{ m}^{t}[n]h_{m}^{t}[n]}. $

式中:$ P_{ m}^{t}\left[n\right] $表示t时刻第n个V2V链路在第m个信道的信号发射功率,$ {\sigma }^{2} $表示信道中的加性高斯白色噪声的功率. 因此,第$ n $条V2V链路的数据传输速率为

$ {{R}^{\prime}}_{ n}^{t}=B{\log }_{2}\left(1+\gamma _{m}^{t}\right). $

式中:B表示信道带宽,$ \gamma _{m}^{t} $表示t时刻m信道的信干噪比.

在车联网中,SINR作为一个关键的服务质量参数来评估数据传输的可靠性. 当V2V链路的瞬时SINR下降到阈值$ {\gamma }_{{\mathrm{o}}} $以下时,接收端难以准确解码出所发送的信息,会导致车辆之间的通信中断. 因此,为了确保可靠的V2V传输,SINR须超过指定阈值[23],表达式如下:

$ \gamma _{m}^{t}\geqslant {\gamma }_{{\mathrm{o}}}. $

2. 以接收端为中心的干扰模型

2.1. 干扰模型

为了便于分析图1中差异化干扰问题,如图2所示给出一个车联网干扰示例图,分析具有5个接收端车辆$ \left\{{R}_{1},{R}_{2},\cdots ,{R}_{5}\right\} $和8个发送端车辆$ \left\{{S}_{1},{S}_{2},\cdots ,{S}_{8}\right\} $的干扰示例.

图 2

图 2   车联网干扰示例图

Fig.2   Interference illustration in Internet of Vehicles


在IoV中,可以从式(6)推导出接收端干扰权值,定义如下:

$ \varphi =\dfrac{{P}_{{\mathrm{S}}}}{{P_{ m}^{t}\left[n\right]h_{m}^{t}\left[n\right]}/{{\gamma }_{0}}-{\sigma }^{2}}. $

式中:$ {P}_{{\mathrm{S}}} $表示发送端信号发射功率.

根据接收端的干扰权值,可以将车辆间干扰定义为2种类型.

1) 强干扰:单个发送端对接收端的干扰权值大于或等于门限,即单个发送端对接收端的干扰会影响接收端的正常通信,这种干扰现象称为强干扰,$ \varphi \geqslant {\varphi }_{0}=1 $[24]. 例如,图2S1R1的干扰是强干扰.

2) 弱干扰:单个发送端对接收端的干扰权值小于阈值,称为弱干扰,$ \varphi \lt {\varphi }_{0}=1 $[25]. 例如图2S8R5的干扰为弱干扰.

对于接收端来说,单个发送端造成的微弱干扰往往不会影响车辆之间的正常通信. 但是,接收端受到多个发送端的干扰,会导致车辆之间无法正常通信,这种干扰现象称为累积干扰,即$ \displaystyle\sum\limits_{S}{\varphi }_{S}\geqslant 1 $. 例如,图2S5S6R2的干扰. 无论是累积干扰还是强干扰,都会导致接收端不能正常接收数据,使数据传输速率下降,严重影响车辆之间的正常通信.

2.2. 量化干扰

为了量化干扰模型中的干扰程度,建立干扰矩阵,设置干扰度,以衡量车联网中的干扰程度.

$ G=\left\{S,R,\varphi \right\} $表示干扰权值图,S表示发送端车辆集合$ \left\{{S}_{1},{S}_{2},\cdots ,{S}_{8}\right\} $R表示接收端车辆集合$ \left\{{R}_{1},{R}_{2},\cdots ,{R}_{5}\right\} $.

构造的干扰权值图可以用关联矩阵$ {\boldsymbol{H}}_{} $表示,$ {\boldsymbol{H}}_{}\in {\bf{R}}^{\left| R\right| \times \left| S\right| } $,矩阵元素表示如下:

$ h(r,s)=\left\{\begin{array}{ll} \varphi ,&s\in r;\\0,&s\notin r.\end{array} \right.$

式中:$ h\left(r,s\right) $$ {\boldsymbol{H}}_{} $中第rs列的元素,$ h(r,s)=\varphi $表示sr可以通信,$s\in r $表示s在边r上.

图2所示,通过干扰权值矩阵,可以直接显示IoV中的干扰关系. 在进行通信资源分配时,具有强干扰或累积干扰关系的发送端不能分配相同的通信资源. 例如,图2中的R1上的S1不能与S2S3划分相同的通信资源.

为了衡量接收端受到的干扰,提出基于干扰权值矩阵的参数$\nu $,其可以表示为

$ \nu =\sum\limits_{i}\left(\max \;\left(\dfrac{{{\boldsymbol{c}}}\cdot {{\boldsymbol{e}}}}{{c}[i]},1\right)-1\right). $

式中:${{\boldsymbol{e}}} $表示图2中的一个接收端收到的不同发送端的干扰权值;$ {{\boldsymbol{c}}} $表示接收端中所有发送端的资源分配方案,${c}[i] $表示由接收端r上的发送端i分配的资源;$ \nu =0 $表示在接收端r中所有发送端没有干扰,反之$ \nu \neq 0 $.

因此,整个密集车联网的干扰度I可以定义为

$ I=\sum\limits^{R}_{r=1}\nu . $

式中:R为干扰权值图中接收端的数量.

2.3. 问题公式化

考虑差异化干扰的车联网资源分配问题可以转化为一个组合优化问题. 本研究的主要目标是优化密集部署车联网中的资源分配,避免资源冲突,提高整个车联网的网络吞吐量. 因此,密集部署的车联网中的无冲突资源分配问题可以描述如下:

$ \left.\begin{split} \max \;\;\;&\left(\lambda_1 \displaystyle\sum\limits_{n \in \{1,2,\cdots ,N\}} R_n^{\prime t}+\lambda_2 \eta_{\mathrm{r}}\right) ;\\ { {\mathrm{s.t}}. }\quad & C_1: R_n^{\prime t} \geqslant R_{\min }^{\prime}, \\& C_2: \gamma_m^t \geqslant \gamma_0, \;p \in \{P_1,P_2,\cdots,P_M\}, \\& C_3: l_{n, m} \in(0,1.0), \\& C_4: \displaystyle\sum\limits_{n \in \{1,2,\cdots ,N\}} l_{n, m} \leqslant N, \;\forall m \in \{1,\cdots,M\}, \\& C_5: I=0 .\end{split}\right\}$

式中:${\lambda }_{1}\in (0,1.0) $$ {{R}^{\prime}}_{ n}^{t} $表示数据传输速率,$ {\eta }_{{\mathrm{r}}} $表示资源复用率,$ \gamma _{m}^{t} $表示t时刻m信道的信干噪比,$ {l}_{n,m} $表示V2V链路对信道的选择.

在式(11)中,C1可以确保最小网络吞吐量不小于IoV网络中的最小网络吞吐量,C2确保V2V链路能够彼此通信,即,信干噪比大于最小阈值,C3C4代表IoV资源分配中对信道和功率选择的约束,C5保证IoV网络资源分配应满足无冲突资源分配. 式(11)是时间平均组合优化问题,其在数学上具有挑战性并且在计算上困难.

3. 基于联邦强化学习的资源管理模型

3.1. MDP模型

针对密集车联网资源管理问题,即第2章提出的组合优化问题,首先通过马尔可夫决策过程将其转化为一个序列决策问题[26-27],将V2V链路作为智能体,智能体通过训练不断寻找资源管理方案. 关于状态Z、动作A、奖励$ {J} $的具体定义如下.

1) 状态空间Z:根据t时刻的车联网信息,每个状态空间可以表示为$ Z=\{{M}_{K},\gamma ,M,P\} $,其中$ {M}_{K} $表示信道选择,γ表示信道信干噪比,M表示可用信道总数,P表示发送端选择的传输功率.

2) 动作空间A:各智能体根据当前车联网状态制定资源分配策略. 动作空间的集合可以表示为:$ {A}_{t}=\{{\boldsymbol{a}}_{1},{\boldsymbol{a}}_{2},\cdots ,{\boldsymbol{a}}_{t}\} $. $ {\boldsymbol{a}}_ t$包括信道选择和功率选择,即$ {\boldsymbol{a}}_{t}=\left[{l}_{n,m},{p}_{k,m}\right] $.

3) 奖励函数$ J $:每个智能体根据动作获得的分数可以表示为

$ J{({\boldsymbol{z}},{\boldsymbol{a}})}_{t}={{\lambda }_{1}\sum\limits_{k}{{R}^{\prime}}_{ m}^{t}} +{{\lambda }_{2}{\eta }_{{\mathrm{r}}}} . $

在训练过程中,如果资源管理方案是最优的,即所分配的资源不冲突并且资源复用率最大,则奖励值最大. 反之,则奖励值最小并且为负. 在本研究构建的强化学习网络中,每个智能体都在不断地寻找最大化奖励值的策略. 令$ {Q}^{{\text{π}} }({\boldsymbol{z}},{\boldsymbol{a}}) $表示动作值函数,即在给定策略$ {\text{π}} $的条件下,智能体在状态空间z选取动作a后,所获得的期望累积折扣奖励,可以表示为

$ {Q}^{{\text{π}} }({\boldsymbol{z}},{\boldsymbol{a}})=E\left[\sum\limits_{t=1}^{{\infty }}\rho {J}({\boldsymbol{z}},{\boldsymbol{a}}){|}_{s={{s}_{0}},{\text{π}} }\right]. $

式中:$ \rho $表示折扣率,$ E(\cdot ) $表示期望值,$ {J}({\boldsymbol{z}},{\boldsymbol{a}}){|}_{s={{s}_{0}},{\text{π}} } $表示在$ {{\boldsymbol{z}}}_{0} $状态选择策略$ {\text{π}} $的累积奖励.

3.2. FedAvg-AC

MDP模型可以使用Q学习、策略梯度方法和深度Q学习来解决. 然而,Q学习中Q函数或其近似的缓慢收敛经常导致次优性能,并阻碍在合理的迭代次数内发现最优策略. 此外,Q学习在学习随机策略方面效率较低,特别是在具有连续动作空间的环境中,例如在信道条件和发射功率变化的IoV网络中.

相比之下,策略梯度方法直接在策略空间中操纵策略,与Q学习相比,通常可以更快地收敛到局部最优策略. 为了解决在连续状态和动作空间中学习智能资源管理的最优策略的挑战,AC学习算法集成了策略和Q值学习,旨在有效收敛.

本研究设计的AC框架由Actor和Critic这2个网络组成. Actor网络通过观察网络状态来确定选择行动的策略,而Critic网络使用从环境反馈中获得的奖励来评估该策略. 在V2V链路作为智能体的车联网环境中,每个智能体都自主感知当前的网络条件,并根据其学习的策略采取行动,以分散的方式运行. 在这些操作之后,IoV环境向智能体提供新的状态和即时奖励,使它们能够为后续迭代更新策略.

Actor网络:AC框架的这一部分旨在选择车联网中的动作策略. 构造神经网络以获得策略π并使用梯度下降进行更新:

$ {{\boldsymbol{\theta}} }_{t+1}={{\boldsymbol{\theta}} }_{t}+\beta \cdot {q}_{t}\cdot \dfrac{\partial \log \;{\text{π}} ({\boldsymbol{a}}_{t},{{\boldsymbol{z}}}_{t};{\boldsymbol{\theta}} )}{\partial {\boldsymbol{\theta}} }{\Big |}_{{\boldsymbol{\theta}} ={{{\boldsymbol{\theta}} }_{t}}}. $

式中:$ {{\boldsymbol{\theta }}}_{t} $表示Actor神经网络参数,$ {q}_{t} $表示神经网络函数.

Critic网络:AC算法的评估部分,用于评估学习框架的搜索策略的质量. 在Critic网络中使用神经网络$ q({\boldsymbol{z}},{\boldsymbol{a}};{\boldsymbol{w}}) $来获得近似值函数,即$ {q}_{t}=q\left({{\boldsymbol{z}}}_{t},{\boldsymbol{a}}_{t};{{\boldsymbol{w}}}^{t}\right) $. 在AC强化学习中也使用时间差学习方案来计算估计值和真实值之间的时间差(time difference, TD)误差,其可以表示为

$ {\delta }_{t}={q}_{t}-({r}^{\prime}_{t}+\rho \cdot {q}_{t+1}). $

式中:$ {{{r}^{\prime}}}_{ t} $表示t时刻的奖励值.

当使用神经网络来估计状态值函数时,可以通过使用梯度下降来更新神经网络的参数:

$ {\boldsymbol{w}}^{t+1}={\boldsymbol{w}}^{t}-{\alpha }^{\prime}\cdot {\delta }_{t}\cdot \dfrac{\partial q\left({{\boldsymbol{z}}}_{t},{\boldsymbol{a}}_{t};{\boldsymbol{w}}\right)}{\partial {\boldsymbol{w}}}{\Big|}_{{{\boldsymbol{w}}}={{\boldsymbol{w}}^{t}}}. $

式中:$ {\boldsymbol{w}}^{t} $表示Critic神经网络参数,$ {\alpha }^{\prime} $表示学习率.

然而,AC算法收敛缓慢. 为了解决这个问题,采用联邦学习方法来提高AC算法的收敛速度[28]. 在所考虑的密集IoV网络中,所有智能体都使用FedAvg-AC服务器的全局模型构建本地AC网络. 在全局模型训练期间,每个智能体从本地经验重放池${N} $随机抽取少量数据集$ D $,以更新本地AC模型. 例如,第k个智能体从经验重放池$ {{N}}_{k} $中随机选择一小批样本$ {D}_{k} $,用于更新最小化目标损失函数$ L({{\boldsymbol{w}} }^{t}) $. 在一轮训练结束时,通过参数加权平均来导出FedAvg-AC全局网络参数,其包含该轮学习过程中涉及的局部AC网络参数. FedAvg-AC全局网络在时间t的最小化损失函数$ L({{\boldsymbol{w}} }^{t}) $可以表示为

$ \min \;L({\boldsymbol{w}}^{t})=\sum\limits_{k=1}^{K}\dfrac{|{D}_{k}|}{{\sum}_{k}|{D}_{k}|}L({\boldsymbol{w}}_{k}^{t}). $

式中:$ \left| {D}_{k}\right| $表示数据集$ {D}_{k} $中数据的数量,$ L({\boldsymbol{w}}_{ k}^{t}) $表示本地AC模型损失函数.

在时间t,全局模型的服务器网络参数更新如下:

$ {\boldsymbol{w}}_{k}^{t}=\underset{服务器}{\underbrace{{\boldsymbol{w}}^{t-1}} }-\eta \underset{客户端}{\underbrace{\nabla L({\boldsymbol{w}}_{k}^{t-1})} }, $

$ {\boldsymbol{w}}^{t}=\sum\limits_{k=1}^{K}\dfrac{|{D}_{k}|}{{\sum}_{k}|{D}_{k}|}{\boldsymbol{w}}_{k}^{t}. $

图3所示,在密集车联网中每个智能体首先从服务器获取全局模型$ L({\boldsymbol{w}}^{t-1}) $的最新参数. 然后,计算梯度$ \nabla L({\boldsymbol{w}}_{k}^{t-1}) $,根据梯度下降更新本地模型. 当本地训练完成时,智能体将$ L({\boldsymbol{w}}^{t}) $发送到服务器. 服务器再以群发的方式将AC网络参数发送给每个智能体,对应伪代码如下.

图 3

图 3   基于FedAvg-AC的资源管理框架

Fig.3   FedAvg-AC-based resource management framework


算法1:FedAvg-AC算法

输入:车联网环境

输出:资源分配方案与总奖励值

1. 服务器执行:初始化网络参数

2. for每一轮t=1,2,3,$ \cdots $T, do

3. $ \quad\;\small {{{\boldsymbol{z}}}_{t}=(\text{randomsetofmax}(k,1))\text{clients}} $

4.  for 每个客户端k, do

5.  更新网络参数

6.  end for

7. 根据客户端的平均值,通过式(18)、(19)更新   服务器网络参数

8. end for

9. 客户端网络更新:

10. for 每个本地轮次k=1,2,$ \cdots $,K, do

11.  初始化Actor网络${\boldsymbol{ \theta}} $和Critic网络w,初始化2   个网络的学习率

12.  for t=1,2,$ \cdots $,T, do

13.  根据当前策略$ {{\text{π}} }_{{\boldsymbol{\theta}} } $,在状态zt选择动作at,并执   行动作at,得到$ {r}^{\prime}_{t} $zt+1

14.  使用当前策略$ {{\text{π}} }_{{\boldsymbol{\theta}} } $在状态zt+1选择动作at+1

15.  将它们存储在体验回放池中

16.  从经验回放池中选择一个小批量组

17.  使用策略梯度更新Actor网络的参数

18.  更新Critic网络的参数

19.  end for

20. end for

4. 仿真结果与性能分析

根据3GPP TR 36.885中的城市场景进行仿真实验. 采用的硬件平台为服务器,CPU为Intel Xeon W5-3425,GPU为Nvidia GeForce RTX 4090,内存为32 GB. 在软件方面利用Python 3.11.9和PyTorch 2.1.0 进行实验,仿真实验FedAvg-AC的参数详见表1.

表 1   仿真实验参数列表

Tab.1  Simulation parameters

参数
学习率0.0001
训练次数1000
客户端数量10
经验回放池大小15000
优化器Adam
带宽/ MHz20
折扣率0.95
发送端数量[20,25,30,35,40,45]
载波频率/ GHz2
小批量样本数量64

新窗口打开| 下载CSV


为了验证本研究算法的有效性,将其与随机网络资源分配(RM)、基于贪婪算法(GA)的网络资源分配、基于最大节点度算法(MND)的网络资源分配等算法进行仿真性能比较.

4.1. 强化学习训练的收敛性能

图4所示,针对密集车载物联网环境下的资源管理问题,对比分析传统AC算法与基于联邦平均的FedAvg-AC算法在收敛特性方面的差异. 在整个训练阶段,均使用固定数量的20个发射端数量,训练轮数为2000轮,学习率、折扣率相同,浅色线条表示每一次训练轮次的奖励值,深色线条表示奖励值的收敛趋势. 如图4所示,2种算法的累积奖励值均随着训练轮次增加呈现收敛趋势. 然而,FedAvg-AC算法通过分布式训练能够更快地收敛到稳定状态. 如图4所示证实了引入联邦学习显著提高了算法的收敛速度.

图 4

图 4   FedAvg-AC与AC算法收敛对比图

Fig.4   Convergence performance comparison of FedAvg-AC and AC


图5所示为本研究所提资源管理算法在不同学习率下的收敛速度. 在整个训练阶段,使用固定数量的20个发射端数量,奖励值随着训练的进行而稳定. 学习率在控制网络模型的学习动态方面起着至关重要的作用,影响算法收敛到全局最优的速度. 学习率太低可能导致算法陷入局部最优. 如图5所示,将学习率设置为0.0001,收敛性能显著改善. 因此,选择0.0001的学习率用于后续仿真实验. 图5强调了FedAvg-AC网络资源管理算法的有效性.

图 5

图 5   不同学习率收敛对比图

Fig.5   Convergence performance with different learning rates


4.2. 不同网络性能比较

1)SINR:SINR为系统中信号功率与组合干扰和噪声功率之比,表达式见式(4). 较高的SINR指示接收端可以在降低的干扰和噪声水平中更清楚地辨别有用信号.

2)网络吞吐量:该性能指标评估了资源分配算法分配完所有通信链路资源后,车联网的网络吞吐量,可以表示为

$ \varGamma =B{\log }_{2}\;\left(1+\overline{\gamma }\right). $

式中:$ \overline{\gamma } $表示平均SINR. 网络吞吐量越高,网络可以接受的最大速率就越高,网络性能就越好.

3)资源复用率:该性能度量指示在特定时间段内信道资源被有效利用的程度. 资源复用率高意味着信道资源得到充分利用,减少空闲浪费,提高整体网络性能和效率,其可以表示为

$ {\eta }_{{\mathrm{r}}}=\dfrac{{M}^{\prime}-{{{M}^{\prime}}}_{ k}}{{M}^{\prime}}. $

式中:$ {M}^{\prime} $表示信道资源的总数,$ {M}^{\prime}_{k} $表示所利用的信道资源总数.

图6展示了发射端的数量S与SINR之间的关系. 较高的SINR意味着网络具有较低的干扰. 图6比较了该算法与其他3种比较算法在不同传输链路下的SINR. 与其他3种算法相比,该算法最高能提升74.3%的信干噪比,最低提升34.8%,平均提升54.2%. 这是因为该算法通过自适应地选择最佳的资源分配方案,能够有效地避免干扰,提高信干噪比,保证传输速率. 仿真结果表明,该算法可以有效地避免干扰,提高信干噪比.

图 6

图 6   不同算法下SINR对比图

Fig.6   SINR comparison among different algorithms


图7描述了在车联网环境中使用各种算法实现的网络吞吐量. 随着发射端数量的增加,网络吞吐量也会增加. 这是因为FedAvg-AC算法能够同时传输更大量的数据,从而提高了整体网络吞吐量. 此外,所提出的FedAvg-AC算法在网络吞吐量方面也明显优于其他算法,相较于MND算法能提升19.2%的网络吞吐量,与GA算法相比能提升37.0%,与RM算法相比能提升28.2%,这是由于本研究所提算法的强自适应性.

图 7

图 7   不同算法下网络吞吐量对比图

Fig.7   Network throughput comparison among different algorithms


图8所示,表明了密集车联网中不同数量的发送端与资源复用率之间的关系. 在发送端固定发射功率的情况下,比较所提出的算法与其他3种比较算法在不同发射端数量下的资源复用率. 结果表明,本研究所提算法在资源复用率方面优于其他对比算法,与其他算法相比,最大能提升85%的资源复用率,最小能提升17%,平均提升48.7%. 这是由于本研究所提算法能够根据当前网络状态自适应地选择最佳的资源分配方案.

图 8

图 8   不同算法下资源复用率对比图

Fig.8   Resource reuse rate comparison among different algorithms


5. 结 语

针对密集车联网中车辆差异化干扰的资源管理问题,建立权值干扰模型,提出基于FedAvg-AC的资源分配算法来分配信道和功率资源. 通过研究密集车辆差异化干扰,利用权值干扰模型评估整个通信网络的干扰水平,将资源分配问题重新定义为组合优化问题. 针对这一问题,探索密集车联网MDP模型的建立方法,并提出基于联邦强化学习的资源管理算法. 最后,通过仿真验证了该算法的有效性.

本研究提出的基于FedAvg-AC的资源管理策略在密集车联网差异化干扰场景中展现出显著优势,但其实际部署仍须考虑安全隐私、计算效率之类的挑战. 未来工作将围绕增强用户隐私保护能力、提升计算效率、实时动态管理展开,为6G超密集网络提供更可靠的资源管理方案.

参考文献

ZHAO J, QUAN H, XIA M, et al

Adaptive resource allocation for mobile edge computing in Internet of vehicles: a deep reinforcement learning approach

[J]. IEEE Transactions on Vehicular Technology, 2024, 73 (4): 5834- 5848

DOI:10.1109/TVT.2023.3335663      [本文引用: 1]

SUN L, LIU M, GUO J, et al

Deep reinforcement learning empowered resource allocation in vehicular fog computing

[J]. IEEE Transactions on Vehicular Technology, 2023, 73 (5): 7066- 7076

LIN D, WU W

Resource allocation in a secure Internet of battle vehicles through RF fingerprint recognition

[J]. IEEE Transactions on Vehicular Technology, 2023, 72 (5): 6880- 6885

DOI:10.1109/TVT.2023.3235884      [本文引用: 1]

HUANG J, YANG F, CHAKRABORTY C, et al

Opportunistic capacity based resource allocation for 6G wireless systems with network slicing

[J]. Future Generation Computer Systems, 2023, 140: 390- 401

DOI:10.1016/j.future.2022.10.032      [本文引用: 1]

YANG F, HUANG J, BHARDWAJ A, et al

Adaptive modulation based on nondata-aided error vector magnitude for smart systems in smart cities

[J]. IEEE Internet of Things Journal, 2023, 10 (21): 18672- 18685

DOI:10.1109/JIOT.2023.3268659      [本文引用: 1]

HUANG J, YU T, ZHU X, et al

Energy efficiency maximization in UAV-assisted intelligent autonomous transport system for 6G networks with energy harvesting

[J]. IEEE Transactions on Intelligent Transportation Systems, 2025, 26 (10): 17212- 17222

DOI:10.1109/TITS.2024.3445088      [本文引用: 1]

YANG F, ZHAO Z, HUANG J, et al

A federated reinforcement learning approach for optimizing wireless communication in UAV-enabled IoT network with dense deployments

[J]. IEEE Internet of Things Journal, 2024, 11 (20): 33953- 33966

DOI:10.1109/JIOT.2024.3434713      [本文引用: 1]

PAN T, WU X, ZHANG T, et al

Energy-efficient resource allocation in ultra-dense networks with EMBB and URLLC users coexistence

[J]. IEEE Transactions on Vehicular Technology, 2023, 73 (2): 2549- 2563

[本文引用: 1]

SHAMAEI S, BAYAT S, HEMMATYAR A M A

Interference-aware resource allocation algorithm for D2D-enabled cellular networks using matching theory

[J]. IEEE Transactions on Network and Service Management, 2024, 21 (1): 759- 772

DOI:10.1109/TNSM.2023.3283993     

XU Y, ZHENG L, WU X, et al

Energy-efficient resource allocation for V2X communications

[J]. IEEE Internet of Things Journal, 2024, 11 (18): 30014- 30026

DOI:10.1109/JIOT.2024.3410098      [本文引用: 1]

CHENG N, ZHANG N, LU N, et al

Opportunistic spectrum access for CR-VANETs: a game-theoretic approach

[J]. IEEE Transactions on Vehicular Technology, 2014, 63 (1): 237- 251

DOI:10.1109/TVT.2013.2274201      [本文引用: 2]

CHIEN W C, LAI C F, CHAO H C

Dynamic resource prediction and allocation in C-RAN with edge artificial intelligence

[J]. IEEE Transactions on Industrial Informatics, 2019, 15 (7): 4306- 4314

DOI:10.1109/TII.2019.2913169      [本文引用: 1]

YANG C, LOU W, LIU Y, et al

Resource allocation for edge computing-based vehicle platoon on freeway: a contract-optimization approach

[J]. IEEE Transactions on Vehicular Technology, 2020, 69 (12): 15988- 16000

DOI:10.1109/TVT.2020.3039851      [本文引用: 1]

JIA Y, ZHANG C, HUANG Y, et al

Lyapunov optimization based mobile edge computing for Internet of vehicles systems

[J]. IEEE Transactions on Communications, 2022, 70 (11): 7418- 7433

DOI:10.1109/TCOMM.2022.3206885      [本文引用: 1]

SUN W, WANG P, XU N, et al

Dynamic digital twin and distributed incentives for resource allocation in aerial-assisted Internet of vehicles

[J]. IEEE Internet of Things Journal, 2022, 9 (8): 5839- 5852

DOI:10.1109/JIOT.2021.3058213      [本文引用: 1]

WU C, HUANG Z, ZOU Y

Delay constrained hybrid task offloading of Internet of vehicle: a deep reinforcement learning method

[J]. IEEE Access, 2022, 10: 102778- 102788

DOI:10.1109/ACCESS.2022.3206359      [本文引用: 1]

XU J, AI B, CHEN L, et al

Deep reinforcement learning for computation and communication resource allocation in multiaccess MEC assisted railway IoT networks

[J]. IEEE Transactions on Intelligent Transportation Systems, 2022, 23 (12): 23797- 23808

DOI:10.1109/TITS.2022.3205175      [本文引用: 1]

HUANG J, WAN J, LV B, et al

Joint computation offloading and resource allocation for edge-cloud collaboration in Internet of vehicles via deep reinforcement learning

[J]. IEEE Systems Journal, 2023, 17 (2): 2500- 2511

DOI:10.1109/JSYST.2023.3249217      [本文引用: 1]

PARVINI M, JAVAN M R, MOKARI N, et al

AoI-aware resource allocation for platoon-based C-V2X networks via multi-agent multi-task reinforcement learning

[J]. IEEE Transactions on Vehicular Technology, 2023, 72 (8): 9880- 9896

DOI:10.1109/TVT.2023.3259688      [本文引用: 2]

WU Q, WANG W, FAN P, et al

Cooperative edge caching based on elastic federated and multi-agent deep reinforcement learning in next-generation networks

[J]. IEEE Transactions on Network and Service Management, 2024, 21 (4): 4179- 4196

DOI:10.1109/TNSM.2024.3403842      [本文引用: 1]

ZHANG P, ZHANG Y, KUMAR N, et al

Dynamic SFC embedding algorithm assisted by federated learning in space-air-ground-integrated network resource allocation scenario

[J]. IEEE Internet of Things Journal, 2022, 10 (11): 9308- 9318

[本文引用: 1]

LI N, SONG X, LI K, et al

Multiagent federated deep-reinforcement-learning-enabled resource allocation for an air–ground-integrated Internet of vehicles network

[J]. IEEE Internet Computing, 2023, 27 (5): 15- 23

DOI:10.1109/MIC.2023.3307431      [本文引用: 2]

YANG F, ZHANG S, LIU C, et al

A hierarchical network management strategy for distributed CIIoT with imperfect CSI

[J]. IEEE Internet of Things Journal, 2023, 11 (8): 13509- 13523

[本文引用: 1]

HUANG J, ZHANG S, YANG F, et al

Hypergraph-based interference avoidance resource management in customer-centric communication for intelligent cyber-physical transportation systems

[J]. IEEE Transactions on Consumer Electronics, 2024, 70 (1): 1775- 1786

DOI:10.1109/TCE.2023.3324680      [本文引用: 1]

HUANG J, YU T, YANG F, et al

AoI-aware resource allocation with interference avoidance for ultradense industrial Internet of Things networks

[J]. IEEE Internet of Things Journal, 2024, 11 (17): 28787- 28797

DOI:10.1109/JIOT.2024.3403849      [本文引用: 1]

YANG F, YANG C, HUANG J, et al

Mutual-interference-aware throughput enhancement in massive IoT: a graph reinforcement learning framework

[J]. IEEE Internet of Things Journal, 2024, 11 (18): 30341- 30353

DOI:10.1109/JIOT.2024.3411653      [本文引用: 1]

HUANG J, YANG C, ZHANG S, et al

Reinforcement learning based resource management for 6G-enabled mIoT with hypergraph interference model

[J]. IEEE Transactions on Communications, 2024, 72 (7): 4179- 4192

DOI:10.1109/TCOMM.2024.3372892      [本文引用: 1]

WANG C, YAO T, FAN T, et al

Modeling on resource allocation for age-sensitive mobile-edge computing using federated multiagent reinforcement learning

[J]. IEEE Internet of Things Journal, 2024, 11 (2): 3121- 3131

DOI:10.1109/JIOT.2023.3294535      [本文引用: 1]

/