浙江大学学报(工学版), 2026, 60(10): 2236-2246 doi: 10.3785/j.issn.1008-973X.2026.10.016

计算机技术与控制工程

面向智能车联网的异构分层任务卸载与资源优化

赖显智,, 杨凡, 黄杰,, 余成波, 李幸星

重庆理工大学 电气与电子工程学院,重庆 400054

Heterogeneous hierarchical task offloading and resource optimization for Smart Internet of Vehicles

LAI Xianzhi,, YANG Fan, HUANG Jie,, YU Chengbo, LI Xingxing

School of Electrical and Electronic Engineering, Chongqing University of Technology, Chongqing 400054, China

通讯作者: 黄杰,男,副教授. orcid.org/0000-0002-4826-5732. E-mail:huangjie_cq@cqut.edu.cn

收稿日期: 2025-08-9  

基金资助: 国家自然科学基金资助项目(62301094);重庆市技术创新与应用发展专项重大项目(CSTB2024TIAD-STX0034);重庆市教育委员会科技研究计划资助项目(KJQN202201157,KJQN202301135);重庆理工大学科研创新团队培育计划资助项目(2023TDZ003).

Received: 2025-08-9  

Fund supported: 国家自然科学基金资助项目(62301094);重庆市技术创新与应用发展专项重大项目(CSTB2024TIAD-STX0034);重庆市教育委员会科技研究计划资助项目(KJQN202201157,KJQN202301135);重庆理工大学科研创新团队培育计划资助项目(2023TDZ003).

作者简介 About authors

赖显智(2000—),男,硕士生,从事无线通信理论研究.orcid.org/0009-0008-1593-1445.E-mail:1207075676@qq.com , E-mail:1207075676@qq.com

摘要

为了提升智能车联网中多任务处理的实时性、资源调度效率和能耗控制水平,针对任务的异构特性与分层依赖关系开展研究,提出基于深度确定性策略梯度的高效任务卸载与资源分配算法. 采用超图结构提取任务依赖特征,以刻画任务间复杂关联关系. 引入融合优先级及时延约束的排队机制,并采用集中训练与分布执行架构,提高策略稳定性,实现卸载决策与资源分配的实时输出. 利用多智能体深度确定性策略梯度框架构,结合边缘节点算力负载、无线网络状态与任务截止期限设计状态空间与奖励函数,以实现协同优化. 仿真结果表明,所提算法能够根据网络变化实时感知节点算力瓶颈,生成调度策略满足低延迟、高可靠及低能耗要求. 与现有算法相比,所提算法的任务调度完成时延平均降低18.17%,资源利用效率平均提升13.21%,平均能耗降低 21.73%. 实验结果证明了所提方法在多任务调度与资源优化方面具有优越性能.

关键词: 车联网 ; 资源分配 ; 边缘计算 ; 任务卸载 ; 超图

Abstract

Research was conducted on task heterogeneity and hierarchical dependencies, in order to enhance the real-time performance of multi-task processing, improve resource scheduling efficiency, and control energy consumption in smart vehicular networks. An efficient task offloading and resource allocation algorithm based on deep deterministic policy gradients was proposed. A hypergraph structure was adopted to extract task dependency features, through which complex inter-task relationships were characterized. A queueing mechanism integrating task priority and latency constraints was introduced, and a centralized training with decentralized execution architecture was employed to improve policy stability, enabling real-time offloading decisions and resource allocation. A cooperative optimization model was further constructed based on a multi-agent deep deterministic policy gradient framework, where edge computing load, wireless network conditions, and task deadlines were jointly incorporated into the design of the state space and reward function. Simulation results showed that the proposed algorithm can detect node computing power bottlenecks in real time based on network changes and generate scheduling strategies that meet the requirements of low latency, high reliability, and low energy consumption. Compared with existing algorithms, the proposed method reduced task scheduling latency by 18.17%, increased resource utilization by 13.21%, and lowered average energy consumption by 21.73% on average. These results demonstrate that the method exhibits superior performance in multi-task scheduling and resource optimization.

Keywords: Internet of Vehicles ; resource allocation ; edge computing ; task offloading ; hypergraph

PDF (2313KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

赖显智, 杨凡, 黄杰, 余成波, 李幸星. 面向智能车联网的异构分层任务卸载与资源优化. 浙江大学学报(工学版)[J], 2026, 60(10): 2236-2246 doi:10.3785/j.issn.1008-973X.2026.10.016

LAI Xianzhi, YANG Fan, HUANG Jie, YU Chengbo, LI Xingxing. Heterogeneous hierarchical task offloading and resource optimization for Smart Internet of Vehicles. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(10): 2236-2246 doi:10.3785/j.issn.1008-973X.2026.10.016

随着物联网的快速发展,更多的物联网设备集成到车辆系统. 同时,车联网设备的智能化以及自动驾驶类新兴业务的兴起,导致车辆所产生的数据量呈指数级增长,对计算资源提出了更高要求[1]. 以大型服务器集群为核心的传统云计算能够提供充足算力支持,但其物理位置通常远离车辆实际部署区域,难以满足智能车联网(Smart Internet of Vehicles,SIoV)对低时延和高可靠性的严苛需求[2-4]. 为了应对上述挑战,移动边缘计算(mobile edge computing,MEC)作为一种新型计算范式应运而生. 通过将计算资源部署在靠近车联网用户的边缘节点上,边缘计算能够支持车辆将部分计算任务卸载至本地边缘服务器,从而有效减少因远程数据传输带来的通信时延[5-6]. 然而,边缘服务器的计算资源相较于云端仍然有限,难以承载SIoV网络中日益增长的计算密集型和延迟敏感型任务需求. 这种资源与需求之间的矛盾,可能导致系统拥塞,严重时甚至引发交通瘫痪或安全事故[7-8]. 因此,如何设计高效的任务卸载机制与资源分配策略,以实现边缘资源的优化利用,保障系统的实时性与稳定性,成为当前亟待解决的重要问题.

为了应对资源受限与任务多样性问题,部分研究借助优化与博弈方法提升卸载效率和资源利用率[9-13]. 例如,Wang等[9]采用交替方向乘子法构建多车辆卸载模型以降低系统代价;Liao等[10]基于距离的资源分配策略实现协作卸载与负载均衡; Dai等[12-13]分别从任务精度与辅助车辆协作角度优化能耗与时延. 在此基础上,混合优化与博弈策略进一步增强了系统的动态适应性[14-18]. He等[14]结合Q学习与图优化实现非正交多址场景下的轨迹与频谱联合分配;Liu等[16]提出混合拍卖模型以保障资源分配真实性与社会福利;Yan等[18]利用势博弈构建无人机增强型服务缓存架构. 从总体来看,优化与博弈类方法在性能提升上表现出色,但多数模型假设系统静态或单时隙,难以适应车联网中时变网络环境.

为了克服上述局限,深度强化学习(deep reinforcement learning,DRL)凭借自适应与在线学习特性被引入任务卸载问题[19-23]. Chen等 [19]提出基于联邦深度强化学习的协作卸载策略,有效降低延迟与决策时间;Zhao等 [20]利用深度确定性策略梯度(deep deterministic policy gradient,DDPG)算法优化上/下行与计算资源分配;王辛果等[21]提出通过任务拆分与空闲车辆协作计算、结合基于优先级的样本采样机制的方法,以提高样本利用率并降低平均时延; Wang等 [23]结合马尔可夫决策过程与量子启发RL实现双接口自适应卸载. 进一步地,部分研究引入强化学习联合优化[24-27]. 例如,Zhan等 [24]将区块链与双深度Q网络相融合,构建安全可扩展的边缘计算架构,实现延迟、能耗与安全性的联合优化;Hou等 [25]提出基于联邦深度强化学习的动态睡眠决策算法,通过流量感知机制显著提升能效与泛化性. 强化学习类方法已逐步展现出应对动态复杂环境的潜力,能够实现时变网络下的实时优化与自适应决策. 然而,在SIoV系统中,智能驾驶终端广泛部署,不同车辆运行的任务在时延敏感性、重要性方面存在显著差异,表现为任务异构性,并且有明显的执行优先区别. 同时,SIoV系统须承担环境感知、路径规划、障碍规避及协同驾驶等核心任务,各模块间存在严格处理流程,上层任务的输出直接构成下层任务的输入,体现出任务分层依赖关系. 在边缘计算架构下,为了提升系统整体响应效率,即使上游任务尚未完成,任务生成模块也常采用预测性策略提前触发后续任务请求,从而形成并行的任务处理流程. 但受限于通信带宽、计算能力以及网络状态的动态变化,系统难以及时、准确地完成任务调度与资源分配,极易造成任务执行顺序混乱,影响响应效果,甚至引发安全隐患. 因此,解决SIoV网络中任务卸载及资源分配优化问题,同时考虑由任务特性产生的任务异构性与分层依赖关系是一个必须解决的紧迫问题.

针对上述问题,首先对不同任务优先级进行分类,并利用超图模型对任务中存在的依赖关系进行建模,最后提出基于任务关系的多智能体深度确定性策略梯度算法(behavior-relation-aware multi-agent DDPG,BR-MADDPG),以降低每个任务的平均时延,提高系统整体的资源利用率. 本研究从以下3个方面展开研究. 1)从任务特性出发,针对车辆任务在时延敏感度上的差异性,引入任务优先级分类机制,以此构建符合业务需求的调度基础. 2)考虑到任务之间存在的分层依赖结构,构建基于超图的任务关系模型,用以替代传统的有向无环图(directed acyclic graph,DAG)描述方式,从而提升复杂依赖关系的表达能力与可扩展性. 3)为了应对多车辆多任务并发调度与资源优化问题,设计集中式训练、分布式执行的多智能体强化学习框架,提出改进的BR-MADDPG算法,并据此开发改进算法用于系统优化控制.

1. 系统模型

1.1. 网络模型

智能车联网的系统模型图如图1所示,系统中存在普通车辆与无人驾驶车辆,分别构成集合$ M=\{1,2,\cdots ,m\} $$ N=\{1,2,\cdots ,n\} $,无人驾驶车辆任务对时延和计算资源具有更高的敏感性,必须在严格约束下优先完成;而普通车辆业务则相对具有一定的时延容忍度. 系统中边缘服务器的集合表示为$ B=\{1,2,\cdots ,b\} $,每个边缘服务器配备单台基站以及路侧单元(road side unit,RSU),基站通过边缘服务器向通信设备提供频谱资源,以实现数据传输,即车辆到基础设施(vehicle to infrastructure,V2I)通信. RSU可以实时收集终端用户信息,包括时延需求、车辆速度以及车辆生成的任务重要性等级,并将这些信息上传至边缘服务器系统. 在每个时隙内,每辆车将生成$ U $个主任务,同时边缘服务器系统对任务执行位置做出智能决策,判断任务应在车辆本地计算还是卸载至边缘侧处理,以优化系统整体性能. 卸载到边缘服务器的主任务根据RSU赋予的重要性权重以不同优先级顺序执行. 一个主任务内部由多个具有依赖关系的分任务组成,分任务根据功能逻辑划分为父类任务和子类任务,其中父类任务需严格优先执行,子类任务仅在其所依赖的父类任务完成后方可开始. 仅当前主任务的所有分任务均完成后,系统才会启动进行下一个主任务,从而确保任务调度的时序性与依赖性. 最终,边缘服务器将计算完成的任务返回到车辆用户.

图 1

图 1   SIoV系统模型图

Fig.1   SIoV system model


在此模型中,将正交频分多址接入应用于$ N $个V2I链路,即将$ N $个V2I链路预分配到正交频率子带,其中$ N $个V2I链路占据$ N $个子带. 因此,车辆$ n $与基站之间的通信速率$ r_{n}^{\text{tr}} $可以表示为

$ r_n^{\mathrm{tr}}=B_n^{\mathrm{tr}} \log _2\left(1+\frac{p_n^t g_{n, {\mathrm{b}}}^t}{\sigma_n^2}\right). $

式中:$ B_{n}^{\text{tr}} $为上行传输的信道带宽, $ p_{n}^{t} $为第$ n $辆车传输功率,$ \sigma _{n}^{2} $为噪声功率,$ g_{n,{\mathrm{b}}}^{t} $为在第$ t $个时隙第$ n $辆车和基站之间的信道增益.

$ g_{n, {\mathrm{b}}}^t=\left|h_n^t\right|^2 L_n^d. $

式中:$ h_{n}^{t} $为小尺度路径衰落;$ L_{n}^{d} $为大尺度路径衰落,其距离路径损耗模型的计算公式为$ \alpha +\beta {\log }_{10}\;(d) $$ \alpha =42.6 $为固定损耗,$ \beta =26 $为路径损耗指数;$ d $为第$ n $辆车到基站之间的距离[28]. $ h_{n}^{t} $采用一般衰落,即

$ h_n^t=\varpi h_n^{t-1}+{\left(\sqrt{\left(v_{n, t}^{\mathrm{p}}-\mathrm{bs}^{\mathrm{p}}\right)^2}\right)^{-\eta}}. $

式中:$ h_{n}^{t} $服从标准复高斯分布,$ \varpi $为相关系数,$ v_{n,t}^{{\mathrm{p}}} $为时隙$ t $中车辆$ n $的位置,$ {\text{bs}}^{{\mathrm{p}}} $为基站的位置,$ \eta $为路径损耗指数.

1.2. 优先级及依赖性驱使的时延模型

$ {U}_{n}=\left\{U_{n}^{1},U_{n}^{2},\cdots ,U_{n}^{i}\right\} $表示第$ n $辆车生成的任务集,对于每个任务,将其表示为$ U_{n}^{i}=\left\{s_{n}^{i},c_{n}^{i},t_{n}^{i}\right\} $,其中$ s_{n}^{i} $为由车辆$ n $生成的第$ i $个任务的大小,$ c_{n}^{i} $为任务的计算复杂度,$ t_{n}^{i} $为时延限制. 对于第$ n $辆车的计算任务$ i $的处理,当$ \chi _{n}^{i}=0 $时,表示任务在本地处理;当$ \chi _{n}^{i}\in (0,1.0) $时,表示任务部分卸载;当$ \chi _{n}^{i}=1.0 $时,表示任务完全卸载到边缘服务器. 本地处理的延时可以表示为

$ T_{n,{\mathrm{l}}}^{i}=\dfrac{(1-\chi _{n}^{i})s_{n}^{i}c_{n}^{i}}{{F}_{n}}. $

式中:$ {F}_{n} $为车辆$ n $自身的计算资源. 如果第$ n $辆车的第$ i $个任务$ U_{n}^{i} $中存在部分或全部卸载,首先须通过无线通信将卸载部分传输到配备有边缘服务器的基站. 云端系统估计并分配任务所需的计算资源,并将计算结果返回给车辆. 这里,由于计算结果的大小远小于上传部分,且下行链路通信速率较高,不考虑计算输出结果返回车辆所引起的延迟. 因此,由完成任务$ U_{n}^{i} $产生的延时可以表示为

$ T_{n,\text{tx}}^{i}+T_{n,{\mathrm{e}}}^{i}=\frac{\chi _{n}^{i}s_{n}^{i}}{r_{n}^{t}}+\frac{\chi _{n}^{i}s_{n}^{i}c_{n}^{i}}{f_{n}^{i}}.$

式中:$ \chi _{n}^{i}s_{n}^{i} $为任务卸载的数据量,$ T_{n,\text{tx}}^{i} $为任务上传延时, $ T_{n,{\rm{e}}}^{i} $为边缘计算延时,$ f_{n}^{i} $为边缘服务器为第$ n $辆车的任务$ i $分配的计算资源. 本地执行与卸载路径并行进行,任务完成时间取其较大值. 则第$ i $个任务的总延时可以表示为

$ T_{n}^{i}=\max \;(T_{n,{\mathrm{l}}}^{i},T_{n,\text{tx}}^{i}+T_{n,{\rm{e}}}^{i}). $

针对移动设备任务调度场景中多目标决策复杂性的问题,提出基于层次分析法的主任务优先级判定模型. 该模型通过构建多准则成对比较矩阵、计算特征向量权重以及对任务属性进行归一化处理,实现主任务优先级的量化排序. 为了确定任务的优先级,综合考虑任务数据大小、所需 CPU 周期数及截止时间等关键因素. 在本研究中,截止时间被赋予最高权重以更准确地反映任务时效性的优先级需求. 首先,比较相同级别的因子并用于构建分析层次矩阵 $ \boldsymbol{A}=[{{f}_{{{\ell}_{1}}{{\ell}_{2}}}}]_{3\times 3} $,即

$ {f}_{{{\ell}_{1}}{{\ell}_{2}}}=\frac{1}{{f}_{{{\ell}_{2}}{{\ell}_{1}}}}. $

式中:$ {f}_{{{\ell}_{1}}{{\ell}_{2}}} $ 为比较因子$ {\ell}_{1} $和 因子$ {\ell}_{2} $的重要性的比较结果. 如表1所示显示了不同的重要性级别及其权重.

表 1   重要性比较因子

Tab.1  Importance comparison factor

因子$ {\ell}_{1} $与因子$ {\ell}_{2} $相比$f_{ {\ell}_{1} {\ell}_{2} } $
同等重要1
比较重要5
绝对重要9
其他2, 4, 6, 8···

新窗口打开| 下载CSV


所有任务的权重矩阵构造为$\boldsymbol{\varTheta}=\left[ x_\ell^{i}\right]_{U \times 3}$$ x_\ell^{i} $表示基于第$ \ell $因子的第$ i $个任务权重,即

$ x_{\ell}^i=\dfrac{1 / f_{\ell}^i}{\displaystyle\sum_{i=1}^U\left(1 / f_{\ell}^i\right)}. $

式中:$ f_{\ell}^{i} $为任务$ i $的重要性权重. 最后,生成所有任务的优先级向量为

$ {\boldsymbol{\varPsi }}={\boldsymbol{\varTheta }}\times {\boldsymbol{\varLambda }}=\left[\begin{matrix}x_{1}^{1} & x_{1}^{2} & x_{1}^{3}\\x_{2}^{1} & x_{2}^{2} & x_{2}^{3}\\\vdots & \vdots & \vdots \\x_{\ell}^{1} & x_{\ell}^{2} & x_{\ell}^{3}\end{matrix}\right]\cdot {[{{\lambda }_{1}},{{\lambda }_{2}},{{\lambda }_{3}}]}^{{\mathrm{T}}}. $

${ \boldsymbol{\varPsi }} $ 向量中的每个元素都表示相应主任务的优先级值,${\boldsymbol{\varLambda }} $为用于表示各因子权重的特征向量,${\boldsymbol{\varLambda }} $特征值可以表示为

$ {\lambda }_{i}=\frac{1}{n}\displaystyle\sum \limits_{{\ell}_{2}=1}^{n}\dfrac{{f}_{{{\ell}_{1}}{{\ell}_{2}}}}{\displaystyle\sum \limits_{i=1}^{n}{f}_{i{{\ell}_{2}}}};\quad {\ell}_{1}=1,2,\cdots ,n. $

同时,无论任务处理时是顺序执行还是并行执行,在一个主任务中多个分任务均依赖于所有前任务的成功完成,如图2所示,因此第$ i $个主任务的联合调度延迟不能简单地通过将其传输时间和计算时间相加来获得.

图 2

图 2   任务调度例子

Fig.2   Task scheduling example


为了保证单个任务的准确完成,须满足任务间的先后依赖关系,即子任务必须在其对应的父任务完成后才能开始执行. 由此,给定的计划任务的开始时间取决于其父任务的最大完成时间,从而导致依赖性. 因此,第$ i $个任务的完成时间$ T_{i}^{\text{cu}} $可以定义为

$ T_{i}^{\text{cu}}=\text{max}\;\{T_{i}^{{\mathrm{S}}},\underset{j\in P(j)}{\max }\;\{T_{j}^{\text{cu}}\}\}+T_{n}^{i}.$

式中:$ P(j) $表示执行当前任务$ i $前需要完成的父类任务集,$ T_{i}^{{\mathrm{S}}} $表示在同一设备上执行任务$ i $时,由于资源占用所产生的等待时间,即与任务i分配至同一资源的历史任务中的最大完成时间. 可以表示为

$ T_{i}^{{\mathrm{S}}}=\text{max}\;\{T_{k}^{{\mathrm{F}}}({z}_{i}={z}_{k})|k=1,\cdots ,i-1\}. $

式中:$ {z}_{i} $$ {z}_{k} $分别表示任务$ i $和任务$ k $被卸载的地点,$ T_{k}^{{\mathrm{F}}} $为任务$ k $完成的时间.

1.3. 基于超图的任务依赖性构造模型

DAG已被广泛用于描述父-子任务间的先后约束. 然而,在智能车联网中,DAG 依赖于双向边来刻画一对一的任务依赖,随着车辆数与并发任务数呈指数级上升,边集规模爆炸式增长,进而显著抬升拓扑存储与调度算法的复杂度. 为了克服这一瓶颈,提出超图建模框架,与DAG不同,超图中一条边可以包含多个点,将每条超边视作一组任务间的多对多依赖集合,从而以线性级的边数实现对复杂依赖结构的压缩表达,能够有效减少边冗余及简化计算[29-30].

超图定义为$ G=\left\{V,E\right\} $,超图中点的集合可以表示为$ V=\{{v}_{1},{v}_{2},\cdots ,{v}_{n}\} $,超边集合可以表示为$ E= \{{e}_{j}=({Z}_{j},{z}_{j})\} $,其中,$ {Z}_{j}\subset V $为任务中父类的集合,$ {z}_{j}\subset V $为子任务集合,在同一条超边中的点表示他们之间存在任务依赖关系. 构建一个依赖矩阵$ \boldsymbol{H}\in {\bf{R}}^{n\times m} $来刻画这种依赖关系,其中,$ n $表示任务数量;$ m $表示超边数量,即依赖关系数.

$ {H}[i,j]=\left\{\begin{array}{ll} -1,&{v}_{i}\in {Z}_{j};\\+1,&{v}_{i}\in {z}_{j};\\0,&其他.\end{array}\right. $

本质上,超边是无序集合,表示并列的、并发的依赖关系,而DAG中的链式依赖是有序结构. 将链式依赖简化为一条超边,就会丢失顺序信息,因此不能简单地用一个集合连接全部任务来表达必须按顺序执行. 以图3为例来展现一个完整的任务依赖关系,在超边$ {e}_{1} $中,$ {v}_{1}、{v}_{2} $作为父类任务,$ {v}_{3} $作为子类任务. 同时,在超边$ {e}_{2} $中,$ {v}_{3} $作为$ {v}_{4}、{v}_{5}、{v}_{6} $的父类任务,在超边$ {e}_{3} $中,$ {v}_{6} $作为$ {v}_{7}、{v}_{8} $的父类任务.

图 3

图 3   基于任务依赖性的超图模型

Fig.3   Hypergraph model based on task dependency


如果任务$ i $是某条超边$ {e}_{j}=({Z}_{j},i) $的子任务,那么它的开始时间$ T_{i}^{{\mathrm{S}}} $须满足

$ T_{i}^{{\mathrm{S}}}\geqslant \underset{{v}_{k}\in {Z}_{j}}{\max }\;T_{k}^{{\mathrm{F}}}. $

式中:$Z_j $表示超边$e_j $中任务$i $的父类任务集合,$T_k^{\mathrm{F}}$表示父类任务$ v_k $的完成时间.

2. 问题公式化

本研究重点研究智能车联网场景下任务卸载及资源分配问题,通过优化调度以及分配卸载策略,系统能够合理制定任务卸载及资源分配方案,从而降低网络整体时延,提高资源利用效率,解决系统中多任务的优先级以及依赖性问题,提高任务的及时完成率. 因此,智能车联网中低时延任务卸载资源分配的问题可以描述为

$ \left.\begin{split} \min\;\; & \displaystyle\sum_{i=1}^N \omega_i \cdot T_i^{\mathrm{cu}} ;\\\text {s.t.} \;\; & C_1: T_i^{\mathrm{S}} \geqslant \max _{v_{k \in P_j}} T_k^{\mathrm{F}} ,\\& C_2: T_i^{\mathrm{cu}} \leqslant T_n^k, \\& C_3: p_n \leqslant p_n^{\max } ,\\& C_4: T_i^{\mathrm{S}} - T_k^{\mathrm{S}} \leqslant \left(1-\delta_{a b}\right) M,\; \forall v_i \in T_a, \;v_k \in T_b .\end{split} \right\}$

式中:$ {\omega }_{i}={{{\varPsi }}_{i}}/{\sum \limits_{i=1}^{k}{{\varPsi }}_{i}} $$ {{\varPsi }}_{i} $表示优先级向量元素的值,优先级越高,任务完成时间越被赋予更高权重,调度器会更优先优化它们的完成时延. 目标函数$ {C}_{1} $确保分任务中子类任务在父类任务之后完成,$ {C}_{2} $确保主任务完成时间不超过其截止时间,$ {C}_{3} $确保车辆$ n $的传输功率Pn不能超过其最大传输功率$ p_{n}^{\max } $$ {C}_{4} $确保高优先级任务先执行,表示若主任务$ {T}_{a} $的优先级高于$ {T}_{b} $,则任意属于$ {T}_{a} $的分任务都必须不晚于任意属于$ {T}_{b} $的分任务启动,其中$ M $为给定的足够大的常数,当${{\varPsi }}_{a} \gt {{\varPsi }}_{b} $时,$ {\delta }_{ab}=1 $;当${{\varPsi }}_{a}\leqslant {{\varPsi }}_{b} $时,$ {\delta }_{ab}=0 $.

3. 基于深度强化学习的任务卸载及资源分配方案

为了实现上述目标(式(15)),为智能车联网构建了一个多智能体马尔可夫决策过程(multi-agent Markov decision process,MA-MDP)模型,其奖励函数根据该优化问题的目标设计. 该模型由多个相互交互的智能体、联合状态空间、动作空间、状态转移函数及奖励函数组成,每个智能体均在环境中通过学习获得最优策略,以实现系统整体性能优化. 然而,在智能车联网场景中,环境表现出高度的可变性,智能体的当前状态在部分已知的转换概率下转换到其他状态. 为了应对这一挑战,深度强化学习(deep reinforcement learning,DRL)被用来迭代地训练智能体,优化决策策略. 在DRL框架内,采用集中式决策方法,其中DRL智能体通过网络控制模块实现. 该模块通过收集并整合全局系统状态信息,实现对实际问题的优化决策,从而促进对所有请求的最佳决策. 由于任务间资源分配的相互影响,用传统方法无法在多项式时间内求解. 因此,本章使用多智能体的方法来转换问题.

3.1. 马尔可夫过程

将任务卸载及资源分配问题建模为MA-MDP模型. 在时隙$ t $,系统中包含$ N $个车辆智能体,记为$ \left\{1,2,\cdots ,N\right\} $,每个车辆视为一个智能体$ n$,智能体通过局部观测来感知当前环境状态,并使用动作价值函数$ Q({{\boldsymbol{s}}}_{t},{{\boldsymbol{a}}}_{t}) $来获取策略,智能体再根据策略选择相应的动作,在所有智能体完成策略选择后,环境将转换到新的状态$ {{\boldsymbol{s}}}_{t+1} $,同时智能体会获得相应的奖励$ r $. MA-MDP的具体构成如下.

3.1.1. 状态空间

在时隙$ t $,所有智能体同时对当前通信环境进行观测,并提取用于刻画其状态的一组参数.

1)$ R_{v}^{n} $:表示车辆本身可用的计算资源.

2)$ R_{b}^{n} $:表示边缘服务器可用的计算资源.

3)$ U_{s}^{n} $:车辆任务特性.

状态空间表示为$ S $,并且系统在时隙$ t $的状态表示为$ \boldsymbol{{\boldsymbol{s}}}_{{t}}^{{n}}\in S $,其中$ \boldsymbol{{\boldsymbol{s}}}_{{t}}^{{n}} $是属于集合$ S $的向量,则每个智能体的局部状态可以定义为

$ \boldsymbol{{\boldsymbol{s}}}_{t}^{n}=\left[R_{{v}_{1}}^{t},R_{{v}_{2}}^{t},\cdots, R_{{v}_{n}}^{t},R_{{b}_{1}}^{t},R_{{b}_{2}}^{t},\cdots, R_{{b}_{n}}^{t},U_{s_1}^{t},U_{s_2}^{t},\cdots ,U_{{{{s}}}_{n}}^{t}\right]. $

3.1.2. 动作空间

对于每个智能体,动作是一个连续的向量,表示为

$ {{\boldsymbol{a}}}_{t}^{n}=[\underset{任务分配比例}{\underbrace{{\tau }_{1},{\tau }_{2},\cdots ,{\tau }_{{{N}_{t}}}} },\underset{资源分配比例}{\underbrace{{\phi }_{1},{\phi }_{2},\cdots ,{\phi }_{{{N}_{t}}}} }]\in {{\bf{R}}}^{2{{N}_{t}}}. $

则动作空间可以表示为$ {D}_{A}=[0,1]_{\tau }^{{N}_{t}}\times [0,1]_{\phi }^{{N}_{t}} $,其中$ {N}_{t} $表示车辆一次最多能同时考虑的子任务数.

3.1.3. 奖励函数

奖励函数$ r_{t}^{n} $整体由时延奖励、资源利用率奖励以及时延违规惩罚组成,表示为

$ r_{t}^{n}={\kappa }_{1}{R}_{{\mathrm{d}}}+{\kappa }_{2}{R}_{{\mathrm{u}}}-10(m-1){\varsigma }_{m \gt 1}. $

式中:$ {\kappa }_{1} $为时延奖励权重,$ {\kappa }_{2} $为资源利用率奖励权重,$ {\kappa }_{1},{\kappa }_{2}\in (0,1.0) $${R}_{{\mathrm{d}}} $为时延奖励值;$ {R}_{{\mathrm{u}}} $为不同资源利用率所带来的奖励值;$ \varsigma_{ (\cdot ) }$为指示函数,条件满足取 1,否则取 0;$ m=\max \;(T_{\text{exe}}^{i})/T_{n}^{i} $,其中$ T_{\text{exe}}^{i} $为任务执行时延,$ T_{n}^{i} $为任务最大时延限制.

$ R_{\mathrm{d}}=0.5\left(2-\frac{\arg \left(T_{\mathrm{exe}}^i\right)}{T_n^i}\right) \varsigma_{m \leqslant 1} . $

智能体$ n $的长期累积奖励可以表示为

$ R_{n}^{t}=\sum \limits_{{t}_{0}=0}^{t}\gamma r^n_{{t}_{0}}. $

式中:$ \gamma \in (0,1.0) $为折扣因子,$r^n_{t_0} $表示智能体nt0时刻获得的即时奖励. 通过最大化每个智能体的长期累积奖励,可获得任务卸载及资源分配的最优策略.

3.2. 基于任务层级关系的MADDPG算法

在SIoV网络环境中提出基于任务关系的多智能体深度确定性策略梯度算法(BR-MADDPG),用于高效地进行任务卸载决策[31]. 如图4所示给出了BR-MADDPG算法框架,在训练阶段采用集中式训练、执行阶段采用分布式决策的框架,使得算法既能够在训练中利用全局信息提升收敛性与稳定性,又能在执行中仅依赖局部观测实现低时延与低通信开销的实时决策. 该算法中,每个智能体均配备一组独立的 Actor 网络与 Critic 网络,以及相应的目标网络(target network). 其中,Actor 网络用于基于本地观测生成卸载动作,Critic 网络则评估状态-动作对的价值函数. 为了提升训练稳定性与全局最优性,BR-MADDPG 采用集中式训练与分布式执行的策略:在训练阶段,智能体的 Critic 网络能够访问所有智能体的状态与动作信息,从而更准确地估计全局$ Q $值;在执行阶段,每个智能体仅依赖本地观测输入并由其 Actor 网络独立做出决策.

图 4

图 4   BR-MADDPG算法框架

Fig.4   BR-MADDPG algorithm framework


各智能体首先感知当前网络状态,然后选择对应动作与环境交互,导致环境状态转移并获得奖励反馈. 通过持续与环境交互,智能体不断收集经验数据(状态、动作、奖励、下一个状态),并通过重放机制构建训练样本. 边缘服务器作为集中控制单元,负责管理各智能体的关键网络参数,并利用全局状态-动作信息对各 Critic 网络进行统一更新,从而优化策略并实现全局$ Q $值的最大化目标.

使用带探索噪声的确定性策略进行动作选择,动作选择为

$ \boldsymbol{a}_{t}=\left\{\begin{array}{ll} {{\boldsymbol{\pi}} }_{{{\theta }_{i}}}(o)+{{\boldsymbol{N}}}_{t},& {P}=1-{\varepsilon }_{t};\\随机动作,& {P}={\varepsilon }_{t}.\end{array}\right. $

$ \left.\begin{split}{{\boldsymbol{N}}}_{t}&=\max\; ({{\boldsymbol{N}}}_{\min },{{\boldsymbol{N}}}_{t-1}\times {\gamma }_{N}),\\{\varepsilon }_{t}&=\max\; ({\varepsilon }_{\min },{\varepsilon }_{t-1}\times {\gamma }_{\varepsilon }).\end{split} \right\}$

式中:$ {\boldsymbol{N}}_t $为随训练衰减的探索噪声,衰减率为$ {\gamma }_{N} $$ {\varepsilon }_{t} $为随训练衰减的随机探索概率,衰减率为$ {\gamma }_{\varepsilon } $$ {{\boldsymbol{\pi}} }_{{{\theta }_{i}}}(o) $为智能体$ i $的策略网络输出. 在随机探索概率衰减并加入探索噪声后,确定性策略能够增强动作随机性,从而更充分地探索环境,学习更多有用的信息. 在早期阶段,$ {\varepsilon }_{t} $较大,由于缺乏经验,智能体会随机采取行动,探索更多可能的行动. 当经验足够时,智能体将采取行动以使回报最大化. 对于智能体$ i $,更新网络$ Q $的方式为

$ {Q}_{i}({{\boldsymbol{s}}}_{t},{\boldsymbol{a}}_{t};{\theta }_{{{Q}_{i}}})={r}_{i}(t)+{\gamma }_{i}\max Q'_{i}({{\boldsymbol{s}}}_{t+1},{\boldsymbol{a}}_{t+1};\theta '_{{{Q}_{i}}}). $

式中:$ {\theta }_{{{Q}_{i}}} $$ \theta '_{{{Q}_{i}}} $分别为估计Critic网络和目标Critic网络的参数,$ {r}_{i}(t) $为智能体$ i $获得的即时奖励. Critic网络由参数$ {\theta }_{{{Q}_{i}}} $控制,要获得最优参数,必须知道损耗函数. 这里,损失函数可以表示为

$ \begin{split} L({\theta }_{{{Q}_{i}}})=&E[({Q}_{i}({{\boldsymbol{s}}}_{t},{\boldsymbol{a}}_{t},{\theta }_{{{Q}_{i}}})-({r}_{i}(t)+\\&{\gamma }_{i}Q'_{i}({{\boldsymbol{s}}}_{t+1},{\boldsymbol{a}}_{t+1},\theta '_{{{Q}_{i}}})){)}^{2}].\end{split} $

随后通过随机梯度下降更新critic网络来最小化损失函数:

$ {\nabla }_{{{\theta }_{{{Q}_{i}}}}}L({\theta }_{{{Q}_{i}}})=E(2\delta {\nabla }_{{{\theta }_{{{Q}_{i}}}}}{Q}_{i}({{\boldsymbol{s}}}_{t},{\boldsymbol{a}}_{t};{\theta }_{{{Q}_{i}}})). $

式中:$ \delta =Q'_{i}({{\boldsymbol{s}}}_{t+1},{\boldsymbol{a}}_{t+1},\theta '_{{{Q}_{i}}})-{Q}_{i}({{\boldsymbol{s}}}_{t},{\boldsymbol{a}}_{t},{\theta }_{{{Q}_{i}}}) $. 在训练过程中,为了保证算法的稳定性,对目标Actor网络和目标Critic网络的参数采用软更新,即

$ \theta '_{i}\leftarrow \tau {\theta }_{i}+(1-\tau ) \theta '_{i}, $

$ \phi '_{i}\leftarrow \tau {\phi }_{i}+(1-\tau ) \phi '_{i}. $

式中:$ {\theta }_{i} $$ {\phi }_{i} $表示当前Actor和Critic网络参数,$ \theta '_{i} $$ \phi '_{i} $表示目标Actor和Critic网络参数,$ \tau $为软更新系数以控制更新速率.

BR-MADDPG算法的步骤概述如下.

算法1. BR-MADDPG算法

输入:多智能体车辆边缘计算网络环境

输出:任务卸载和资源分配策略

1.   初始化经验回放缓冲区$ D $,为每个智能体初始化Actor网络和Critic网络

2.   初始化目标网络

3.   for每个轮次执行

4.    重置环境并获取初始状态$ {{\boldsymbol{s}}}_{t} $

5.    for每个时间步$ t $执行

6.     for每个智能体$ i $执行;

7.      根据当前策略网络和状态$ {{\boldsymbol{s}}}_{t} $选择操作动作. $ \small{{\boldsymbol{a}}_{t}=\left\{\begin{array}{ll} {{\boldsymbol{\pi}} }_{{{{\boldsymbol{\theta}} }_{i}}}(o)+{{\boldsymbol{N}}}_{t},& P=1-{\varepsilon }_{t};\\随机动作,& P={\varepsilon }_{t}.\end{array}\right.} $

8.     end for

9.     执行联合动作$ \small{A=({\boldsymbol{a}}_{1},{\boldsymbol{a}}_{2},\cdots, {\boldsymbol{a}}_{n})} $以获得下一个状态$ {{\boldsymbol{s}}}_{t+1} $和奖励$ {r}_{t} $.

10.    将$ ({{\boldsymbol{s}}}_{t},A,r,{{\boldsymbol{s}}}_{t+1}) $存储到经验回放缓冲区$ D $.

11.    if $\small{ \left| D\right| \geqslant \text{batch size}} $

12.     从$ D $中随机抽取一批转换样本$ \small{({\boldsymbol{s}}_{t}^{j},{A}^{j},r_{t}^{j},{\boldsymbol{s}}_{t+1}^{j})} $

13.     for每个智能体 $ i $执行操作

14.      计算目标$ Q $

15.      计算基于均方误差的损失函数$\small{ L({\theta }_{{{Q}_{i}}})=}$$\small{ E[{({{Q}_{i}}({{{\boldsymbol{s}}}_{t}},{{\boldsymbol{a}}_{t}},}} \small{{{{\theta }_{{{Q}_{i}}}})-({{r}_{i}}(t)+{{\gamma }_{i}}Q{'_{i}}({{{\boldsymbol{s}}}_{t+1}},{{\boldsymbol{a}}_{t+1}},\theta {'_{{{Q}_{i}}}})))}^{2}]} $

16.      通过梯度下降更新对应网络参数

17.     end for

18.   end for

19.   更新目标网络及策略网络参数$\small{\theta '_{i}\leftarrow \tau \times }$$ \small{{\theta }_{i}+(1-\tau )\theta '_{i}} $$\small{ \phi '_{i}\leftarrow \tau \times {\phi }_{i}+(1-\tau ) \phi '_{i}} $

20.  更新状态$ {{\boldsymbol{s}}}_{t}\leftarrow {{\boldsymbol{s}}}_{t+1} $

21.  end for

3.3. 算法复杂度分析及收敛性证明

在所提出的BR-MADDPG算法中,主要的计算开销来源于2部分:Actor网络与Critic网络的前向传播和参数更新. 对于每个智能体,其Actor网络包含2层全连接隐藏层,假设输入状态维度为$ {d}_{1} $,隐藏层规模分别为$ {h}_{1} $$ {h}_{2} $,输出动作维度为$ {d}_{2} $,则单次前向传播的复杂度约为$ O({d}_{1}{h}_{1}+{h}_{1}{h}_{2}+{h}_{2}{d}_{2}) $. Critic网络的输入包含所有智能体的状态与动作,假设智能体数量为与车辆数相同为$ N $,则输入维度规模为$ O(N{d}_{1}+N{d}_{2}) $,其前向传播复杂度约为$ O((N{d}_{1}+N{d}_{2}){h}_{1}+{h}_{1}{h}_{2}+{h}_{2}) $. 每次训练中,对批量大小为$ {B}_{\text{batch}} $的样本进行参数更新,每轮迭代整体复杂度为$ O({B}_{\text{batch}}\cdot N({d}_{1}{h}_{1}+{h}_{1}{h}_{2}+{h}_{2}{d}_{2}+(N{d}_{1}+N{d}_{2}){h}_{1})) $. 此外,经验回放缓冲区的采样复杂度为$ O({B}_{\text{batch}}) $,相对于神经网络计算开销可以忽略. 因此,所提算法在多智能体规模下的复杂度近似为$ O({B}_{\text{batch}}{N}^{2}{h}_{1}) $,表明其在智能体数量与网络规模增加时仍具备可扩展性.

为了保证所提出 BR-MADDPG 算法的理论有效性,参考确定性策略梯度和两时间尺度随机逼近框架,给出其收敛性说明. 在满足以下常见条件下: MDP 回报有界且策略网络与价值网络在参数空间内满足 Lipschitz 连续;小批量采样得到的梯度为无偏且方差有界;学习率满足 Robbins-Monro 条件;目标网络采用软更新机制并与评价网络存在时间尺度分离,则可推得算法参数序列在期望意义下收敛至一阶驻点. 即

$ \lim _{T_\lambda \rightarrow \infty} \dfrac{1}{T_\lambda} \displaystyle\sum_{t=1}^{T_\lambda} {E}\left\|\nabla J\left(\bar{\theta}_t\right)\right\|^2=0.$

式中:$ \nabla J({\overline{\theta }}_{t}) $为目标函数关于平均参数的梯度;$ {T}_{\lambda } $为总训练步数,并使用常数学习率,收敛至驻点邻域,其偏差随步长和梯度方差成比例.

4. 仿真分析

通过仿真验证所提BR-MADDPG算法的有效性,如表2所示列出了仿真实验的参数.

表 2   仿真实验参数列表

Tab.2  Simulation parameters

参数
Actor网络学习率$ {\text{lr}}_{{\mathrm{a}}} $$ 1\times {10}^{-5} $
Critic网络学习率$ {\text{lr}}_{{\mathrm{c}}} $$ 1\times {10}^{-3} $
任务数$ {U}_{i} $$ 3 $
车辆数$ N+M $$ [6,8,10] $
边缘服务器最大计算资源$ {R}_{{\mathrm{B}}}/\text{GHz} $$ 30 $
车联网最大计算资源$ {R}_{{\mathrm{v}}}/\text{MHz} $$ 3 $
带宽$ {B}_{n}/\text{MHz} $$ 5 $
随机动作概率$ {\varepsilon }_{t} $$ 0.2 $
噪声衰减率$ {\gamma }_{N} $$ 0.2 $
折扣因子$ \gamma /\text{kb} $$ 0.99 $
任务大小$ {\boldsymbol{s}}_{n}^{i} $$ [100,150] $
任务复杂度$ c_{nv}^{i}/{\mathrm{cycle}}/{\mathrm{byte}} $$ 1250 $
软更新系数$ \tau $$ 0.005 $
小批量抽样数$ {B} $$ 128 $
经验池容量大小$ 1\times {10}^{6} $
传输功率$ {p}^{t}/\text{mW} $$ 200 $
任务依赖关系层数$ [0,3] $
神经网络层数$ 4 $
神经元个数$ 256,\;128 $
任务优先级权重$ f_{\ell}^{i} $$ [1,9] $

新窗口打开| 下载CSV


为了评估所提算法,使用随机比例任务卸载及资源分配算法作为基准算法(Baseline),并与MADQN算法和DDPG算法比较.

4.1. 强化学习训练的收敛性能

图5所示展示了所提出的BR-MADDPG算法在不同学习率设置下的收敛性能. 训练过程中车辆数固定为8,从整体趋势来看,随着训练的深入,算法的累计奖励逐步提升并趋于稳定. 当Actor网络的学习率设为$ 1\times {10}^{-5} $,Critic网络的学习率设为$ 1\times {10}^{-3} $时,算法表现出较优的收敛速度与稳定性,显著提升了训练效果. 相反,过高的学习率会导致参数更新过程不稳定,难以实现有效收敛;而过低的学习率则可能使算法陷入局部最优,限制其性能的充分发挥. 因此,在后续实验中,采用Actor网络学习率为$ 1\times {10}^{-5} $,Critic网络学习率为$ 1\times {10}^{-3} $,以在收敛速度与策略稳定性之间取得良好平衡.

图 5

图 5   不同学习率下的收敛性对比

Fig.5   Convergence comparison under different learning rates


4.2. 算法性能分析

图6所示展示了在不同算法下,车辆数量变化对系统平均时延的影响. 随着车辆数量的增加,系统中需处理的任务数量随之上升,导致在有限的车辆计算资源与边缘服务器资源下,资源分配压力加剧,单个任务所能获得的资源份额减少,从而引起任务平均时延的增加. 尽管3种对比算法在车辆数量增加时均表现出平均时延的上升趋势,但从图中结果可以看出,本研究提出的BR-MADDPG算法在面对资源竞争加剧的情况时,仍能够有效缓解由资源瓶颈带来的时延增长问题,其性能对车辆数量的变化更具鲁棒性,时延上升幅度更小,显示出更优的任务调度能力. 相较于基准算法在不同车辆数下的平均时延降低31.6%,相较于MADQN算法降低10.5%,相较于DDPG算法降低12.4%.

图 6

图 6   不同车辆数量下的任务平均时延对比

Fig.6   Comparison of average task delays under different numbers of vehicles


图7所示进一步展示了车辆数量变化对系统整体资源利用率$\bar R $的影响. 随着车辆数量的增加,任务量显著上升,系统中更多的计算资源被激活用于任务处理,从而整体资源利用率提升. 对比结果表明,3种算法在车辆数量增加时均能提高资源利用率,其中BR-MADDPG算法在所有实验设置中均表现出最高的资源利用效率. 这说明该算法能够在满足时延约束和任务关系约束的前提下,更加充分地调度和配置计算资源,实现了更优的资源利用与任务处理效率之间的协同优化. 相较于基准算法在不同车辆数下的平均资源利用率提高19.67%,相较于MADQN算法平均提高4.54%,相较于DDPG算法平均提高15.43%.

图 7

图 7   不同车辆数量下的资源利用率对比

Fig.7   Comparison of resource utilization under different numbers of vehicles


图8所示展示了在不同算法下,车辆数的上升对平均能量消耗$\bar E $的影响. 随着车辆数的上升,系统中须处理的任务数量随之增加,从而导致车辆计算与通信能量消耗加剧. 可以看出,基准算法平均能耗呈现明显的增长趋势;MADQN算法在多车辆场景下缺乏有效的协作机制,能耗上升幅度较大;DDPG算法在车辆数量增多时扩展性略弱,能耗增幅较小;本研究提出的BR-MADDPG算法在面对任务数量增加和资源竞争加剧的情况下,能耗增长最为平缓. 相较于基准算法、MADQN算法、DDPG算法,平均能耗降低分别约为 35.7%、21.6%和7.9%.

图 8

图 8   不同车辆数量下的平均能耗对比

Fig.8   Comparison of average energy consumption under different numbers of vehicles


图9所示展示了在不同车辆数量下高优先级任务($ f_{\ell}^{i}\geqslant 7 $)的完成情况. 其中,$\bar C $为任务完成率平均值. 随着车辆数量的增加,系统中须处理的高优先级任务数量也随之上升,而有限的计算资源难以完全满足任务需求,因此整体任务完成率呈下降趋势. 然而,具有多智能体协作能力的MADDPG和MADQN算法能够更有效地协调资源分配,使得任务完成率下降幅度相对平缓. 本研究提出的BR-MADDPG算法通过超图对任务关系进行建模,在面对复杂并发任务增多的情况下表现出更显著的优势,相较于基准算法,在不同车辆数下的高优先级任务完成率提升70.1%,相较于MADQN算法提升7.9%,相较于DDPG算法提升24.6%.

图 9

图 9   不同车辆数量下的高优先任务完成率对比

Fig.9   Average high-priority task completion rate under different numbers of vehicles


5. 结 语

针对智能车联网系统中任务异构性和时延敏感性带来的调度挑战,提出基于MADDPG算法的任务卸载与资源分配联合优化方案. 通过构建任务间依赖关系的超图模型,有效刻画任务层级关系,降低系统建模复杂度;同时引入深度强化学习机制,结合环境动态特征,实现面向任务时延约束与依赖约束的自适应决策策略. 仿真结果表明,所提方法在多种车辆规模条件下均展现出更优的任务响应速度与资源调度效率并降低了系统整体能耗,验证了其在SIoV场景下的实用性与鲁棒性.

在未来的研究中,将完善多智能体负载均衡与优先级调度机制,并拓展任务类型以覆盖非时延敏感和带宽敏感任务. 未来计划结合真实车联网数据进行验证,增强方法的工程适用性,实现更高效、安全的多任务调度与资源管理.

参考文献

QUAN H, ZHANG Q, ZHAO J

Federated learning assisted intelligent IoV mobile edge computing

[J]. IEEE Transactions on Green Communications and Networking, 2025, 9 (1): 228- 241

DOI:10.1109/TGCN.2024.3421357      [本文引用: 1]

冯姣, 白若冰, 李鹏, 等

车联网异构业务共存的任务卸载和计算资源分配

[J]. 电讯技术, 2025, 65 (1): 9- 17

[本文引用: 1]

FENG Jiao, BAI Ruobing, LI Peng, et al

Task offloading and computation resource allocation for heterogeneous services in Internet of vehicles

[J]. Telecommunication Engineering, 2025, 65 (1): 9- 17

[本文引用: 1]

吴微, 徐涴砯

IRS-D2D混合通信车联网场景下的资源优化策略

[J]. 计算机应用研究, 2025, 42 (2): 560- 565

WU Wei, XU Wanping

Resource optimization strategies for IRS-D2D hybrid communication in Internet of Vehicles scenarios

[J]. Application Research of Computers, 2025, 42 (2): 560- 565

吴一川

基于A3C的车联网任务卸载和资源分配算法

[J]. 计算机与现代化, 2025, (4): 56- 62

[本文引用: 1]

WU Yichuan

A3C based task offloading and resource allocation algorithm for Internet of vehicles

[J]. Computer and Modernization, 2025, (4): 56- 62

[本文引用: 1]

TIAN S, XIANG S, ZHOU Z, et al

Task offloading and resource allocation based on reinforcement learning and load balancing in vehicular networking

[J]. IEEE Transactions on Consumer Electronics, 2025, 71 (1): 2217- 2230

DOI:10.1109/TCE.2025.3542133      [本文引用: 1]

HUANG J, WAN J, LV B, et al

Joint computation offloading and resource allocation for edge-cloud collaboration in Internet of vehicles via deep reinforcement learning

[J]. IEEE Systems Journal, 2023, 17 (2): 2500- 2511

DOI:10.1109/JSYST.2023.3249217      [本文引用: 1]

ERNEST T Z H, MADHUKUMAR A S

Computation offloading in MEC-enabled IoV networks: average energy efficiency analysis and learning-based maximization

[J]. IEEE Transactions on Mobile Computing, 2024, 23 (5): 6074- 6087

DOI:10.1109/TMC.2023.3315275      [本文引用: 1]

LIU L, CHEN Z

Joint optimization of multiuser computation offloading and wireless-caching resource allocation with linearly related requests in vehicular edge computing system

[J]. IEEE Internet of Things Journal, 2024, 11 (1): 1534- 1547

DOI:10.1109/JIOT.2023.3289994      [本文引用: 1]

WANG X, WANG S, GAO X, et al

AMTOS: an ADMM-based multilayer computation offloading and resource allocation optimization scheme in IoV-MEC system

[J]. IEEE Internet of Things Journal, 2024, 11 (19): 30953- 30964

DOI:10.1109/JIOT.2024.3416171      [本文引用: 2]

LIAO Z, XU S, HUANG J, et al

Task migration and resource allocation scheme in IoV with roadside unit

[J]. IEEE Transactions on Network and Service Management, 2023, 20 (4): 4528- 4541

DOI:10.1109/TNSM.2023.3262878      [本文引用: 1]

YANG Y, YU H, ZHAO Y, et al

A dynamic-pricing-based offloading and resource allocation scheme with data security for vehicle platoon

[J]. IEEE Internet of Things Journal, 2025, 12 (6): 7149- 7163

DOI:10.1109/JIOT.2024.3492694     

DAI C, BAO S, CHEN S, et al

Precision-adaptive task offloading and resource allocation for efficient positioning and sensing in near-field IoV systems

[J]. IEEE Internet of Things Journal, 2025, 12 (13): 22635- 22646

DOI:10.1109/JIOT.2025.3557431      [本文引用: 1]

FAN W, LIU J, HUA M, et al

Joint task offloading and resource allocation for multi-access edge computing assisted by parked and moving vehicles

[J]. IEEE Transactions on Vehicular Technology, 2022, 71 (5): 5314- 5330

DOI:10.1109/TVT.2022.3149937      [本文引用: 2]

HE Y, HUANG F, WANG D, et al

Performance analysis and optimization design of AAV-assisted vehicle platooning in NOMA-enhanced Internet of vehicles

[J]. IEEE Transactions on Intelligent Transportation Systems, 2025, 26 (6): 8810- 8819

DOI:10.1109/TITS.2025.3542402      [本文引用: 2]

YIN L, LUO J, QIU C, et al

Joint task offloading and resources allocation for hybrid vehicle edge computing systems

[J]. IEEE Transactions on Intelligent Transportation Systems, 2024, 25 (8): 10355- 10368

DOI:10.1109/TITS.2024.3351635     

LIU X, LIU J, LI W

Truthful mechanism for resource allocation and pricing in vehicle-assisted mobile edge computing

[J]. IEEE Transactions on Vehicular Technology, 2025, 74 (5): 8171- 8186

DOI:10.1109/TVT.2025.3526935      [本文引用: 1]

QIN W, LI Y, YAO H, et al

Two-layer computing resource management for blockchain-enabled Internet of vehicles

[J]. IEEE Transactions on Vehicular Technology, 2024, 73 (9): 13724- 13737

DOI:10.1109/TVT.2024.3390690     

YAN H, LI H, XU X, et al

UAV-enhanced service caching for IoT systems in extreme environments

[J]. IEEE Internet of Things Journal, 2024, 11 (16): 26741- 26750

DOI:10.1109/JIOT.2023.3288200      [本文引用: 2]

CHEN Z, HUANG Z, ZHANG J, et al

Resource allocation and collaborative offloading in multi-UAV-assisted IoV with federated deep reinforcement learning

[J]. IEEE Internet of Things Journal, 2025, 12 (5): 4629- 4640

DOI:10.1109/JIOT.2024.3516838      [本文引用: 2]

ZHAO J, QUAN H, XIA M, et al

Adaptive resource allocation for mobile edge computing in Internet of vehicles: a deep reinforcement learning approach

[J]. IEEE Transactions on Vehicular Technology, 2024, 73 (4): 5834- 5848

DOI:10.1109/TVT.2023.3335663      [本文引用: 1]

王辛果, 王昶

一种采用联邦深度强化学习的车联网资源分配方法

[J]. 电讯技术, 2024, 64 (7): 1065- 1071

[本文引用: 1]

WANG Xinguo, WANG Chang

A resource allocation method using federated deep reinforcement learning in vehicular networks

[J]. Telecommunication Engineering, 2024, 64 (7): 1065- 1071

[本文引用: 1]

CHEN Z, HUANG S, MIN G, et al

Mobility-aware seamless service migration and resource allocation in multi-edge IoV systems

[J]. IEEE Transactions on Mobile Computing, 2025, 24 (7): 6315- 6332

DOI:10.1109/TMC.2025.3540407     

WANG D, SONG B, LIN P, et al

Resource management for edge intelligence (EI)-assisted IoV using quantum-inspired reinforcement learning

[J]. IEEE Internet of Things Journal, 2022, 9 (14): 12588- 12600

DOI:10.1109/JIOT.2021.3137984      [本文引用: 2]

ZHAN Z, WANG X, LIU Y, et al

Integration and optimization strategy of blockchain-enabled edge computing system for Internet of vehicles

[J]. Journal of Cyber Security and Mobility, 2025, 14 (2): 391- 432

DOI:10.13052/jcsm2245-1439.1426      [本文引用: 2]

HOU P, HUANG Y, ZHU H, et al

Intelligent decision-based edge server sleep for green computing in MEC-enabled IoV networks

[J]. IEEE Transactions on Intelligent Vehicles, 2024, 9 (2): 3687- 3703

DOI:10.1109/TIV.2023.3347833      [本文引用: 1]

YAN M, XIONG R, WANG Y, et al

Edge computing task offloading optimization for a UAV-assisted Internet of vehicles via deep reinforcement learning

[J]. IEEE Transactions on Vehicular Technology, 2024, 73 (4): 5647- 5658

DOI:10.1109/TVT.2023.3331363     

WU D, WANG Z, PAN H, et al

In-network computing empowered mobile edge offloading architecture for Internet of Things

[J]. IEEE Transactions on Services Computing, 2024, 17 (6): 3817- 3829

DOI:10.1109/TSC.2024.3463475      [本文引用: 1]

ANUSHA V S, NITHYA G K, RAO S N. A comprehensive survey of electromagnetic propagation models [C]// Proceedings of the International Conference on Communication and Signal Processing. Chennai: IEEE, 2018: 1457–1462.

[本文引用: 1]

GUO Y, XIE W, WANG Q, et al

Betweenness approximation for edge computing with hypergraph neural networks

[J]. Tsinghua Science and Technology, 2025, 30 (1): 331- 344

DOI:10.26599/TST.2023.9010106      [本文引用: 1]

ZHANG L, ZHANG H, YU L, et al. Virtual resource allocation for mobile edge computing: a hypergraph matching approach [C]// Proceedings of the IEEE Global Communications Conference. Waikoloa: IEEE, 2020: 1–6.

[本文引用: 1]

LOWE R, WU Y, TAMAR A, et al. Multi-agent actor-critic for mixed cooperative-competitive environments [EB/OL]. [2025–07–01]. https://arxiv.org/abs/1706.02275

[本文引用: 1]

/