面向智能车联网的异构分层任务卸载与资源优化
Heterogeneous hierarchical task offloading and resource optimization for Smart Internet of Vehicles
通讯作者:
收稿日期: 2025-08-9
| 基金资助: |
|
Received: 2025-08-9
| Fund supported: | 国家自然科学基金资助项目(62301094);重庆市技术创新与应用发展专项重大项目(CSTB2024TIAD-STX0034);重庆市教育委员会科技研究计划资助项目(KJQN202201157,KJQN202301135);重庆理工大学科研创新团队培育计划资助项目(2023TDZ003). |
作者简介 About authors
赖显智(2000—),男,硕士生,从事无线通信理论研究.orcid.org/0009-0008-1593-1445.E-mail:
为了提升智能车联网中多任务处理的实时性、资源调度效率和能耗控制水平,针对任务的异构特性与分层依赖关系开展研究,提出基于深度确定性策略梯度的高效任务卸载与资源分配算法. 采用超图结构提取任务依赖特征,以刻画任务间复杂关联关系. 引入融合优先级及时延约束的排队机制,并采用集中训练与分布执行架构,提高策略稳定性,实现卸载决策与资源分配的实时输出. 利用多智能体深度确定性策略梯度框架构,结合边缘节点算力负载、无线网络状态与任务截止期限设计状态空间与奖励函数,以实现协同优化. 仿真结果表明,所提算法能够根据网络变化实时感知节点算力瓶颈,生成调度策略满足低延迟、高可靠及低能耗要求. 与现有算法相比,所提算法的任务调度完成时延平均降低18.17%,资源利用效率平均提升13.21%,平均能耗降低 21.73%. 实验结果证明了所提方法在多任务调度与资源优化方面具有优越性能.
关键词:
Research was conducted on task heterogeneity and hierarchical dependencies, in order to enhance the real-time performance of multi-task processing, improve resource scheduling efficiency, and control energy consumption in smart vehicular networks. An efficient task offloading and resource allocation algorithm based on deep deterministic policy gradients was proposed. A hypergraph structure was adopted to extract task dependency features, through which complex inter-task relationships were characterized. A queueing mechanism integrating task priority and latency constraints was introduced, and a centralized training with decentralized execution architecture was employed to improve policy stability, enabling real-time offloading decisions and resource allocation. A cooperative optimization model was further constructed based on a multi-agent deep deterministic policy gradient framework, where edge computing load, wireless network conditions, and task deadlines were jointly incorporated into the design of the state space and reward function. Simulation results showed that the proposed algorithm can detect node computing power bottlenecks in real time based on network changes and generate scheduling strategies that meet the requirements of low latency, high reliability, and low energy consumption. Compared with existing algorithms, the proposed method reduced task scheduling latency by 18.17%, increased resource utilization by 13.21%, and lowered average energy consumption by 21.73% on average. These results demonstrate that the method exhibits superior performance in multi-task scheduling and resource optimization.
Keywords:
本文引用格式
赖显智, 杨凡, 黄杰, 余成波, 李幸星.
LAI Xianzhi, YANG Fan, HUANG Jie, YU Chengbo, LI Xingxing.
随着物联网的快速发展,更多的物联网设备集成到车辆系统. 同时,车联网设备的智能化以及自动驾驶类新兴业务的兴起,导致车辆所产生的数据量呈指数级增长,对计算资源提出了更高要求[1]. 以大型服务器集群为核心的传统云计算能够提供充足算力支持,但其物理位置通常远离车辆实际部署区域,难以满足智能车联网(Smart Internet of Vehicles,SIoV)对低时延和高可靠性的严苛需求[2-4]. 为了应对上述挑战,移动边缘计算(mobile edge computing,MEC)作为一种新型计算范式应运而生. 通过将计算资源部署在靠近车联网用户的边缘节点上,边缘计算能够支持车辆将部分计算任务卸载至本地边缘服务器,从而有效减少因远程数据传输带来的通信时延[5-6]. 然而,边缘服务器的计算资源相较于云端仍然有限,难以承载SIoV网络中日益增长的计算密集型和延迟敏感型任务需求. 这种资源与需求之间的矛盾,可能导致系统拥塞,严重时甚至引发交通瘫痪或安全事故[7-8]. 因此,如何设计高效的任务卸载机制与资源分配策略,以实现边缘资源的优化利用,保障系统的实时性与稳定性,成为当前亟待解决的重要问题.
为了应对资源受限与任务多样性问题,部分研究借助优化与博弈方法提升卸载效率和资源利用率[9-13]. 例如,Wang等[9]采用交替方向乘子法构建多车辆卸载模型以降低系统代价;Liao等[10]基于距离的资源分配策略实现协作卸载与负载均衡; Dai等[12-13]分别从任务精度与辅助车辆协作角度优化能耗与时延. 在此基础上,混合优化与博弈策略进一步增强了系统的动态适应性[14-18]. He等[14]结合Q学习与图优化实现非正交多址场景下的轨迹与频谱联合分配;Liu等[16]提出混合拍卖模型以保障资源分配真实性与社会福利;Yan等[18]利用势博弈构建无人机增强型服务缓存架构. 从总体来看,优化与博弈类方法在性能提升上表现出色,但多数模型假设系统静态或单时隙,难以适应车联网中时变网络环境.
为了克服上述局限,深度强化学习(deep reinforcement learning,DRL)凭借自适应与在线学习特性被引入任务卸载问题[19-23]. Chen等 [19]提出基于联邦深度强化学习的协作卸载策略,有效降低延迟与决策时间;Zhao等 [20]利用深度确定性策略梯度(deep deterministic policy gradient,DDPG)算法优化上/下行与计算资源分配;王辛果等[21]提出通过任务拆分与空闲车辆协作计算、结合基于优先级的样本采样机制的方法,以提高样本利用率并降低平均时延; Wang等 [23]结合马尔可夫决策过程与量子启发RL实现双接口自适应卸载. 进一步地,部分研究引入强化学习联合优化[24-27]. 例如,Zhan等 [24]将区块链与双深度Q网络相融合,构建安全可扩展的边缘计算架构,实现延迟、能耗与安全性的联合优化;Hou等 [25]提出基于联邦深度强化学习的动态睡眠决策算法,通过流量感知机制显著提升能效与泛化性. 强化学习类方法已逐步展现出应对动态复杂环境的潜力,能够实现时变网络下的实时优化与自适应决策. 然而,在SIoV系统中,智能驾驶终端广泛部署,不同车辆运行的任务在时延敏感性、重要性方面存在显著差异,表现为任务异构性,并且有明显的执行优先区别. 同时,SIoV系统须承担环境感知、路径规划、障碍规避及协同驾驶等核心任务,各模块间存在严格处理流程,上层任务的输出直接构成下层任务的输入,体现出任务分层依赖关系. 在边缘计算架构下,为了提升系统整体响应效率,即使上游任务尚未完成,任务生成模块也常采用预测性策略提前触发后续任务请求,从而形成并行的任务处理流程. 但受限于通信带宽、计算能力以及网络状态的动态变化,系统难以及时、准确地完成任务调度与资源分配,极易造成任务执行顺序混乱,影响响应效果,甚至引发安全隐患. 因此,解决SIoV网络中任务卸载及资源分配优化问题,同时考虑由任务特性产生的任务异构性与分层依赖关系是一个必须解决的紧迫问题.
针对上述问题,首先对不同任务优先级进行分类,并利用超图模型对任务中存在的依赖关系进行建模,最后提出基于任务关系的多智能体深度确定性策略梯度算法(behavior-relation-aware multi-agent DDPG,BR-MADDPG),以降低每个任务的平均时延,提高系统整体的资源利用率. 本研究从以下3个方面展开研究. 1)从任务特性出发,针对车辆任务在时延敏感度上的差异性,引入任务优先级分类机制,以此构建符合业务需求的调度基础. 2)考虑到任务之间存在的分层依赖结构,构建基于超图的任务关系模型,用以替代传统的有向无环图(directed acyclic graph,DAG)描述方式,从而提升复杂依赖关系的表达能力与可扩展性. 3)为了应对多车辆多任务并发调度与资源优化问题,设计集中式训练、分布式执行的多智能体强化学习框架,提出改进的BR-MADDPG算法,并据此开发改进算法用于系统优化控制.
1. 系统模型
1.1. 网络模型
智能车联网的系统模型图如图1所示,系统中存在普通车辆与无人驾驶车辆,分别构成集合
图 1
在此模型中,将正交频分多址接入应用于
式中:
式中:
式中:
1.2. 优先级及依赖性驱使的时延模型
设
式中:
式中:
针对移动设备任务调度场景中多目标决策复杂性的问题,提出基于层次分析法的主任务优先级判定模型. 该模型通过构建多准则成对比较矩阵、计算特征向量权重以及对任务属性进行归一化处理,实现主任务优先级的量化排序. 为了确定任务的优先级,综合考虑任务数据大小、所需 CPU 周期数及截止时间等关键因素. 在本研究中,截止时间被赋予最高权重以更准确地反映任务时效性的优先级需求. 首先,比较相同级别的因子并用于构建分析层次矩阵
式中:
表 1 重要性比较因子
Tab.1
| 因子 | |
| 同等重要 | 1 |
| 比较重要 | 5 |
| 绝对重要 | 9 |
| 其他 | 2, 4, 6, 8··· |
所有任务的权重矩阵构造为
式中:
同时,无论任务处理时是顺序执行还是并行执行,在一个主任务中多个分任务均依赖于所有前任务的成功完成,如图2所示,因此第
图 2
为了保证单个任务的准确完成,须满足任务间的先后依赖关系,即子任务必须在其对应的父任务完成后才能开始执行. 由此,给定的计划任务的开始时间取决于其父任务的最大完成时间,从而导致依赖性. 因此,第
式中:
式中:
1.3. 基于超图的任务依赖性构造模型
超图定义为
本质上,超边是无序集合,表示并列的、并发的依赖关系,而DAG中的链式依赖是有序结构. 将链式依赖简化为一条超边,就会丢失顺序信息,因此不能简单地用一个集合连接全部任务来表达必须按顺序执行. 以图3为例来展现一个完整的任务依赖关系,在超边
图 3
如果任务
式中:
2. 问题公式化
本研究重点研究智能车联网场景下任务卸载及资源分配问题,通过优化调度以及分配卸载策略,系统能够合理制定任务卸载及资源分配方案,从而降低网络整体时延,提高资源利用效率,解决系统中多任务的优先级以及依赖性问题,提高任务的及时完成率. 因此,智能车联网中低时延任务卸载资源分配的问题可以描述为
式中:
3. 基于深度强化学习的任务卸载及资源分配方案
为了实现上述目标(式(15)),为智能车联网构建了一个多智能体马尔可夫决策过程(multi-agent Markov decision process,MA-MDP)模型,其奖励函数根据该优化问题的目标设计. 该模型由多个相互交互的智能体、联合状态空间、动作空间、状态转移函数及奖励函数组成,每个智能体均在环境中通过学习获得最优策略,以实现系统整体性能优化. 然而,在智能车联网场景中,环境表现出高度的可变性,智能体的当前状态在部分已知的转换概率下转换到其他状态. 为了应对这一挑战,深度强化学习(deep reinforcement learning,DRL)被用来迭代地训练智能体,优化决策策略. 在DRL框架内,采用集中式决策方法,其中DRL智能体通过网络控制模块实现. 该模块通过收集并整合全局系统状态信息,实现对实际问题的优化决策,从而促进对所有请求的最佳决策. 由于任务间资源分配的相互影响,用传统方法无法在多项式时间内求解. 因此,本章使用多智能体的方法来转换问题.
3.1. 马尔可夫过程
将任务卸载及资源分配问题建模为MA-MDP模型. 在时隙
3.1.1. 状态空间
在时隙
1)
2)
3)
状态空间表示为
3.1.2. 动作空间
对于每个智能体,动作是一个连续的向量,表示为
则动作空间可以表示为
3.1.3. 奖励函数
奖励函数
式中:
智能体
式中:
3.2. 基于任务层级关系的MADDPG算法
在SIoV网络环境中提出基于任务关系的多智能体深度确定性策略梯度算法(BR-MADDPG),用于高效地进行任务卸载决策[31]. 如图4所示给出了BR-MADDPG算法框架,在训练阶段采用集中式训练、执行阶段采用分布式决策的框架,使得算法既能够在训练中利用全局信息提升收敛性与稳定性,又能在执行中仅依赖局部观测实现低时延与低通信开销的实时决策. 该算法中,每个智能体均配备一组独立的 Actor 网络与 Critic 网络,以及相应的目标网络(target network). 其中,Actor 网络用于基于本地观测生成卸载动作,Critic 网络则评估状态-动作对的价值函数. 为了提升训练稳定性与全局最优性,BR-MADDPG 采用集中式训练与分布式执行的策略:在训练阶段,智能体的 Critic 网络能够访问所有智能体的状态与动作信息,从而更准确地估计全局
图 4
各智能体首先感知当前网络状态,然后选择对应动作与环境交互,导致环境状态转移并获得奖励反馈. 通过持续与环境交互,智能体不断收集经验数据(状态、动作、奖励、下一个状态),并通过重放机制构建训练样本. 边缘服务器作为集中控制单元,负责管理各智能体的关键网络参数,并利用全局状态-动作信息对各 Critic 网络进行统一更新,从而优化策略并实现全局
使用带探索噪声的确定性策略进行动作选择,动作选择为
式中:
式中:
随后通过随机梯度下降更新critic网络来最小化损失函数:
式中:
式中:
BR-MADDPG算法的步骤概述如下.
算法1. BR-MADDPG算法
输入:多智能体车辆边缘计算网络环境
输出:任务卸载和资源分配策略
1. 初始化经验回放缓冲区
2. 初始化目标网络
3. for每个轮次执行
4. 重置环境并获取初始状态
5. for每个时间步
6. for每个智能体
7. 根据当前策略网络和状态
8. end for
9. 执行联合动作
10. 将
11. if
12. 从
13. for每个智能体
14. 计算目标
15. 计算基于均方误差的损失函数
16. 通过梯度下降更新对应网络参数
17. end for
18. end for
19. 更新目标网络及策略网络参数
20. 更新状态
21. end for
3.3. 算法复杂度分析及收敛性证明
在所提出的BR-MADDPG算法中,主要的计算开销来源于2部分:Actor网络与Critic网络的前向传播和参数更新. 对于每个智能体,其Actor网络包含2层全连接隐藏层,假设输入状态维度为
为了保证所提出 BR-MADDPG 算法的理论有效性,参考确定性策略梯度和两时间尺度随机逼近框架,给出其收敛性说明. 在满足以下常见条件下: MDP 回报有界且策略网络与价值网络在参数空间内满足 Lipschitz 连续;小批量采样得到的梯度为无偏且方差有界;学习率满足 Robbins-Monro 条件;目标网络采用软更新机制并与评价网络存在时间尺度分离,则可推得算法参数序列在期望意义下收敛至一阶驻点. 即
式中:
4. 仿真分析
通过仿真验证所提BR-MADDPG算法的有效性,如表2所示列出了仿真实验的参数.
表 2 仿真实验参数列表
Tab.2
| 参数 | 值 |
| Actor网络学习率 | |
| Critic网络学习率 | |
| 任务数 | |
| 车辆数 | |
| 边缘服务器最大计算资源 | |
| 车联网最大计算资源 | |
| 带宽 | |
| 随机动作概率 | |
| 噪声衰减率 | |
| 折扣因子 | |
| 任务大小 | |
| 任务复杂度 | |
| 软更新系数 | |
| 小批量抽样数 | |
| 经验池容量大小 | |
| 传输功率 | |
| 任务依赖关系层数 | |
| 神经网络层数 | |
| 神经元个数 | |
| 任务优先级权重 |
为了评估所提算法,使用随机比例任务卸载及资源分配算法作为基准算法(Baseline),并与MADQN算法和DDPG算法比较.
4.1. 强化学习训练的收敛性能
如图5所示展示了所提出的BR-MADDPG算法在不同学习率设置下的收敛性能. 训练过程中车辆数固定为8,从整体趋势来看,随着训练的深入,算法的累计奖励逐步提升并趋于稳定. 当Actor网络的学习率设为
图 5
4.2. 算法性能分析
如图6所示展示了在不同算法下,车辆数量变化对系统平均时延的影响. 随着车辆数量的增加,系统中需处理的任务数量随之上升,导致在有限的车辆计算资源与边缘服务器资源下,资源分配压力加剧,单个任务所能获得的资源份额减少,从而引起任务平均时延的增加. 尽管3种对比算法在车辆数量增加时均表现出平均时延的上升趋势,但从图中结果可以看出,本研究提出的BR-MADDPG算法在面对资源竞争加剧的情况时,仍能够有效缓解由资源瓶颈带来的时延增长问题,其性能对车辆数量的变化更具鲁棒性,时延上升幅度更小,显示出更优的任务调度能力. 相较于基准算法在不同车辆数下的平均时延降低31.6%,相较于MADQN算法降低10.5%,相较于DDPG算法降低12.4%.
图 6
图 6 不同车辆数量下的任务平均时延对比
Fig.6 Comparison of average task delays under different numbers of vehicles
如图7所示进一步展示了车辆数量变化对系统整体资源利用率
图 7
图 7 不同车辆数量下的资源利用率对比
Fig.7 Comparison of resource utilization under different numbers of vehicles
如图8所示展示了在不同算法下,车辆数的上升对平均能量消耗
图 8
图 8 不同车辆数量下的平均能耗对比
Fig.8 Comparison of average energy consumption under different numbers of vehicles
如图9所示展示了在不同车辆数量下高优先级任务(
图 9
图 9 不同车辆数量下的高优先任务完成率对比
Fig.9 Average high-priority task completion rate under different numbers of vehicles
5. 结 语
针对智能车联网系统中任务异构性和时延敏感性带来的调度挑战,提出基于MADDPG算法的任务卸载与资源分配联合优化方案. 通过构建任务间依赖关系的超图模型,有效刻画任务层级关系,降低系统建模复杂度;同时引入深度强化学习机制,结合环境动态特征,实现面向任务时延约束与依赖约束的自适应决策策略. 仿真结果表明,所提方法在多种车辆规模条件下均展现出更优的任务响应速度与资源调度效率并降低了系统整体能耗,验证了其在SIoV场景下的实用性与鲁棒性.
在未来的研究中,将完善多智能体负载均衡与优先级调度机制,并拓展任务类型以覆盖非时延敏感和带宽敏感任务. 未来计划结合真实车联网数据进行验证,增强方法的工程适用性,实现更高效、安全的多任务调度与资源管理.
参考文献
Federated learning assisted intelligent IoV mobile edge computing
[J].DOI:10.1109/TGCN.2024.3421357 [本文引用: 1]
车联网异构业务共存的任务卸载和计算资源分配
[J].
Task offloading and computation resource allocation for heterogeneous services in Internet of vehicles
[J].
IRS-D2D混合通信车联网场景下的资源优化策略
[J].
Resource optimization strategies for IRS-D2D hybrid communication in Internet of Vehicles scenarios
[J].
基于A3C的车联网任务卸载和资源分配算法
[J].
A3C based task offloading and resource allocation algorithm for Internet of vehicles
[J].
Task offloading and resource allocation based on reinforcement learning and load balancing in vehicular networking
[J].DOI:10.1109/TCE.2025.3542133 [本文引用: 1]
Joint computation offloading and resource allocation for edge-cloud collaboration in Internet of vehicles via deep reinforcement learning
[J].DOI:10.1109/JSYST.2023.3249217 [本文引用: 1]
Computation offloading in MEC-enabled IoV networks: average energy efficiency analysis and learning-based maximization
[J].DOI:10.1109/TMC.2023.3315275 [本文引用: 1]
Joint optimization of multiuser computation offloading and wireless-caching resource allocation with linearly related requests in vehicular edge computing system
[J].DOI:10.1109/JIOT.2023.3289994 [本文引用: 1]
AMTOS: an ADMM-based multilayer computation offloading and resource allocation optimization scheme in IoV-MEC system
[J].DOI:10.1109/JIOT.2024.3416171 [本文引用: 2]
Task migration and resource allocation scheme in IoV with roadside unit
[J].DOI:10.1109/TNSM.2023.3262878 [本文引用: 1]
A dynamic-pricing-based offloading and resource allocation scheme with data security for vehicle platoon
[J].
Precision-adaptive task offloading and resource allocation for efficient positioning and sensing in near-field IoV systems
[J].DOI:10.1109/JIOT.2025.3557431 [本文引用: 1]
Joint task offloading and resource allocation for multi-access edge computing assisted by parked and moving vehicles
[J].DOI:10.1109/TVT.2022.3149937 [本文引用: 2]
Performance analysis and optimization design of AAV-assisted vehicle platooning in NOMA-enhanced Internet of vehicles
[J].DOI:10.1109/TITS.2025.3542402 [本文引用: 2]
Joint task offloading and resources allocation for hybrid vehicle edge computing systems
[J].
Truthful mechanism for resource allocation and pricing in vehicle-assisted mobile edge computing
[J].DOI:10.1109/TVT.2025.3526935 [本文引用: 1]
Two-layer computing resource management for blockchain-enabled Internet of vehicles
[J].
UAV-enhanced service caching for IoT systems in extreme environments
[J].DOI:10.1109/JIOT.2023.3288200 [本文引用: 2]
Resource allocation and collaborative offloading in multi-UAV-assisted IoV with federated deep reinforcement learning
[J].DOI:10.1109/JIOT.2024.3516838 [本文引用: 2]
Adaptive resource allocation for mobile edge computing in Internet of vehicles: a deep reinforcement learning approach
[J].DOI:10.1109/TVT.2023.3335663 [本文引用: 1]
一种采用联邦深度强化学习的车联网资源分配方法
[J].
A resource allocation method using federated deep reinforcement learning in vehicular networks
[J].
Mobility-aware seamless service migration and resource allocation in multi-edge IoV systems
[J].
Resource management for edge intelligence (EI)-assisted IoV using quantum-inspired reinforcement learning
[J].DOI:10.1109/JIOT.2021.3137984 [本文引用: 2]
Integration and optimization strategy of blockchain-enabled edge computing system for Internet of vehicles
[J].DOI:10.13052/jcsm2245-1439.1426 [本文引用: 2]
Intelligent decision-based edge server sleep for green computing in MEC-enabled IoV networks
[J].DOI:10.1109/TIV.2023.3347833 [本文引用: 1]
Edge computing task offloading optimization for a UAV-assisted Internet of vehicles via deep reinforcement learning
[J].
In-network computing empowered mobile edge offloading architecture for Internet of Things
[J].DOI:10.1109/TSC.2024.3463475 [本文引用: 1]
Betweenness approximation for edge computing with hypergraph neural networks
[J].DOI:10.26599/TST.2023.9010106 [本文引用: 1]
/
| 〈 |
|
〉 |

