如图2 所示,MEC系统模型包括多个互联的基站,每个基站拥有一定数量的异构边缘服务器,并部署在用户设备(智能汽车、智能手机)附近,服务器集$ S=\left\{{s}_{1},{s}_{2},\cdots,{s}_{n}\right\} $ . 每个边缘服务器包含若干异构虚拟机,虚拟机集$ \mathrm{VM}=\left\{{\text{vm}}_{1},{\mathrm{vm}}_{2},\cdots,{\mathrm{vm}}_{m}\right\} $ ,服务器$ {s}_{h} $ 上的虚拟机集$ {\mathrm{VM}}_{h}=\left\{{\mathrm{vm}}_{i},\cdots,{\mathrm{vm}}_{j}\right\} $ . 每个边缘服务器和虚拟机都具有一定的故障率和恢复率,将用户设备定义为服务器$ {s}_{0} $ 上的虚拟机$ {\mathrm{vm}}_{0} $ . 用户设备会产生对时延敏感的应用程序,每个应用由多个具有依赖关系的子任务组成,建模为有向无环图(directed acyclic graph, DAG). 在实际场景(如自动驾驶、工业物联网、智慧交通和大数据处理等)的典型应用中,均包含阶段性任务,可通过 DAG 表示内部任务之间的依赖关系,适合进行分布式调度与优化.
用户提交的应用程序集合$ I=\left\{1,2,\cdots,N\right\} $ ,将多个具有依赖关系的子任务组成的应用建模为有向无环图$ G=\left(T,E\right) $ ,其中$ {T}_{a}=\left\{{t}_{1},{t}_{2},\cdots,{t}_{k}\right\} $ 为应用$ a $ 中子任务的集合. 每个子任务$ {t}_{i} $ 的计算参数为$ \left\{{l}_{i},{d}_{i}\right\} $ ,$ {l}_{i} $ 为完成任务$ {t}_{i} $ 所需的处理器周期总数,$ {d}_{i} $ 为任务输入数据大小. $ {E}_{a}=\left\{{e}_{ij}\left({m}_{i,j}\right)\right\} $ 为应用$ a $ 子任务间相连的边的集合,$ {m}_{i,j} $ 为子任务$ {t}_{i} $ 和$ {t}_{j} $ 间的传输数据大小. 如图3 所示,每条边表示2个子任务间的连接,箭头为依赖关系,即当前子任务只有在所有直接前继任务执行完成后才可以被启动. 定义$ \mathrm{pred}\left({t}_{q}\right) $ 为子任务$ {t}_{q} $ 的前继任务集合,$ \mathrm{succ}\left({t}_{q}\right) $ 为后继任务集合.
应用子任务可以选择在用户终端上执行,也可以卸载到MEC服务器上执行. 定义边缘服务器上虚拟机的处理能力$ C=\left\{{c}_{1},{c}_{2},\cdots,{c}_{m}\right\} $ 为单位时间内可执行的处理器指令周期数. $ t_{i,q}^{\mathrm{loc}}={l}_{q}/{c}_{0} $ 为本地计算时延,其中$ {c}_{0} $ 为用户设备的处理能力. 由于边缘节点下行信道带宽大,输出数据量小,因此忽略将卸载子任务结果返回用户的传输时间. $ t_{i,q}^{\mathrm{off}}={l}_{q}/{c}_{k}+t_{i,q,h}^{\mathrm{send}} $ 为应用$ i $ 的子任务$ t_q $ 的边缘计算时延. 为了简化,将用户$ i $ 在本地或MEC服务器上执行的子任务的延迟时间统一用$ t_{i,q}^{\mathrm{exe}} $ 表示,当$ h=0 $ 时,表示子任务在本地执行,此时传输时延$ t_{i,q,h}^{\mathrm{send}}=0 $ ,计算时延统一表示为
$ \begin{split} {\mathrm{s.t.}}\quad&{\mathrm{C}}1\colon E(i)\leqslant {E}_{\mathrm{req}},\; i\in I;\\&{\mathrm{C}}2\colon \sum\limits_{k=0}^{m}{x}_{i,q,k}=1,\;t_q\in {T}_{i},\; i\in I;\\&{\mathrm{C}}3\colon \tau \left({t}_{q}\right)\geqslant \tau \left({t}_{i}\right)+\sum\limits_{k=0}^{m}{x}_{i,q,k}\left(t_{i,q}^{\mathrm{exe}}+T_{j,q}^{\mathrm{comm}}\right),\\&\quad\quad {t}_{j}\in \mathrm{pred}\left({t}_{q}\right);\\&{\mathrm{C}}4\colon \tau \left({t}_{q}\right)+\sum\limits_{k=0}^{m}{x}_{i,q,k}\left(t_{i,q}^{\mathrm{exe}}+T_{j,q}^{\mathrm{comm}}\right)\leqslant \tau \left({t}_{j}\right),\\&\quad\quad {t}_{j}\in \mathrm{succ}\left({t}_{q}\right);\\& {\mathrm{C}}5\colon {x}_{i,q,k}\in \left\{0,1\right\}.\end{split} $
[1]
谢人超, 廉晓飞, 贾庆民, 等 移动边缘计算卸载技术综述
[J]. 通信学报 , 2018 , 39 (11 ): 138 - 155
DOI:10.11896/jsjkx.250100058
[本文引用: 1]
XIE Renchao, LIAN Xiaofei, JIA Qingmin, et al Survey on computation offloading in mobile edge computing
[J]. Journal on Communications , 2018 , 39 (11 ): 138 - 155
DOI:10.11896/jsjkx.250100058
[本文引用: 1]
[2]
CHEN L, XU Y, LU Z, et al IoT microservice deployment in edge-cloud hybrid environment using reinforcement learning
[J]. IEEE Internet of Things Journal , 2021 , 8 (16 ): 12610 - 12622
DOI:10.1109/JIOT.2020.3014970
[本文引用: 1]
[3]
MAZLAMI G, CITO J, LEITNER P. Extraction of microservices from monolithic software architectures [C]// Proceedings of the IEEE International Conference on Web Services . Honolulu: IEEE, 2017: 524–531.
[本文引用: 1]
[4]
ARAL A, BRANDIĆ I Learning spatiotemporal failure dependencies for resilient edge computing services
[J]. IEEE Transactions on Parallel and Distributed Systems , 2021 , 32 (7 ): 1578 - 1590
DOI:10.1109/TPDS.2020.3046188
[本文引用: 1]
[5]
KUMARI P, KAUR P A survey of fault tolerance in cloud computing
[J]. Journal of King Saud University: Computer and Information Sciences , 2021 , 33 (10 ): 1159 - 1176
DOI:10.1016/j.jksuci.2018.09.021
[本文引用: 2]
[6]
BIRKE R, GIURGIU I, CHEN L Y, et al. Failure analysis of virtual and physical machines: patterns, causes and characteristics [C]// Proceedings of the 44th Annual IEEE/IFIP International Conference on Dependable Systems and Networks . Atlanta: IEEE, 2014: 1–12.
[本文引用: 5]
[7]
RAY K, BANERJEE A Prioritized fault recovery strategies for multi-access edge computing using probabilistic model checking
[J]. IEEE Transactions on Dependable and Secure Computing , 2023 , 20 (1 ): 797 - 812
DOI:10.1109/TDSC.2022.3143877
[本文引用: 1]
[8]
LONG T, MA Y, XIA Y, et al. A mobility-aware and fault-tolerant service offloading method in mobile edge computing [C]// Proceedings of the IEEE International Conference on Web Services . Barcelona: IEEE, 2022: 67–72.
[本文引用: 1]
[9]
LIU H, CAO L, PEI T, et al A fast algorithm for energy-saving offloading with reliability and latency requirements in multi-access edge computing
[J]. IEEE Access , 2020 , 8 : 151 - 161
DOI:10.1109/ACCESS.2019.2961453
[本文引用: 1]
[10]
LIU J, ZHOU A, LIU C, et al Reliability-enhanced task offloading in mobile edge computing environments
[J]. IEEE Internet of Things Journal , 2022 , 9 (13 ): 10382 - 10396
DOI:10.1109/JIOT.2021.3115807
[本文引用: 1]
[11]
SAMANTA A, ESPOSITO F, NGUYEN T G Fault-tolerant mechanism for edge-based IoT networks with demand uncertainty
[J]. IEEE Internet of Things Journal , 2021 , 8 (23 ): 16963 - 16971
DOI:10.1109/JIOT.2021.3075681
[本文引用: 3]
[12]
LIU J, ZHANG Q Offloading schemes in mobile edge computing for ultra-reliable low latency communications
[J]. IEEE Access , 2018 , 6 : 12825 - 12837
DOI:10.1109/ACCESS.2018.2800032
[本文引用: 1]
[13]
ZHAO H, DENG S, LIU Z, et al Distributed redundant placement for microservice-based applications at the edge
[J]. IEEE Transactions on Services Computing , 2022 , 15 (3 ): 1732 - 1745
DOI:10.1109/TSC.2020.3013600
[本文引用: 1]
[14]
TULI S, CASALE G, JENNINGS N R. PreGAN: preemptive migration prediction network for proactive fault-tolerant edge computing [C]// Proceedings of the IEEE INFOCOM 2022 - IEEE Conference on Computer Communications . London: IEEE, 2022: 670–679.
[本文引用: 1]
[15]
LONG T, CHEN P, XIA Y, et al A deep deterministic policy gradient-based method for enforcing service fault-tolerance in MEC
[J]. Chinese Journal of Electronics , 2024 , 33 (4 ): 899 - 909
DOI:10.23919/cje.2023.00.105
[本文引用: 1]
[16]
SONG L, SUN G, YU H. An approach for fault tolerance in multi-access edge computing [C]// Proceedings of the IEEE 2nd International Conference on Deep Learning and Computer Vision . Jinan: IEEE, 2025: 1–5.
[本文引用: 1]
[17]
PARK T, YOU M, KIM J, et al Fatriot: fault-tolerant MEC architecture for mission-critical systems using a SmartNIC
[J]. Journal of Network and Computer Applications , 2024 , 231 : 103978
DOI:10.1016/j.jnca.2024.103978
[本文引用: 1]
[18]
International Organization for Standardization. Road vehicles - functional safety: ISO 26262 [S]. Geneva: International Organization for Standardization, 2017.
[本文引用: 1]
[19]
BARI M F, BOUTABA R, ESTEVES R, et al Data center network virtualization: a survey
[J]. IEEE Communications Surveys and Tutorials , 2013 , 15 (2 ): 909 - 928
DOI:10.1109/SURV.2012.090512.00043
[本文引用: 1]
[20]
XIE G, ZENG G, CHEN Y, et al Minimizing redundancy to satisfy reliability requirement for a parallel application on heterogeneous service-oriented systems
[J]. IEEE Transactions on Services Computing , 2020 , 13 (5 ): 871 - 886
DOI:10.1109/TSC.2017.2665552
[本文引用: 1]
[21]
BURKE E K, KENDALL G. Search methodologies: introductory tutorials in optimization and decision support techniques [M]. Boston: Springer, 2014: 273–316.
[本文引用: 1]
[22]
TONG Z, DENG X, CHEN H, et al DDMTS: a novel dynamic load balancing scheduling scheme under SLA constraints in cloud computing
[J]. Journal of Parallel and Distributed Computing , 2021 , 149 : 138 - 148
DOI:10.1016/j.jpdc.2020.11.007
[本文引用: 1]
[23]
GABI D, ISMAIL A S, ZAINAL A, et al Orthogonal Taguchi-based cat algorithm for solving task scheduling problem in cloud computing
[J]. Neural Computing and Applications , 2018 , 30 (6 ): 1845 - 1863
DOI:10.1007/s00521-016-2816-4
[本文引用: 1]
[24]
KHATAVKAR B, BOOPATHY P. Efficient WMaxMin static algorithm for load balancing in cloud computation [C]// Proceedings of the Innovations in Power and Advanced Computing Technologies (i-PACT) . Vellore: IEEE, 2018: 1–6.
[本文引用: 2]
[25]
邵苏杰, 吴磊, 钟成, 等 面向多工作流的基于容器的边缘微服务选择机制
[J]. 电子与信息学报 , 2022 , 44 (11 ): 3748 - 3756
DOI:10.11999/JEIT220267
[本文引用: 1]
SHAO Sujie, WU Lei, ZHONG Cheng, et al Container based microservice selection for multi-workflow in edge computing paradigm
[J]. Journal of Electronics and Information Technology , 2022 , 44 (11 ): 3748 - 3756
DOI:10.11999/JEIT220267
[本文引用: 1]
移动边缘计算卸载技术综述
1
2018
... 边缘应用与5G网络的快速发展普及,云计算模型已很难满足低时延需求的应用场景,移动边缘计算(mobile edge computing, MEC)网络[1 ] 应运而生,它将云计算能力由中心逐步下沉到边缘,利用更靠近用户或数据源的计算和存储资源来完成数据处理,为用户提供超低时延和高带宽的网络服务. ...
移动边缘计算卸载技术综述
1
2018
... 边缘应用与5G网络的快速发展普及,云计算模型已很难满足低时延需求的应用场景,移动边缘计算(mobile edge computing, MEC)网络[1 ] 应运而生,它将云计算能力由中心逐步下沉到边缘,利用更靠近用户或数据源的计算和存储资源来完成数据处理,为用户提供超低时延和高带宽的网络服务. ...
IoT microservice deployment in edge-cloud hybrid environment using reinforcement learning
1
2021
... 可靠性指标评定网络组件在特定时间内正常运行的可能性[2 ] ,在云计算系统中定义为应用成功完成调度的概率[3 ] . MEC为了增强服务质量在一定程度上忽略了系统的可靠性,使得应用在边缘端执行时更易受到故障影响,从而导致执行失败[4 ] . 选择合适的边缘计算节点执行任务,在满足用户需求的同时减小故障的发生,是提升系统可靠性的关键. 影响MEC系统可靠性的因素众多,其中边缘服务器和虚拟机(virtual machine,VM)的故障是导致可靠性降低的主要原因[5 ] ;服务器故障率受资源使用率影响[6 ] ,随着使用率上升呈先下降后上升的趋势. 传统云计算中的容错技术(如副本、重新提交)通过消耗大量边缘资源来维持可靠性,所需的恢复时间较长,在资源受限的MEC环境中很难有效使用[7 -8 ] . 边缘服务器的故障率不恒定,现有的可靠性增强任务部署方案均假设边缘计算节点的故障率恒定,但物理机的资源使用率对故障率的影响不容忽视[6 ] . 如何在节点故障率变化及资源受限的MEC环境下,构建既能降低资源消耗,又能提高系统可靠性的任务部署方案成为亟待解决的问题. ...
1
... 可靠性指标评定网络组件在特定时间内正常运行的可能性[2 ] ,在云计算系统中定义为应用成功完成调度的概率[3 ] . MEC为了增强服务质量在一定程度上忽略了系统的可靠性,使得应用在边缘端执行时更易受到故障影响,从而导致执行失败[4 ] . 选择合适的边缘计算节点执行任务,在满足用户需求的同时减小故障的发生,是提升系统可靠性的关键. 影响MEC系统可靠性的因素众多,其中边缘服务器和虚拟机(virtual machine,VM)的故障是导致可靠性降低的主要原因[5 ] ;服务器故障率受资源使用率影响[6 ] ,随着使用率上升呈先下降后上升的趋势. 传统云计算中的容错技术(如副本、重新提交)通过消耗大量边缘资源来维持可靠性,所需的恢复时间较长,在资源受限的MEC环境中很难有效使用[7 -8 ] . 边缘服务器的故障率不恒定,现有的可靠性增强任务部署方案均假设边缘计算节点的故障率恒定,但物理机的资源使用率对故障率的影响不容忽视[6 ] . 如何在节点故障率变化及资源受限的MEC环境下,构建既能降低资源消耗,又能提高系统可靠性的任务部署方案成为亟待解决的问题. ...
Learning spatiotemporal failure dependencies for resilient edge computing services
1
2021
... 可靠性指标评定网络组件在特定时间内正常运行的可能性[2 ] ,在云计算系统中定义为应用成功完成调度的概率[3 ] . MEC为了增强服务质量在一定程度上忽略了系统的可靠性,使得应用在边缘端执行时更易受到故障影响,从而导致执行失败[4 ] . 选择合适的边缘计算节点执行任务,在满足用户需求的同时减小故障的发生,是提升系统可靠性的关键. 影响MEC系统可靠性的因素众多,其中边缘服务器和虚拟机(virtual machine,VM)的故障是导致可靠性降低的主要原因[5 ] ;服务器故障率受资源使用率影响[6 ] ,随着使用率上升呈先下降后上升的趋势. 传统云计算中的容错技术(如副本、重新提交)通过消耗大量边缘资源来维持可靠性,所需的恢复时间较长,在资源受限的MEC环境中很难有效使用[7 -8 ] . 边缘服务器的故障率不恒定,现有的可靠性增强任务部署方案均假设边缘计算节点的故障率恒定,但物理机的资源使用率对故障率的影响不容忽视[6 ] . 如何在节点故障率变化及资源受限的MEC环境下,构建既能降低资源消耗,又能提高系统可靠性的任务部署方案成为亟待解决的问题. ...
A survey of fault tolerance in cloud computing
2
2021
... 可靠性指标评定网络组件在特定时间内正常运行的可能性[2 ] ,在云计算系统中定义为应用成功完成调度的概率[3 ] . MEC为了增强服务质量在一定程度上忽略了系统的可靠性,使得应用在边缘端执行时更易受到故障影响,从而导致执行失败[4 ] . 选择合适的边缘计算节点执行任务,在满足用户需求的同时减小故障的发生,是提升系统可靠性的关键. 影响MEC系统可靠性的因素众多,其中边缘服务器和虚拟机(virtual machine,VM)的故障是导致可靠性降低的主要原因[5 ] ;服务器故障率受资源使用率影响[6 ] ,随着使用率上升呈先下降后上升的趋势. 传统云计算中的容错技术(如副本、重新提交)通过消耗大量边缘资源来维持可靠性,所需的恢复时间较长,在资源受限的MEC环境中很难有效使用[7 -8 ] . 边缘服务器的故障率不恒定,现有的可靠性增强任务部署方案均假设边缘计算节点的故障率恒定,但物理机的资源使用率对故障率的影响不容忽视[6 ] . 如何在节点故障率变化及资源受限的MEC环境下,构建既能降低资源消耗,又能提高系统可靠性的任务部署方案成为亟待解决的问题. ...
... 在边缘计算场景下,导致系统可靠性降低的主要原因是MEC中服务器或虚拟机的故障[5 ] . 本文主要研究服务器和虚拟机在执行任务中故障对系统可靠性的影响. 执行可靠性主要受瞬时性故障和永久性故障影响. 鉴于瞬时性故障与执行可靠性的相关性更强[18 ] ,将故障均视为瞬时性故障,并假设所有服务器和虚拟机故障相互独立[19 ] . 在硬件生命周期中,瞬间故障的发生频率服从泊松分布[20 ] . 定义$ \lambda $ 为故障率参数,则在任务执行时间区间$ t $ 内发生$ k $ 次故障的概率为$ {\left(\lambda t\right)}^{k}\cdot {\exp}\left({-\lambda t}\right)/k!,\;k\geqslant 0 $ ,在执行任务时故障不发生的概率$ {P}_{\mathrm{succ}}={\exp}\left({-\lambda t}\right) $ . 用$ {\lambda }_{h} $ 和$ {\lambda }_{h,k} $ 分别表示服务器$ {s}_{h} $ 和其上虚拟机$ {\mathrm{vm}}_{k} $ 的故障率,则在服务器和虚拟机上执行子任务$ {t}_{q} $ 获得的可靠性值分别表示为$ {R}_{\mathrm{sh}}\left({t}_{q}\right)={\exp}\left({-{{\lambda }_{h}}{l}_{q}/{c}_{k}}\right) $ 和$ {R}_{\mathrm{vmk}}\left({t}_{q}\right)={\exp}\left({-{{\lambda }_{h,k}}{l}_{q}/{c}_{k}} \right)$ . 若完成应用$ i $ 时设备总能耗超过能耗要求$ {E}_{\mathrm{req}}\left(i\right) $ ,或执行中所在服务器或虚拟机发生故障导致应用无法完成,均视作违反应用$ i $ 的QoS请求. 用$ {R}_{\mathrm{req}}\left(i\right) $ 表示应用程序$ i $ 的可靠性需求,$ {r}_{i} $ 表示是否违反应用$ i $ 的QoS请求,若未违反,则$ {r}_{i}=1 $ ,反之$ {r}_{i}=0 $ ,$ |T_i| $ 为应用$ i $ 中子任务数量,系统可靠性表示为 ...
5
... 可靠性指标评定网络组件在特定时间内正常运行的可能性[2 ] ,在云计算系统中定义为应用成功完成调度的概率[3 ] . MEC为了增强服务质量在一定程度上忽略了系统的可靠性,使得应用在边缘端执行时更易受到故障影响,从而导致执行失败[4 ] . 选择合适的边缘计算节点执行任务,在满足用户需求的同时减小故障的发生,是提升系统可靠性的关键. 影响MEC系统可靠性的因素众多,其中边缘服务器和虚拟机(virtual machine,VM)的故障是导致可靠性降低的主要原因[5 ] ;服务器故障率受资源使用率影响[6 ] ,随着使用率上升呈先下降后上升的趋势. 传统云计算中的容错技术(如副本、重新提交)通过消耗大量边缘资源来维持可靠性,所需的恢复时间较长,在资源受限的MEC环境中很难有效使用[7 -8 ] . 边缘服务器的故障率不恒定,现有的可靠性增强任务部署方案均假设边缘计算节点的故障率恒定,但物理机的资源使用率对故障率的影响不容忽视[6 ] . 如何在节点故障率变化及资源受限的MEC环境下,构建既能降低资源消耗,又能提高系统可靠性的任务部署方案成为亟待解决的问题. ...
... [6 ]. 如何在节点故障率变化及资源受限的MEC环境下,构建既能降低资源消耗,又能提高系统可靠性的任务部署方案成为亟待解决的问题. ...
... 物理机资源使用率对故障率影响不容忽视[6 ] ,本研究考虑通过限制边缘服务器的压力值,解决服务器故障率变化下的任务部署问题. ...
... 采用物理机随CPU使用率U CPU 变化的浴盆曲线[6 ] ,模拟边缘服务器故障率随压力值变化的情况. 以服务器压力值为自变量的三次函数,对文献[6 ]中故障率曲线进行拟合,近似得出边缘服务器故障率变化曲线. 添加故障率变化因子$ \alpha $ ,表示故障率受服务器压力影响的剧烈程度,$ \alpha =0 $ 表示服务器故障率不受资源使用率的影响,$ \alpha $ 越大表明所受影响越剧烈. 如图6 所示为$ \alpha =1 $ 时的故障率拟合曲线,服务器$ {s}_{h} $ 真实故障率$ {\lambda }^{\prime}_{h} $ 计算为 ...
... ,模拟边缘服务器故障率随压力值变化的情况. 以服务器压力值为自变量的三次函数,对文献[6 ]中故障率曲线进行拟合,近似得出边缘服务器故障率变化曲线. 添加故障率变化因子$ \alpha $ ,表示故障率受服务器压力影响的剧烈程度,$ \alpha =0 $ 表示服务器故障率不受资源使用率的影响,$ \alpha $ 越大表明所受影响越剧烈. 如图6 所示为$ \alpha =1 $ 时的故障率拟合曲线,服务器$ {s}_{h} $ 真实故障率$ {\lambda }^{\prime}_{h} $ 计算为 ...
Prioritized fault recovery strategies for multi-access edge computing using probabilistic model checking
1
2023
... 可靠性指标评定网络组件在特定时间内正常运行的可能性[2 ] ,在云计算系统中定义为应用成功完成调度的概率[3 ] . MEC为了增强服务质量在一定程度上忽略了系统的可靠性,使得应用在边缘端执行时更易受到故障影响,从而导致执行失败[4 ] . 选择合适的边缘计算节点执行任务,在满足用户需求的同时减小故障的发生,是提升系统可靠性的关键. 影响MEC系统可靠性的因素众多,其中边缘服务器和虚拟机(virtual machine,VM)的故障是导致可靠性降低的主要原因[5 ] ;服务器故障率受资源使用率影响[6 ] ,随着使用率上升呈先下降后上升的趋势. 传统云计算中的容错技术(如副本、重新提交)通过消耗大量边缘资源来维持可靠性,所需的恢复时间较长,在资源受限的MEC环境中很难有效使用[7 -8 ] . 边缘服务器的故障率不恒定,现有的可靠性增强任务部署方案均假设边缘计算节点的故障率恒定,但物理机的资源使用率对故障率的影响不容忽视[6 ] . 如何在节点故障率变化及资源受限的MEC环境下,构建既能降低资源消耗,又能提高系统可靠性的任务部署方案成为亟待解决的问题. ...
1
... 可靠性指标评定网络组件在特定时间内正常运行的可能性[2 ] ,在云计算系统中定义为应用成功完成调度的概率[3 ] . MEC为了增强服务质量在一定程度上忽略了系统的可靠性,使得应用在边缘端执行时更易受到故障影响,从而导致执行失败[4 ] . 选择合适的边缘计算节点执行任务,在满足用户需求的同时减小故障的发生,是提升系统可靠性的关键. 影响MEC系统可靠性的因素众多,其中边缘服务器和虚拟机(virtual machine,VM)的故障是导致可靠性降低的主要原因[5 ] ;服务器故障率受资源使用率影响[6 ] ,随着使用率上升呈先下降后上升的趋势. 传统云计算中的容错技术(如副本、重新提交)通过消耗大量边缘资源来维持可靠性,所需的恢复时间较长,在资源受限的MEC环境中很难有效使用[7 -8 ] . 边缘服务器的故障率不恒定,现有的可靠性增强任务部署方案均假设边缘计算节点的故障率恒定,但物理机的资源使用率对故障率的影响不容忽视[6 ] . 如何在节点故障率变化及资源受限的MEC环境下,构建既能降低资源消耗,又能提高系统可靠性的任务部署方案成为亟待解决的问题. ...
A fast algorithm for energy-saving offloading with reliability and latency requirements in multi-access edge computing
1
2020
... 故障预防策略能够提前预测故障并提前采取容错方案,主要包括基于故障预防的任务部署方法与基于故障预测的任务迁移方法. 在任务部署方面,Liu等[9 ] 提出具有可靠性和时延要求的快速节能任务卸载算法,通过提前计算在每个边缘计算节点执行任务时获得的可靠性值以及所需的时间来部署任务,但未考虑虚拟机故障. Liu等[10 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,在提高系统可靠性的同时降低带宽消耗,但未考虑终端设备能耗以及边缘服务器故障率变化的情况. Samanta等[11 ] 构建面向不确定需求的容错机制,在多种网络异常条件下实现资源合理分配,缺点是忽视了设备能耗与节点故障率对系统可靠性的影响. Liu等[12 ] 提出面向超可靠低延迟的卸载方案,在任务卸载延迟和系统可靠性之间权衡,但仅考虑累积通信可靠性,未考虑计算节点故障及任务依赖关系. Zhao等[13 ] 提出面向微服务应用的分布式冗余调度算法,用于解决因容器失效导致的可用性问题,但忽略了执行时延. 在任务迁移方面,Tuli等[14 ] 提出基于生成对抗网络(generative adversarial network, GAN)复合AI模型的抢占式迁移技术,将可能发生故障的节点上的任务提前迁移至其他合适的节点执行,避免故障发生. Long等[15 ] 提出基于深度确定性策略的MEC服务容错方法,融合生成优化网络模型以预测资源故障,深度确定性策略梯度模型以实现预防性任务迁移决策,在时延、能耗与预测精度方面均取得较好效果. Song等[16 ] 提出基于服务器分类的服务迁移方案,在故障发生前主动迁移关键服务至健康节点,以降低服务中断风险. Park等[17 ] 提出基于SmartNIC的Fatriot架构,通过主动监控MEC主机上的异常情况,在检测到故障时将传入的服务流量无缝重定向到备份主机,进而保持服务不被中断,缺点是忽视了用户能耗和任务的部署问题. ...
Reliability-enhanced task offloading in mobile edge computing environments
1
2022
... 故障预防策略能够提前预测故障并提前采取容错方案,主要包括基于故障预防的任务部署方法与基于故障预测的任务迁移方法. 在任务部署方面,Liu等[9 ] 提出具有可靠性和时延要求的快速节能任务卸载算法,通过提前计算在每个边缘计算节点执行任务时获得的可靠性值以及所需的时间来部署任务,但未考虑虚拟机故障. Liu等[10 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,在提高系统可靠性的同时降低带宽消耗,但未考虑终端设备能耗以及边缘服务器故障率变化的情况. Samanta等[11 ] 构建面向不确定需求的容错机制,在多种网络异常条件下实现资源合理分配,缺点是忽视了设备能耗与节点故障率对系统可靠性的影响. Liu等[12 ] 提出面向超可靠低延迟的卸载方案,在任务卸载延迟和系统可靠性之间权衡,但仅考虑累积通信可靠性,未考虑计算节点故障及任务依赖关系. Zhao等[13 ] 提出面向微服务应用的分布式冗余调度算法,用于解决因容器失效导致的可用性问题,但忽略了执行时延. 在任务迁移方面,Tuli等[14 ] 提出基于生成对抗网络(generative adversarial network, GAN)复合AI模型的抢占式迁移技术,将可能发生故障的节点上的任务提前迁移至其他合适的节点执行,避免故障发生. Long等[15 ] 提出基于深度确定性策略的MEC服务容错方法,融合生成优化网络模型以预测资源故障,深度确定性策略梯度模型以实现预防性任务迁移决策,在时延、能耗与预测精度方面均取得较好效果. Song等[16 ] 提出基于服务器分类的服务迁移方案,在故障发生前主动迁移关键服务至健康节点,以降低服务中断风险. Park等[17 ] 提出基于SmartNIC的Fatriot架构,通过主动监控MEC主机上的异常情况,在检测到故障时将传入的服务流量无缝重定向到备份主机,进而保持服务不被中断,缺点是忽视了用户能耗和任务的部署问题. ...
Fault-tolerant mechanism for edge-based IoT networks with demand uncertainty
3
2021
... 故障预防策略能够提前预测故障并提前采取容错方案,主要包括基于故障预防的任务部署方法与基于故障预测的任务迁移方法. 在任务部署方面,Liu等[9 ] 提出具有可靠性和时延要求的快速节能任务卸载算法,通过提前计算在每个边缘计算节点执行任务时获得的可靠性值以及所需的时间来部署任务,但未考虑虚拟机故障. Liu等[10 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,在提高系统可靠性的同时降低带宽消耗,但未考虑终端设备能耗以及边缘服务器故障率变化的情况. Samanta等[11 ] 构建面向不确定需求的容错机制,在多种网络异常条件下实现资源合理分配,缺点是忽视了设备能耗与节点故障率对系统可靠性的影响. Liu等[12 ] 提出面向超可靠低延迟的卸载方案,在任务卸载延迟和系统可靠性之间权衡,但仅考虑累积通信可靠性,未考虑计算节点故障及任务依赖关系. Zhao等[13 ] 提出面向微服务应用的分布式冗余调度算法,用于解决因容器失效导致的可用性问题,但忽略了执行时延. 在任务迁移方面,Tuli等[14 ] 提出基于生成对抗网络(generative adversarial network, GAN)复合AI模型的抢占式迁移技术,将可能发生故障的节点上的任务提前迁移至其他合适的节点执行,避免故障发生. Long等[15 ] 提出基于深度确定性策略的MEC服务容错方法,融合生成优化网络模型以预测资源故障,深度确定性策略梯度模型以实现预防性任务迁移决策,在时延、能耗与预测精度方面均取得较好效果. Song等[16 ] 提出基于服务器分类的服务迁移方案,在故障发生前主动迁移关键服务至健康节点,以降低服务中断风险. Park等[17 ] 提出基于SmartNIC的Fatriot架构,通过主动监控MEC主机上的异常情况,在检测到故障时将传入的服务流量无缝重定向到备份主机,进而保持服务不被中断,缺点是忽视了用户能耗和任务的部署问题. ...
... 为了评估所提算法的有效性和准确性,将这2种算法与以下算法[11 ,24 ] 进行对比. 1) Random:部署时采取随机部署策略,调度时随机选择虚拟机部署任务,在分配所有子任务后计算总能耗,若不满足能耗需求,则重新选择虚拟机执行,直至找到满足能耗要求部署方案. 2) Greedy:部署时采用贪婪部署策略,对于每个子任务,在终端设备或MEC服务器上寻找使时延最小且满足能耗需求的位置部署. 3) 可靠性轮询部署算法(reliability round robin, RRR):部署时采用轮询部署策略[24 ] ,在调度时先找到满足能耗需求的服务器,根据平均可靠性值进行排序,并在服务器上选择能获得最大可靠性值的虚拟机部署任务,若所有服务器都已被调度过,则从头选择服务器开始调度,直至所有子任务部署完成. 4) 可靠性增强的任务卸载方法(reliability-enhanced task offloading, RETO):该算法目标是最小化物联网应用带宽消耗,同时最大限度地提高可靠性水平. Samanta等[11 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,通过在带宽消耗、执行时间和虚拟机故障率之间权衡找到最优的部署策略. ...
... [11 ]提出具有最小化带宽资源的可靠性增强任务卸载策略,通过在带宽消耗、执行时间和虚拟机故障率之间权衡找到最优的部署策略. ...
Offloading schemes in mobile edge computing for ultra-reliable low latency communications
1
2018
... 故障预防策略能够提前预测故障并提前采取容错方案,主要包括基于故障预防的任务部署方法与基于故障预测的任务迁移方法. 在任务部署方面,Liu等[9 ] 提出具有可靠性和时延要求的快速节能任务卸载算法,通过提前计算在每个边缘计算节点执行任务时获得的可靠性值以及所需的时间来部署任务,但未考虑虚拟机故障. Liu等[10 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,在提高系统可靠性的同时降低带宽消耗,但未考虑终端设备能耗以及边缘服务器故障率变化的情况. Samanta等[11 ] 构建面向不确定需求的容错机制,在多种网络异常条件下实现资源合理分配,缺点是忽视了设备能耗与节点故障率对系统可靠性的影响. Liu等[12 ] 提出面向超可靠低延迟的卸载方案,在任务卸载延迟和系统可靠性之间权衡,但仅考虑累积通信可靠性,未考虑计算节点故障及任务依赖关系. Zhao等[13 ] 提出面向微服务应用的分布式冗余调度算法,用于解决因容器失效导致的可用性问题,但忽略了执行时延. 在任务迁移方面,Tuli等[14 ] 提出基于生成对抗网络(generative adversarial network, GAN)复合AI模型的抢占式迁移技术,将可能发生故障的节点上的任务提前迁移至其他合适的节点执行,避免故障发生. Long等[15 ] 提出基于深度确定性策略的MEC服务容错方法,融合生成优化网络模型以预测资源故障,深度确定性策略梯度模型以实现预防性任务迁移决策,在时延、能耗与预测精度方面均取得较好效果. Song等[16 ] 提出基于服务器分类的服务迁移方案,在故障发生前主动迁移关键服务至健康节点,以降低服务中断风险. Park等[17 ] 提出基于SmartNIC的Fatriot架构,通过主动监控MEC主机上的异常情况,在检测到故障时将传入的服务流量无缝重定向到备份主机,进而保持服务不被中断,缺点是忽视了用户能耗和任务的部署问题. ...
Distributed redundant placement for microservice-based applications at the edge
1
2022
... 故障预防策略能够提前预测故障并提前采取容错方案,主要包括基于故障预防的任务部署方法与基于故障预测的任务迁移方法. 在任务部署方面,Liu等[9 ] 提出具有可靠性和时延要求的快速节能任务卸载算法,通过提前计算在每个边缘计算节点执行任务时获得的可靠性值以及所需的时间来部署任务,但未考虑虚拟机故障. Liu等[10 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,在提高系统可靠性的同时降低带宽消耗,但未考虑终端设备能耗以及边缘服务器故障率变化的情况. Samanta等[11 ] 构建面向不确定需求的容错机制,在多种网络异常条件下实现资源合理分配,缺点是忽视了设备能耗与节点故障率对系统可靠性的影响. Liu等[12 ] 提出面向超可靠低延迟的卸载方案,在任务卸载延迟和系统可靠性之间权衡,但仅考虑累积通信可靠性,未考虑计算节点故障及任务依赖关系. Zhao等[13 ] 提出面向微服务应用的分布式冗余调度算法,用于解决因容器失效导致的可用性问题,但忽略了执行时延. 在任务迁移方面,Tuli等[14 ] 提出基于生成对抗网络(generative adversarial network, GAN)复合AI模型的抢占式迁移技术,将可能发生故障的节点上的任务提前迁移至其他合适的节点执行,避免故障发生. Long等[15 ] 提出基于深度确定性策略的MEC服务容错方法,融合生成优化网络模型以预测资源故障,深度确定性策略梯度模型以实现预防性任务迁移决策,在时延、能耗与预测精度方面均取得较好效果. Song等[16 ] 提出基于服务器分类的服务迁移方案,在故障发生前主动迁移关键服务至健康节点,以降低服务中断风险. Park等[17 ] 提出基于SmartNIC的Fatriot架构,通过主动监控MEC主机上的异常情况,在检测到故障时将传入的服务流量无缝重定向到备份主机,进而保持服务不被中断,缺点是忽视了用户能耗和任务的部署问题. ...
1
... 故障预防策略能够提前预测故障并提前采取容错方案,主要包括基于故障预防的任务部署方法与基于故障预测的任务迁移方法. 在任务部署方面,Liu等[9 ] 提出具有可靠性和时延要求的快速节能任务卸载算法,通过提前计算在每个边缘计算节点执行任务时获得的可靠性值以及所需的时间来部署任务,但未考虑虚拟机故障. Liu等[10 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,在提高系统可靠性的同时降低带宽消耗,但未考虑终端设备能耗以及边缘服务器故障率变化的情况. Samanta等[11 ] 构建面向不确定需求的容错机制,在多种网络异常条件下实现资源合理分配,缺点是忽视了设备能耗与节点故障率对系统可靠性的影响. Liu等[12 ] 提出面向超可靠低延迟的卸载方案,在任务卸载延迟和系统可靠性之间权衡,但仅考虑累积通信可靠性,未考虑计算节点故障及任务依赖关系. Zhao等[13 ] 提出面向微服务应用的分布式冗余调度算法,用于解决因容器失效导致的可用性问题,但忽略了执行时延. 在任务迁移方面,Tuli等[14 ] 提出基于生成对抗网络(generative adversarial network, GAN)复合AI模型的抢占式迁移技术,将可能发生故障的节点上的任务提前迁移至其他合适的节点执行,避免故障发生. Long等[15 ] 提出基于深度确定性策略的MEC服务容错方法,融合生成优化网络模型以预测资源故障,深度确定性策略梯度模型以实现预防性任务迁移决策,在时延、能耗与预测精度方面均取得较好效果. Song等[16 ] 提出基于服务器分类的服务迁移方案,在故障发生前主动迁移关键服务至健康节点,以降低服务中断风险. Park等[17 ] 提出基于SmartNIC的Fatriot架构,通过主动监控MEC主机上的异常情况,在检测到故障时将传入的服务流量无缝重定向到备份主机,进而保持服务不被中断,缺点是忽视了用户能耗和任务的部署问题. ...
A deep deterministic policy gradient-based method for enforcing service fault-tolerance in MEC
1
2024
... 故障预防策略能够提前预测故障并提前采取容错方案,主要包括基于故障预防的任务部署方法与基于故障预测的任务迁移方法. 在任务部署方面,Liu等[9 ] 提出具有可靠性和时延要求的快速节能任务卸载算法,通过提前计算在每个边缘计算节点执行任务时获得的可靠性值以及所需的时间来部署任务,但未考虑虚拟机故障. Liu等[10 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,在提高系统可靠性的同时降低带宽消耗,但未考虑终端设备能耗以及边缘服务器故障率变化的情况. Samanta等[11 ] 构建面向不确定需求的容错机制,在多种网络异常条件下实现资源合理分配,缺点是忽视了设备能耗与节点故障率对系统可靠性的影响. Liu等[12 ] 提出面向超可靠低延迟的卸载方案,在任务卸载延迟和系统可靠性之间权衡,但仅考虑累积通信可靠性,未考虑计算节点故障及任务依赖关系. Zhao等[13 ] 提出面向微服务应用的分布式冗余调度算法,用于解决因容器失效导致的可用性问题,但忽略了执行时延. 在任务迁移方面,Tuli等[14 ] 提出基于生成对抗网络(generative adversarial network, GAN)复合AI模型的抢占式迁移技术,将可能发生故障的节点上的任务提前迁移至其他合适的节点执行,避免故障发生. Long等[15 ] 提出基于深度确定性策略的MEC服务容错方法,融合生成优化网络模型以预测资源故障,深度确定性策略梯度模型以实现预防性任务迁移决策,在时延、能耗与预测精度方面均取得较好效果. Song等[16 ] 提出基于服务器分类的服务迁移方案,在故障发生前主动迁移关键服务至健康节点,以降低服务中断风险. Park等[17 ] 提出基于SmartNIC的Fatriot架构,通过主动监控MEC主机上的异常情况,在检测到故障时将传入的服务流量无缝重定向到备份主机,进而保持服务不被中断,缺点是忽视了用户能耗和任务的部署问题. ...
1
... 故障预防策略能够提前预测故障并提前采取容错方案,主要包括基于故障预防的任务部署方法与基于故障预测的任务迁移方法. 在任务部署方面,Liu等[9 ] 提出具有可靠性和时延要求的快速节能任务卸载算法,通过提前计算在每个边缘计算节点执行任务时获得的可靠性值以及所需的时间来部署任务,但未考虑虚拟机故障. Liu等[10 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,在提高系统可靠性的同时降低带宽消耗,但未考虑终端设备能耗以及边缘服务器故障率变化的情况. Samanta等[11 ] 构建面向不确定需求的容错机制,在多种网络异常条件下实现资源合理分配,缺点是忽视了设备能耗与节点故障率对系统可靠性的影响. Liu等[12 ] 提出面向超可靠低延迟的卸载方案,在任务卸载延迟和系统可靠性之间权衡,但仅考虑累积通信可靠性,未考虑计算节点故障及任务依赖关系. Zhao等[13 ] 提出面向微服务应用的分布式冗余调度算法,用于解决因容器失效导致的可用性问题,但忽略了执行时延. 在任务迁移方面,Tuli等[14 ] 提出基于生成对抗网络(generative adversarial network, GAN)复合AI模型的抢占式迁移技术,将可能发生故障的节点上的任务提前迁移至其他合适的节点执行,避免故障发生. Long等[15 ] 提出基于深度确定性策略的MEC服务容错方法,融合生成优化网络模型以预测资源故障,深度确定性策略梯度模型以实现预防性任务迁移决策,在时延、能耗与预测精度方面均取得较好效果. Song等[16 ] 提出基于服务器分类的服务迁移方案,在故障发生前主动迁移关键服务至健康节点,以降低服务中断风险. Park等[17 ] 提出基于SmartNIC的Fatriot架构,通过主动监控MEC主机上的异常情况,在检测到故障时将传入的服务流量无缝重定向到备份主机,进而保持服务不被中断,缺点是忽视了用户能耗和任务的部署问题. ...
Fatriot: fault-tolerant MEC architecture for mission-critical systems using a SmartNIC
1
2024
... 故障预防策略能够提前预测故障并提前采取容错方案,主要包括基于故障预防的任务部署方法与基于故障预测的任务迁移方法. 在任务部署方面,Liu等[9 ] 提出具有可靠性和时延要求的快速节能任务卸载算法,通过提前计算在每个边缘计算节点执行任务时获得的可靠性值以及所需的时间来部署任务,但未考虑虚拟机故障. Liu等[10 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,在提高系统可靠性的同时降低带宽消耗,但未考虑终端设备能耗以及边缘服务器故障率变化的情况. Samanta等[11 ] 构建面向不确定需求的容错机制,在多种网络异常条件下实现资源合理分配,缺点是忽视了设备能耗与节点故障率对系统可靠性的影响. Liu等[12 ] 提出面向超可靠低延迟的卸载方案,在任务卸载延迟和系统可靠性之间权衡,但仅考虑累积通信可靠性,未考虑计算节点故障及任务依赖关系. Zhao等[13 ] 提出面向微服务应用的分布式冗余调度算法,用于解决因容器失效导致的可用性问题,但忽略了执行时延. 在任务迁移方面,Tuli等[14 ] 提出基于生成对抗网络(generative adversarial network, GAN)复合AI模型的抢占式迁移技术,将可能发生故障的节点上的任务提前迁移至其他合适的节点执行,避免故障发生. Long等[15 ] 提出基于深度确定性策略的MEC服务容错方法,融合生成优化网络模型以预测资源故障,深度确定性策略梯度模型以实现预防性任务迁移决策,在时延、能耗与预测精度方面均取得较好效果. Song等[16 ] 提出基于服务器分类的服务迁移方案,在故障发生前主动迁移关键服务至健康节点,以降低服务中断风险. Park等[17 ] 提出基于SmartNIC的Fatriot架构,通过主动监控MEC主机上的异常情况,在检测到故障时将传入的服务流量无缝重定向到备份主机,进而保持服务不被中断,缺点是忽视了用户能耗和任务的部署问题. ...
1
... 在边缘计算场景下,导致系统可靠性降低的主要原因是MEC中服务器或虚拟机的故障[5 ] . 本文主要研究服务器和虚拟机在执行任务中故障对系统可靠性的影响. 执行可靠性主要受瞬时性故障和永久性故障影响. 鉴于瞬时性故障与执行可靠性的相关性更强[18 ] ,将故障均视为瞬时性故障,并假设所有服务器和虚拟机故障相互独立[19 ] . 在硬件生命周期中,瞬间故障的发生频率服从泊松分布[20 ] . 定义$ \lambda $ 为故障率参数,则在任务执行时间区间$ t $ 内发生$ k $ 次故障的概率为$ {\left(\lambda t\right)}^{k}\cdot {\exp}\left({-\lambda t}\right)/k!,\;k\geqslant 0 $ ,在执行任务时故障不发生的概率$ {P}_{\mathrm{succ}}={\exp}\left({-\lambda t}\right) $ . 用$ {\lambda }_{h} $ 和$ {\lambda }_{h,k} $ 分别表示服务器$ {s}_{h} $ 和其上虚拟机$ {\mathrm{vm}}_{k} $ 的故障率,则在服务器和虚拟机上执行子任务$ {t}_{q} $ 获得的可靠性值分别表示为$ {R}_{\mathrm{sh}}\left({t}_{q}\right)={\exp}\left({-{{\lambda }_{h}}{l}_{q}/{c}_{k}}\right) $ 和$ {R}_{\mathrm{vmk}}\left({t}_{q}\right)={\exp}\left({-{{\lambda }_{h,k}}{l}_{q}/{c}_{k}} \right)$ . 若完成应用$ i $ 时设备总能耗超过能耗要求$ {E}_{\mathrm{req}}\left(i\right) $ ,或执行中所在服务器或虚拟机发生故障导致应用无法完成,均视作违反应用$ i $ 的QoS请求. 用$ {R}_{\mathrm{req}}\left(i\right) $ 表示应用程序$ i $ 的可靠性需求,$ {r}_{i} $ 表示是否违反应用$ i $ 的QoS请求,若未违反,则$ {r}_{i}=1 $ ,反之$ {r}_{i}=0 $ ,$ |T_i| $ 为应用$ i $ 中子任务数量,系统可靠性表示为 ...
Data center network virtualization: a survey
1
2013
... 在边缘计算场景下,导致系统可靠性降低的主要原因是MEC中服务器或虚拟机的故障[5 ] . 本文主要研究服务器和虚拟机在执行任务中故障对系统可靠性的影响. 执行可靠性主要受瞬时性故障和永久性故障影响. 鉴于瞬时性故障与执行可靠性的相关性更强[18 ] ,将故障均视为瞬时性故障,并假设所有服务器和虚拟机故障相互独立[19 ] . 在硬件生命周期中,瞬间故障的发生频率服从泊松分布[20 ] . 定义$ \lambda $ 为故障率参数,则在任务执行时间区间$ t $ 内发生$ k $ 次故障的概率为$ {\left(\lambda t\right)}^{k}\cdot {\exp}\left({-\lambda t}\right)/k!,\;k\geqslant 0 $ ,在执行任务时故障不发生的概率$ {P}_{\mathrm{succ}}={\exp}\left({-\lambda t}\right) $ . 用$ {\lambda }_{h} $ 和$ {\lambda }_{h,k} $ 分别表示服务器$ {s}_{h} $ 和其上虚拟机$ {\mathrm{vm}}_{k} $ 的故障率,则在服务器和虚拟机上执行子任务$ {t}_{q} $ 获得的可靠性值分别表示为$ {R}_{\mathrm{sh}}\left({t}_{q}\right)={\exp}\left({-{{\lambda }_{h}}{l}_{q}/{c}_{k}}\right) $ 和$ {R}_{\mathrm{vmk}}\left({t}_{q}\right)={\exp}\left({-{{\lambda }_{h,k}}{l}_{q}/{c}_{k}} \right)$ . 若完成应用$ i $ 时设备总能耗超过能耗要求$ {E}_{\mathrm{req}}\left(i\right) $ ,或执行中所在服务器或虚拟机发生故障导致应用无法完成,均视作违反应用$ i $ 的QoS请求. 用$ {R}_{\mathrm{req}}\left(i\right) $ 表示应用程序$ i $ 的可靠性需求,$ {r}_{i} $ 表示是否违反应用$ i $ 的QoS请求,若未违反,则$ {r}_{i}=1 $ ,反之$ {r}_{i}=0 $ ,$ |T_i| $ 为应用$ i $ 中子任务数量,系统可靠性表示为 ...
Minimizing redundancy to satisfy reliability requirement for a parallel application on heterogeneous service-oriented systems
1
2020
... 在边缘计算场景下,导致系统可靠性降低的主要原因是MEC中服务器或虚拟机的故障[5 ] . 本文主要研究服务器和虚拟机在执行任务中故障对系统可靠性的影响. 执行可靠性主要受瞬时性故障和永久性故障影响. 鉴于瞬时性故障与执行可靠性的相关性更强[18 ] ,将故障均视为瞬时性故障,并假设所有服务器和虚拟机故障相互独立[19 ] . 在硬件生命周期中,瞬间故障的发生频率服从泊松分布[20 ] . 定义$ \lambda $ 为故障率参数,则在任务执行时间区间$ t $ 内发生$ k $ 次故障的概率为$ {\left(\lambda t\right)}^{k}\cdot {\exp}\left({-\lambda t}\right)/k!,\;k\geqslant 0 $ ,在执行任务时故障不发生的概率$ {P}_{\mathrm{succ}}={\exp}\left({-\lambda t}\right) $ . 用$ {\lambda }_{h} $ 和$ {\lambda }_{h,k} $ 分别表示服务器$ {s}_{h} $ 和其上虚拟机$ {\mathrm{vm}}_{k} $ 的故障率,则在服务器和虚拟机上执行子任务$ {t}_{q} $ 获得的可靠性值分别表示为$ {R}_{\mathrm{sh}}\left({t}_{q}\right)={\exp}\left({-{{\lambda }_{h}}{l}_{q}/{c}_{k}}\right) $ 和$ {R}_{\mathrm{vmk}}\left({t}_{q}\right)={\exp}\left({-{{\lambda }_{h,k}}{l}_{q}/{c}_{k}} \right)$ . 若完成应用$ i $ 时设备总能耗超过能耗要求$ {E}_{\mathrm{req}}\left(i\right) $ ,或执行中所在服务器或虚拟机发生故障导致应用无法完成,均视作违反应用$ i $ 的QoS请求. 用$ {R}_{\mathrm{req}}\left(i\right) $ 表示应用程序$ i $ 的可靠性需求,$ {r}_{i} $ 表示是否违反应用$ i $ 的QoS请求,若未违反,则$ {r}_{i}=1 $ ,反之$ {r}_{i}=0 $ ,$ |T_i| $ 为应用$ i $ 中子任务数量,系统可靠性表示为 ...
1
... 式中:$ T\left(i\right) $ 为应用程序$ i $ 的总执行时间;$ {x}_{i,q,k} $ 为二元变量,表示应用程序$ i $ 中子任务$ {t}_{q} $ 是否在$ {\mathrm{vm}}_{k} $ 上执行,是则$ {x}_{i,q,k}=1 $ ,否则$ {x}_{i,q,k}=0 $ ;$ \tau \left({t}_{q}\right) $ 为子任务$ {t}_{q} $ 的开始时间;约束条件$ {\mathrm{C}}1 $ 表示用户完成应用程序的总能耗小于或等于给定的能耗约束;约束$ {\mathrm{C}}2 $ 表示每个子任务只能在1个地方执行;约束$ {\mathrm{C}}3 $ 和$ {\mathrm{C}}4 $ 表示当前子任务只有当所有前继任务完成之后才可执行. 利用加权和方法,将优化目标转化为单目标优化问题[21 ] . 目标优化问题表示为 ...
DDMTS: a novel dynamic load balancing scheduling scheme under SLA constraints in cloud computing
1
2021
... 为了描述用户卸载子任务时系统可靠性的均衡情况,参考分布式系统中负载不平衡程度(degree of imbalance, DI)[22 -23 ] ,可靠性均衡的评价指标DRI越小,表示计算节点之间的可靠性越均衡. 分配每个子任务时都计算可靠性均衡程度: ...
Orthogonal Taguchi-based cat algorithm for solving task scheduling problem in cloud computing
1
2018
... 为了描述用户卸载子任务时系统可靠性的均衡情况,参考分布式系统中负载不平衡程度(degree of imbalance, DI)[22 -23 ] ,可靠性均衡的评价指标DRI越小,表示计算节点之间的可靠性越均衡. 分配每个子任务时都计算可靠性均衡程度: ...
2
... 为了评估所提算法的有效性和准确性,将这2种算法与以下算法[11 ,24 ] 进行对比. 1) Random:部署时采取随机部署策略,调度时随机选择虚拟机部署任务,在分配所有子任务后计算总能耗,若不满足能耗需求,则重新选择虚拟机执行,直至找到满足能耗要求部署方案. 2) Greedy:部署时采用贪婪部署策略,对于每个子任务,在终端设备或MEC服务器上寻找使时延最小且满足能耗需求的位置部署. 3) 可靠性轮询部署算法(reliability round robin, RRR):部署时采用轮询部署策略[24 ] ,在调度时先找到满足能耗需求的服务器,根据平均可靠性值进行排序,并在服务器上选择能获得最大可靠性值的虚拟机部署任务,若所有服务器都已被调度过,则从头选择服务器开始调度,直至所有子任务部署完成. 4) 可靠性增强的任务卸载方法(reliability-enhanced task offloading, RETO):该算法目标是最小化物联网应用带宽消耗,同时最大限度地提高可靠性水平. Samanta等[11 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,通过在带宽消耗、执行时间和虚拟机故障率之间权衡找到最优的部署策略. ...
... [24 ],在调度时先找到满足能耗需求的服务器,根据平均可靠性值进行排序,并在服务器上选择能获得最大可靠性值的虚拟机部署任务,若所有服务器都已被调度过,则从头选择服务器开始调度,直至所有子任务部署完成. 4) 可靠性增强的任务卸载方法(reliability-enhanced task offloading, RETO):该算法目标是最小化物联网应用带宽消耗,同时最大限度地提高可靠性水平. Samanta等[11 ] 提出具有最小化带宽资源的可靠性增强任务卸载策略,通过在带宽消耗、执行时间和虚拟机故障率之间权衡找到最优的部署策略. ...
面向多工作流的基于容器的边缘微服务选择机制
1
2022
... 对于应用程序子任务的拓扑图,采用文献[25 ]中的Montage、CyberShake和LIGO Inspiral Analysis共3种科学工作流进行仿真实验. 系统中包含3~8个边缘服务器,每个服务器含有5个虚拟机. 整个应用大小为5~6 MB,所需处理器总周期数为5 000~6 000 Megacycles,虚拟机的计算能力$ {c}_{k} $ =5~10 GHz,用户设备处理器计算能力$ {c}_{0} $ =0.5 GHz,用户设备在1个时间单位内的能量成本$ \rho $ =5 mW,设置信道带宽W =5 MHz,用户设备的传输功率$ P $ =50~100 mW,路径损耗因子$ \alpha $ =4,信道噪声功率$ {\sigma }^{2} $ =−100 dBm,若任务为发送方,则发送的数据量为40~80 KB. 采用Backblaze公司在2023年发布的硬盘故障率作为边缘服务器和虚拟机的故障率参数$ \lambda $ ,假设用户设备在执行时不会发生故障. 应用能耗需求$ {E}_{\mathrm{req}} $ =0.14~0.18 J,可靠性需求$ {R}_{\mathrm{req}} $ =0.93~0.98,设置正可调因子$ {\theta }_{1} $ 和${\theta }_{2} $ 分别为0.2、0.8. 边缘服务器和虚拟机发生故障是概率事件,因此假设不同用户设备依次传输10 000个应用到边缘端执行,以消除随机性影响. ...
面向多工作流的基于容器的边缘微服务选择机制
1
2022
... 对于应用程序子任务的拓扑图,采用文献[25 ]中的Montage、CyberShake和LIGO Inspiral Analysis共3种科学工作流进行仿真实验. 系统中包含3~8个边缘服务器,每个服务器含有5个虚拟机. 整个应用大小为5~6 MB,所需处理器总周期数为5 000~6 000 Megacycles,虚拟机的计算能力$ {c}_{k} $ =5~10 GHz,用户设备处理器计算能力$ {c}_{0} $ =0.5 GHz,用户设备在1个时间单位内的能量成本$ \rho $ =5 mW,设置信道带宽W =5 MHz,用户设备的传输功率$ P $ =50~100 mW,路径损耗因子$ \alpha $ =4,信道噪声功率$ {\sigma }^{2} $ =−100 dBm,若任务为发送方,则发送的数据量为40~80 KB. 采用Backblaze公司在2023年发布的硬盘故障率作为边缘服务器和虚拟机的故障率参数$ \lambda $ ,假设用户设备在执行时不会发生故障. 应用能耗需求$ {E}_{\mathrm{req}} $ =0.14~0.18 J,可靠性需求$ {R}_{\mathrm{req}} $ =0.93~0.98,设置正可调因子$ {\theta }_{1} $ 和${\theta }_{2} $ 分别为0.2、0.8. 边缘服务器和虚拟机发生故障是概率事件,因此假设不同用户设备依次传输10 000个应用到边缘端执行,以消除随机性影响. ...