面向长期时间序列预测的多尺度双流架构
Multi-scale dual-stream architecture for long-term time series forecasting
通讯作者:
收稿日期: 2025-06-24
| 基金资助: |
|
Received: 2025-06-24
| Fund supported: | 国家自然科学基金联合基金资助项目(U24A20219);国家自然科学基金资助项目(62272281);泰山学者专项基金资助项目(tsqn202306274);山东省高等学校青创科技支持计划(2023KJ212). |
作者简介 About authors
王美佳(2002—),女,硕士生,从事时间序列预测研究.orcid.org/0009-0009-4029-3809.E-mail:
针对长期时间序列预测中多尺度动态捕捉不足与非线性建模能力有限的问题,提出名为Patchflow的双流架构. 设计多尺度分割策略,将长期时间序列划分为不同粒度的局部片段,精准同步建模局部与全局时序动态,提升对多频率特征的自适应能力. 引入切比雪夫多项式构建的近似卷积算子,从几何视角刻画片段间相关性,有效增强非平稳序列的建模精度. 在趋势建模的基础上,引入结构化先验以提取复杂时序依赖. 实验结果表明,相较同类方法,Patchflow在多个公开数据集上的预测精度均显著提升,在强季节性与长期趋势性序列上的表现尤为突出.
关键词:
A dual-stream framework named Patchflow was proposed to address the limited ability to capture multi-scale dynamic and insufficient nonlinear modeling capability in long-term time series forecasting. A multi-scale segmentation strategy was employed to partition long-term time series into local segments of different granularities, enabling accurate simultaneous modeling of local and global temporal dynamics while enhancing adaptability to multi-frequency patterns. A Chebyshev polynomial-based approximate convolution operator was further introduced to capture inter-segment correlations from a geometric perspective, improving the modeling accuracy of non-stationary sequences. Based on the trend modeling branch, a structured prior was introduced to extract complex temporal dependencies. Experiments on multiple public datasets showed that Patchflow consistently outperformed state-of-the-art methods, with particularly notable improvements on sequences with strong seasonality and long-term trends.
Keywords:
本文引用格式
王美佳, 张帆, 王桦, 张明丽, 张彩明.
WANG Meijia, ZHANG Fan, WANG Hua, ZHANG Mingli, ZHANG Caiming.
1. 相关工作
1.1. 补丁应用于长期时间序列预测
长期时间序列预测在金融交易、气象监测、交通调度、电力负荷预测、能源管理[12]等实际任务中具有广泛应用前景. 随着深度学习尤其是Transformer架构的发展,基于深度学习的模型已成为解决长期时间序列预测任务的主流方法. 传统Transformer在长序列场景下计算复杂度过高,受Vision Transformer[13]模型启发,研究者引入补丁机制,将长序列划分为局部块以降低计算开销并增强局部建模能力. PatchTST[10]通过等长划分与共享线性投影提升模型的泛化与效率;Crossformer[14]进一步结合多尺度补丁与交叉注意力,实现跨周期序列的增强建模;TimesNet[7]将时间序列视作二维结构并结合频谱变换,以兼顾局部与全局模式. 上述基于补丁的方法有效缓解了滑动窗口的冗余问题,成为时间序列建模的重要方向.
1.2. 时间序列预测中的多尺度建模
1.3. 切比雪夫多项式
切比雪夫多项式[16]是正交多项式,因其良好的数值稳定性和最小最大误差性质而广泛应用于函数逼近与信号处理. 与泰勒展开相比,切比雪夫多项式在全局逼近精度上更优,能够显著减轻高阶插值常见的振荡现象;与拉格朗日插值和勒让德多项式相比,切比雪夫多项式的节点分布在边界区域更加稳定,适合处理长时间跨度和强波动趋势的函数. 在深度学习领域,Defferrard等[17]提出的ChebNet,将切比雪夫多项式引入图神经网络,通过频谱图卷积实现高效的图信号处理,避免了传统图卷积对特征分解的依赖;ChebNetII[18]进一步完善ChebNet的网络结构,从频率响应的角度分析高阶项引发的振荡问题,通过限制谱域范围减少了 Runge现象,显著提升了图神经网络的表达能力与训练稳定性. 在时间序列建模方面,ChebyshevNet[19]将切比雪夫多项式显式用作非线性映射模块,用于拟合序列中潜在的非平稳趋势与多尺度变化. 本研究设计切比雪夫多项式层,并与双流结构结合,一方面保留线性路径以捕捉长期趋势,另一方面利用切比雪夫映射增强非线性分支对非平稳性和多频特征的适应能力,从而提升整体预测的稳健性与泛化性能.
2. 多尺度双流网络架构
2.1. 整体架构
多元时间序列预测任务的目标是根据给定的历史观测序列
图 1
2.2. 多尺度分割
为了简化标记,使用单变量时间序列进行描述,独立考虑每个变量,使Patchflow扩展到多变量情况. 定义
2.3. 双流预测模块
在补丁划分的基础上,Patchflow对每个尺度的输入进行时序分解,原始输入时间序列被有效地划分为2个互补的组成部分:季节性分量与趋势性分量. 该分解策略旨在简化时间序列的建模难度,使模型能够分别针对不同的动态特征进行建模与优化. 采用双流预测策略分别对季节性和趋势性部分进行独立建模与预测,充分保留各自的动态特征. 每个分量的预测结果将通过单独的全连接层进行非线性映射,输出相应的子预测序列. 所有尺度下的输出分量将被送入多尺度聚合器中进行集成. 这种分解-预测-聚合的结构不仅提升了模型的表达能力,还增强了对复杂时间序列中长期依赖的建模鲁棒性.
2.3.1. 季节性分量预测
针对季节性分量的高频周期特性,引入切比雪夫多项式层,增强对复杂模式的拟合能力. 如图2所示,输入时间序列
图 2
接着,进行切比雪夫多项式计算:
将各阶切比雪夫多项式在输入上的取值与模型学习得到的切比雪夫系数进行加权求和,实现对时间序列局部结构的非线性建模与特征融合:
式中:
经过非线性增强的特征被送入局部-全局卷积模块,进一步挖掘序列的局部动态模式. 如图3所示,局部卷积子模块集成双分支预测机制,从不同视角建模时间序列的细粒度变化与趋势信息. 经过分割后的序列
图 3
式中:
式中:
2.3.2. 趋势性分量预测
趋势性分量建模采用轻量的多层感知器网络,结合层归一化、平均池化机制,从长期视角捕获时间序列的平稳演变趋势. 该部分与季节流协同运作,整体构成双流预测架构.
式中:
2.4. 多尺度聚合
为了更好地建模时间序列中的多尺度依赖特征,将输入时间序列依据不同的补丁大小进行划分,形成多组不同时间分辨率的子序列. 每一组补丁分别通过独立的双流预测模块进行处理,获得多个预测结果,这些结果经过多尺度聚合器整合为模型的最终输出. 具体而言,对于每个补丁尺度
式中:
式中:
3. 实验分析与讨论
3.1. 时间序列预测实验
3.1.1. 数据集
在9个真实的数据集上进行实验,各个数据集的统计数据如表1所示,其中f为采样频率.
表 1 用于基准测试的公开数据集统计数据
Tab.1
| 数据集 | 种类 | C | f |
| ETTh1,ETTh2 | 变压器温度 | 7 | 1 h |
| ETTm1,ETTm2 | 变压器温度 | 7 | 15 min |
| Weather | 气象观测 | 21 | 10 min |
| Traffic | 道路占用率 | 862 | 1 h |
| Electricity | 用电负荷 | 321 | 1 d |
| Exchange | 全球8国汇率波动 | 8 | 1 d |
| ILI | 流感样病例就诊比例 | 7 | 7 d |
3.1.2. 基线和指标
在时间序列预测任务中,为了全面评估模型性能,选用2个常用的回归评估指标:平均绝对误差MAE与均方误差MSE. MAE衡量预测值与真实值之间的平均绝对偏差,能够反映模型在整体上的预测稳定性与一致性;MSE对较大误差具有更强的惩罚效应,适用于评估模型对极端预测误差的敏感性和控制能力;这2种评估指标的数值越小,表示模型的预测越准确. 设预测值序列
3.1.3. 主要实验结果
为了清晰呈现对比细节并直观突出核心性能,将各模型在多个标准多元时间序列数据集上的长期预测结果按评价指标进行拆分,MSE与MAE的详细对比分别如表2和表3所示,最优结果加粗表示,次优结果用下划线标出.整体来看,Patchflow在这2张表中,有12次取得最优结果. 与当前主流方法的具体对比结果如下:与xPatch相比,Patchflow在ETT系列数据集上的平均MSE降低了2.16%,在Exchange数据集上的平均MSE降低了8.27%;相较于SimpleTM, Patchflow评估指标呈现一致或数值更低;与Pathformer相比,Patchflow在除Electricity外的所有数据集上,评估指标数值均有所下降.
表 2 不同模型在多个标准多元时间序列数据集上的长期预测结果(MSE)
Tab.2
| 数据集 | MSE | |||||||||
| Patchflow | xPatch | SimpleTM | FilterTS | Pathformer | TimeMixer | PatchTST | TimesNet | MICN | DLinear | |
| ETTh1 | 0.420 | 0.428 | 0.423 | 0.434 | 0.439 | 0.447 | 0.446 | 0.458 | 0.440 | 0.456 |
| ETTh2 | 0.311 | 0.319 | 0.354 | 0.376 | 0.344 | 0.365 | 0.376 | 0.414 | 0.408 | 0.559 |
| ETTm1 | 0.369 | 0.377 | 0.381 | 0.385 | 0.382 | 0.381 | 0.391 | 0.400 | 0.406 | 0.403 |
| ETTm2 | 0.261 | 0.267 | 0.275 | 0.277 | 0.273 | 0.275 | 0.282 | 0.291 | 0.290 | 0.350 |
| Weather | 0.236 | 0.232 | 0.243 | 0.245 | 0.239 | 0.240 | 0.256 | 0.259 | 0.274 | 0.265 |
| Traffic | 0.500 | 0.500 | 0.444 | 0.470 | 0.501 | 0.485 | 0.515 | 0.620 | 0.585 | 0.625 |
| Electricity | 0.183 | 0.179 | 0.186 | 0.181 | 0.182 | 0.182 | 0.203 | 0.193 | 0.209 | 0.212 |
| Exchange | 0.344 | 0.375 | 0.424 | 0.350 | 0.401 | 0.408 | 0.369 | 0.416 | 0.589 | 0.354 |
| ILI | 1.432 | 1.442 | 4.915 | 2.425 | 1.563 | 1.708 | 2.110 | 2.184 | 2.653 | 2.616 |
表 3 不同模型在多个标准多元时间序列数据集上的长期预测结果(MAE)
Tab.3
| 数据集 | MAE | |||||||||
| Patchflow | xPatch | SimpleTM | FilterTS | Pathformer | TimeMixer | PatchTST | TimesNet | MICN | DLinear | |
| ETTh1 | 0.413 | 0.419 | 0.428 | 0.430 | 0.430 | 0.440 | 0.441 | 0.450 | 0.462 | 0.452 |
| ETTh2 | 0.359 | 0.361 | 0.391 | 0.398 | 0.379 | 0.395 | 0.401 | 0.427 | 0.440 | 0.515 |
| ETTm1 | 0.379 | 0.384 | 0.396 | 0.396 | 0.386 | 0.396 | 0.403 | 0.406 | 0.432 | 0.407 |
| ETTm2 | 0.310 | 0.313 | 0.322 | 0.322 | 0.316 | 0.323 | 0.325 | 0.333 | 0.343 | 0.401 |
| Weather | 0.260 | 0.261 | 0.272 | 0.274 | 0.263 | 0.297 | 0.280 | 0.287 | 0.325 | 0.317 |
| Traffic | 0.310 | 0.279 | 0.288 | 0.315 | 0.299 | 0.298 | 0.332 | 0.336 | 0.350 | 0.383 |
| Electricity | 0.274 | 0.264 | 0.287 | 0.272 | 0.269 | 0.273 | 0.290 | 0.295 | 0.319 | 0.300 |
| Exchange | 0.397 | 0.409 | 0.434 | 0.397 | 0.419 | 0.422 | 0.406 | 0.443 | 0.541 | 0.414 |
| ILI | 0.730 | 0.725 | 1.540 | 1.020 | 0.753 | 0.820 | 0.917 | 0.931 | 1.073 | 1.090 |
3.2. 消融实验
为了确定Patchflow中不同模块的影响,在保证其他参数相同的情况下,进行聚焦多尺度分割和切比雪夫多项式模块的消融实验,结果如表4所示. 表4中,
表 4 所提多尺度双流架构的模块消融实验结果
Tab.4
| 数据集 | T | Patchflow | 去除多尺度聚合 | 去除切比雪夫层 | |||||
| MSE | MAE | MSE | MAE | MSE | MAE | ||||
| ETTh1 | 96 | 0.370 | 0.387 | 0.373 | 0.389 | 0.371 | 0.388 | ||
| 192 | 0.417 | 0.401 | 0.433 | 0.413 | 0.417 | 0.405 | |||
| 336 | 0.438 | 0.417 | 0.453 | 0.429 | 0.467 | 0.435 | |||
| 720 | 0.454 | 0.446 | 0.495 | 0.473 | 0.486 | 0.462 | |||
| ETTm1 | 96 | 0.299 | 0.339 | 0.311 | 0.351 | 0.309 | 0.342 | ||
| 192 | 0.341 | 0.363 | 0.354 | 0.369 | 0.355 | 0.369 | |||
| 336 | 0.381 | 0.389 | 0.392 | 0.391 | 0.390 | 0.393 | |||
| 720 | 0.454 | 0.424 | 0.464 | 0.428 | 0.457 | 0.429 | |||
| ETTm2 | 96 | 0.162 | 0.245 | 0.166 | 0.251 | 0.164 | 0.248 | ||
| 192 | 0.227 | 0.287 | 0.231 | 0.291 | 0.230 | 0.290 | |||
| 336 | 0.283 | 0.325 | 0.291 | 0.330 | 0.292 | 0.331 | |||
| 720 | 0.371 | 0.381 | 0.380 | 0.384 | 0.381 | 0.383 | |||
| Weather | 96 | 0.152 | 0.191 | 0.157 | 0.199 | 0.168 | 0.203 | ||
| 192 | 0.201 | 0.237 | 0.206 | 0.241 | 0.213 | 0.245 | |||
| 336 | 0.256 | 0.280 | 0.264 | 0.285 | 0.267 | 0.286 | |||
| 720 | 0.338 | 0.333 | 0.345 | 0.340 | 0.344 | 0.339 | |||
3.3. 强插件分析
强插件实验是验证方法组件必要性或优越性的实验设计策略. 为了进一步验证切比雪夫多项式模块的通用性,将其作为插件组件添加至现有的强基线模型xPatch中,并分别在ETTh2、ETTm2和Weather数据集上进行实验,结果如表5所示. 观察实验结果可以得知:引入切比雪夫多项式模块导致预测误差普遍降低,验证了它在降低预测精度上的有效性. 这也说明该模块不仅适用于Patchflow,也具备良好的通用性,可用于增强其他现有架构的建模能力.
表 5 在强基线模型中引入切比雪夫多项式层的实验结果
Tab.5
| 数据集 | T | xPatch | xPatch* | |||
| MSE | MAE | MSE | MAE | |||
| ETTh2 | 96 | 0.233 | 0.300 | 0.227 | 0.298 | |
| 192 | 0.291 | 0.338 | 0.285 | 0.335 | ||
| 336 | 0.344 | 0.377 | 0.343 | 0.376 | ||
| 720 | 0.407 | 0.427 | 0.418 | 0.436 | ||
| ETTm2 | 96 | 0.166 | 0.248 | 0.165 | 0.247 | |
| 192 | 0.230 | 0.291 | 0.228 | 0.290 | ||
| 336 | 0.292 | 0.331 | 0.290 | 0.330 | ||
| 720 | 0.381 | 0.383 | 0.378 | 0.382 | ||
| Weather | 96 | 0.168 | 0.203 | 0.158 | 0.197 | |
| 192 | 0.214 | 0.245 | 0.205 | 0.240 | ||
| 336 | 0.236 | 0.273 | 0.233 | 0.272 | ||
| 720 | 0.309 | 0.321 | 0.306 | 0.321 | ||
3.4. 切比雪夫多项式层的性能分析
3.4.1. 拟合能力分析
为了进一步验证切比雪夫多项式层在简化复杂信号与信号平滑方面的能力,构建示例函数拟合任务作为测试,如图4所示. 该函数由线性趋势项与周期性正弦项叠加而成,同时叠加微弱的高斯噪声,可有效模拟实际时间序列中常见的多尺度变化模式,表达形式为
图 4
图 4 多层感知机和切比雪夫多项式层的拟合效果比较
Fig.4 Comparison of fitting effects for multi-layer perceptrons and Chebyshev polynomial layers
为了提升拟合的稳定性,切比雪夫多项式层的输入特征经过区间
3.4.2. 特征可视化分析
为了更直观地评估切比雪夫多项式层的效果,在上述示例函数拟合实验的基础上,对输入信号在进入切比雪夫层前后的特征分布进行可视化对比. 选取ETTh1数据集为例,
图 5
图 5 切比雪夫多项式层输入与输出特征对比图
Fig.5 Comparison of input and output features for Chebyshev polynomial layer
3.5. 参数敏感性分析
参数敏感性分析是通过系统性地调整模型参数,观察性能指标变化,从而评估某个参数对模型性能的影响以及参数之间的交互作用.
3.5.1. 卷积核参数敏感性分析
选取ETT 数据集,分析深度可分离卷积中的卷积核(k=2,4,6,8,10)对模型预测精度的影响. 在不同预测长度下的MSE和MAE变化被可视化为雷达图形式,如图6所示. 通过观察可知,中等尺度的卷积核通常能取得更佳的预测效果,原因在于它能在平衡局部精细特征与全局趋势信息提取方面提供良好的折中.
图 6
图 6 ETT数据集上卷积核的参数敏感性分析
Fig.6 Parameter sensitivity analysis of convolutional kernels on ETT dataset
3.5.2. 嵌入维度参数敏感性分析
选取Weather数据集,对嵌入维度进行敏感性分析(D=32、64、128、256、512),以折线图方式展现其与预测精度之间的关系,如图7所示. 实验结果表明,随着嵌入维度的增加,模型的性能逐渐提升,但在超过某一阈值后提升幅度趋于平缓甚至下降,表明过大的模型容量可能引发过拟合问题,须结合数据复杂度谨慎选择.
图 7
图 7 Weather数据集上嵌入维度的参数敏感性分析
Fig.7 Parameter sensitivity analysis of embedded dimensions on Weather dataset
3.6. 模型复杂度分析
为了验证Patchflow在实时预测场景下的实用性,在ETTh1、ETTm1和Electricity数据集上将其与多种近期长序列预测方法的计算开销FLOPs、模型规模Par和单样本推理时间I进行对比,结果如表6所示,最小值加粗表示. 在ETTm1数据集中,Patchflow的计算复杂度高于xPatch、SimpleTM、iTransformer、Pathformer和TimeMixer,但显著低于PatchTST;在ETTh1数据集上表现类似,继续保持对Pathformer和TimeMixer的时延优势;在更大规模的Electricity数据集上,Patchflow相较于其他方法仍具较高负担,仍优于PatchTST. 综合来看,Patchflow在中小规模数据集上能以较高计算代价换取显著精度提升,在大规模场景中能保持良好的推理效率,兼顾预测精度与扩展性;对于实时性要求极高的边缘部署,更适合采用如SimpleTM或iTransformer的轻量模型.
表 6 模型复杂度分析
Tab.6
| 数据集 | 模型 | FLOPs/106 | Par/106 | I/ms |
| ETTh1 | Patchflow | 123.47 | 18.45 | 8.28 |
| xPatch | 10.42 | 1.37 | 4.66 | |
| SimpleTM | 0.75 | 0.05 | 5.61 | |
| iTransformer | 23.80 | 2.17 | 2.54 | |
| Pathformer | 12.06 | 0.54 | 205.41 | |
| TimeMixer | 16.54 | 0.12 | 9.20 | |
| PatchTST | 13.56 | 67.24 | ||
| ETTm1 | Patchflow | 123.42 | 18.44 | 8.67 |
| xPatch | 10.42 | 1.37 | 5.88 | |
| SimpleTM | 0.22 | 0.02 | 3.87 | |
| iTransformer | 2.80 | 0.26 | 2.44 | |
| Pathformer | 30.09 | 0.87 | 247.52 | |
| TimeMixer | 16.54 | 0.12 | 8.72 | |
| PatchTST | 140.66 | 2.21 | 18.29 | |
| Electricity | Patchflow | 15.69 | 320.21 | |
| xPatch | 477.92 | 1.37 | 221.20 | |
| SimpleTM | 542.81 | 0.90 | 60.52 | |
| iTransformer | 4.96 | 93.01 | ||
| Pathformer | 4.31 | |||
| TimeMixer | 971.68 | 0.15 | ||
| PatchTST | 2.21 | 615.75 |
为了增强Patchflow在资源受限环境中的部署适应性,设计并评估2种轻量化策略:1)降维版本的Patchflow-Lite和2)基于结构化与非结构化剪枝的模型稀疏化方案. Patchflow-Lite在保留主干架构优势的同时,通过将嵌入维度由 128、256降至64,压缩隐藏表示空间,显著降低了模型复杂度;模型剪枝直接在训练完成的Patchflow模型上裁剪部分权重连接,以进一步减小规模与加速推理.
在ETTh1、ETTm1和Electricity数据集上进行对比实验,设置
表 7 轻量化模型的性能评估
Tab.7
| 数据集 | 模型 | FLOPs/106 | I/ms | MSE | MAE |
| ETTh1 | Patchflow | 113.28 | 9.16 | 0.438 | 0.417 |
| Patchflow_Lite | 46.63 | 6.48 | 0.439 | 0.421 | |
| ETTm1 | Patchflow | 113.28 | 9.58 | 0.381 | 0.389 |
| Patchflow_Lite | 46.63 | 6.57 | 0.387 | 0.389 | |
| Electricity | Patchflow | 819.10 | 0.182 | 0.275 | |
| Patchflow_Lite | 140.55 | 0.187 | 0.281 |
选择ETTh1和Electricity数据集评估结构化与非结构化剪枝的性能表现. 剪枝率设置为30%,
表 8 模型剪枝实验结果
Tab.8
| 数据集 | 剪枝类型 | FLOPs/106 | I/ms | MSE | MAE |
| ETTh1 | 无剪枝 | 31 | 5.24 | 0.372 | 0.388 |
| 结构化剪枝 | 31 | 6.97 | 0.499 | 0.468 | |
| 非结构化剪枝 | 31 | 6.70 | 0.372 | 0.388 | |
| Electricity | 无剪枝 | 774.61 | 5.66 | 0.154 | 0.249 |
| 结构化剪枝 | 774.61 | 7.03 | 0.341 | 0.433 | |
| 非结构化剪枝 | 774.61 | 7.14 | 0.155 | 0.250 |
综上所述,Patchflow-Lite在兼顾效率与精度方面表现出强鲁棒性,证明了该轻量化设计的有效性. 模型剪枝在压缩与加速方面的收益依赖于稀疏计算优化与硬件支持,后续可结合稀疏注意力、动态路由机制进一步提升部署性能.
为了全面评估 Patchflow 在实际应用中应对噪声干扰与异常值扰动的能力,设计系统性的鲁棒性测试实验,涵盖不同类型与强度的干扰条件,并与多种基线模型进行对比分析.
为了进一步验证模型在统一预测任务之外的泛化能力,特别是在面对真实世界中常见的缺失数据问题时的鲁棒性,引入时间序列插值任务作为扩展实验. 现实中,许多传感系统会由于传输故障或设备异常导致数据不完整,影响下游分析任务的准确性. 为了模拟这一场景,在3个典型的时间序列数据集上进行插值实验,包括ETTh1、ETTm1以及Weather. 这些数据集覆盖电力调度与气象监测等真实应用场景,且具有周期性强、趋势变化明显等特点,适合评估模型的重建能力. 实验结果如表9所示,最佳结果加粗标注. 具体而言,对原始输入序列按比例随机遮蔽,遮蔽比例为{12.5%、25%、37.5%、50%},要求模型在给定部分可观测输入的条件下预测缺失值,最终输出完整序列. 观察结果可知,通过在模型中引入遮蔽机制以模拟部分可观测的时间序列预测场景,并针对前向传播和损失函数进行定制化设计,其在输入缺失情况下仍能有效学习,体现其良好的实用潜力.
表 9 不同模型的时间序列插值性能对比
Tab.9
| 模型 | ETTh1 | ETTm1 | Weather | |||||
| MSE | MAE | MSE | MAE | MSE | MAE | |||
| Patchflow | 0.106 | 0.228 | 0.054 | 0.161 | 0.038 | 0.089 | ||
| xPatch | 0.163 | 0.283 | 0.071 | 0.185 | 0.050 | 0.115 | ||
| SimpleTM | 0.215 | 0.353 | 0.111 | 0.230 | 0.062 | 0.128 | ||
为了更全面的评估Patchflow在不同干扰条件下的预测性能,进一步对输入时间序列施加多种类型的扰动. 具体扰动类型包括高斯噪声(方差分别为0.01、0.05和0.10)、随机正负尖峰(分别占总长度的0.5%和1.0%),以及一定比例的脉冲替换(以序列最大值替换5%数据点). 每种扰动均对测试集样本施加后进行模型推断,并与未扰动输入的预测结果进行对比. 实验采用公开典型的时间序列数据集ETTh1,在
图 8
图 8 模型的异常扰动鲁棒性测试结果
Fig.8 Robustness test results of model under anomalous perturbation
综上,Patchflow能够在大多数常见噪声条件下保持稳定性能,但在应对极端突变型扰动方面仍有改进空间.
为了验证可学习权重参数的有效性,在4个基准数据集上可视化权重参数
图 9
为了探究不同补丁尺度在时间序列预测中的作用,在ETTh1、ETTm1、Weather、Electricity数据集上分别设置单一尺度补丁(P=8、16、32)与多尺度融合方案,比较在相同预测长度下的预测性能,结果如图10所示. 从整体趋势看,单一尺度补丁的最佳选择因数据集而异:较小尺度的补丁能够更精细地刻画局部变化,对高频成分和短期波动的捕捉更敏感;较大尺度的补丁具有更长的时间覆盖范围,更适合建模低频趋势和长期依赖. 单一尺度在不同数据集上的表现差异总体较小,说明仅依赖单一尺度难以稳定适应多样化的时间序列模式. 相比之下,多尺度方案在所有数据集上均优于任一单尺度设定. 这表明:不同尺度补丁能够互补短期波动与长期趋势的建模能力,在多样化时间序列模式下具有更强的适应性.
图 10
图 10 补丁尺度与多尺度融合方案在不同数据集上的预测性能对比
Fig.10 Comparison of prediction performance between patch-scale and multi-scale fusion schemes across different datasets
为了更直观地评估模型的多步预测性能,在多个数据集上绘制典型样本片段的真实值与预测值对比曲线.
如图11所示为模型在Electricity和Weather 数据集上预测值与真实值的可视化对比. 设置
图 11
图 11 在Electricity和Weather数据集上2种模型的预测值与真实值对比
Fig.11 Comparison of predictions and ground truth for two models on Electricity and Weather datasets
如图12所示为模型在ETTh1和ETTm1数据集上预测值与真实值的可视化对比. 设置
图 12
图 12 在ETTh1和ETTm1数据集上2种模型的预测值与真实值的对比
Fig.12 Comparison of predictions and ground truth for two models on ETTh1 and ETTm1 datasets
Patchflow之所以能有效响应复杂波动,得益于多尺度补丁机制与双流网络架构的协同设计,使模型不仅在平稳区间保持稳定拟合,也能在远端预测和趋势突变中表现出更强的泛化能力.
4. 结 语
本研究提出名为Patchflow的双流结构时间序列预测框架,结合多尺度时间分割与切比雪夫多项式建模策略,针对长期依赖建模与复杂周期问题进行优化. 在多个标准长期预测数据集上的实验表明,Patchflow在准确性和泛化性方面均优于现有主流基线模型. 未来工作考虑将切比雪夫模块作为可插拔组件应用于如分类、异常检测的时间序列分析任务中,进一步提升Patchflow的通用性与实用价值.
参考文献
Are transformers effective for time series forecasting?
[J].
基于边缘和距离约束的有理多项式图像放大
[J].
Rational polynomial image magnification based on edge and distance constraints
[J].
Time-series forecasting with deep learning: a survey
[J].
ChebyshevNet: a novel time series analysis model using Chebyshev polynomial
[J].DOI:10.1007/s11227-024-06672-y [本文引用: 1]
xPatch: dual-stream time series forecasting with exponential seasonal-trend decomposition
[J].DOI:10.1609/aaai.v39i19.34270 [本文引用: 1]
/
| 〈 |
|
〉 |

