浙江大学学报(工学版), 2026, 60(8): 1770-1781 doi: 10.3785/j.issn.1008-973X.2026.08.016

计算机技术

面向长期时间序列预测的多尺度双流架构

王美佳,, 张帆,, 王桦, 张明丽, 张彩明

1. 山东工商学院 计算机科学与技术学院,山东 烟台 264005

2. 山东省高等学校未来健康智能医疗产业工程研究中心,山东 烟台 264005

3. 鲁东大学 计算机与人工智能学院,山东 烟台 264025

4. 麦吉尔大学 麦吉尔综合神经学中心 蒙特利尔神经科学研究所,魁北克 蒙特利尔 H3A 2B4

5. 山东大学 软件学院,山东 济南 250100

Multi-scale dual-stream architecture for long-term time series forecasting

WANG Meijia,, ZHANG Fan,, WANG Hua, ZHANG Mingli, ZHANG Caiming

1. School of Computer Science and Technology, Shandong Technology and Business University, Yantai 264005, China

2. Shandong Provincial Higher Education Institutions Future Health Intelligent Medical Industry Engineering Research Center, Yantai 264005, China

3. School of Computer and Artificial Intelligence, Ludong University, Yantai 264025, China

4. McGill Centre for Integrative Neuroscience, Montreal Neurological Institute, McGill University, Montreal, H3A 2B4, Canada

5. School of Software, Shandong University, Jinan 250100, China

通讯作者: 张帆,男,教授. orcid.org/0000-0002-0343-3499. E-mail:zhangfan@sdtbu.edu.cn

收稿日期: 2025-06-24  

基金资助: 国家自然科学基金联合基金资助项目(U24A20219);国家自然科学基金资助项目(62272281);泰山学者专项基金资助项目(tsqn202306274);山东省高等学校青创科技支持计划(2023KJ212).

Received: 2025-06-24  

Fund supported: 国家自然科学基金联合基金资助项目(U24A20219);国家自然科学基金资助项目(62272281);泰山学者专项基金资助项目(tsqn202306274);山东省高等学校青创科技支持计划(2023KJ212).

作者简介 About authors

王美佳(2002—),女,硕士生,从事时间序列预测研究.orcid.org/0009-0009-4029-3809.E-mail:2024410048@sdtbu.edu.cn , E-mail:2024410048@sdtbu.edu.cn

摘要

针对长期时间序列预测中多尺度动态捕捉不足与非线性建模能力有限的问题,提出名为Patchflow的双流架构. 设计多尺度分割策略,将长期时间序列划分为不同粒度的局部片段,精准同步建模局部与全局时序动态,提升对多频率特征的自适应能力. 引入切比雪夫多项式构建的近似卷积算子,从几何视角刻画片段间相关性,有效增强非平稳序列的建模精度. 在趋势建模的基础上,引入结构化先验以提取复杂时序依赖. 实验结果表明,相较同类方法,Patchflow在多个公开数据集上的预测精度均显著提升,在强季节性与长期趋势性序列上的表现尤为突出.

关键词: 时间序列预测 ; 双流结构 ; 多尺度分割 ; 非平稳序列 ; 切比雪夫多项式

Abstract

A dual-stream framework named Patchflow was proposed to address the limited ability to capture multi-scale dynamic and insufficient nonlinear modeling capability in long-term time series forecasting. A multi-scale segmentation strategy was employed to partition long-term time series into local segments of different granularities, enabling accurate simultaneous modeling of local and global temporal dynamics while enhancing adaptability to multi-frequency patterns. A Chebyshev polynomial-based approximate convolution operator was further introduced to capture inter-segment correlations from a geometric perspective, improving the modeling accuracy of non-stationary sequences. Based on the trend modeling branch, a structured prior was introduced to extract complex temporal dependencies. Experiments on multiple public datasets showed that Patchflow consistently outperformed state-of-the-art methods, with particularly notable improvements on sequences with strong seasonality and long-term trends.

Keywords: time series forecasting ; dual-stream architecture ; multi-scale segmentation ; non-stationary sequences ; Chebyshev polynomials

PDF (4292KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

王美佳, 张帆, 王桦, 张明丽, 张彩明. 面向长期时间序列预测的多尺度双流架构. 浙江大学学报(工学版)[J], 2026, 60(8): 1770-1781 doi:10.3785/j.issn.1008-973X.2026.08.016

WANG Meijia, ZHANG Fan, WANG Hua, ZHANG Mingli, ZHANG Caiming. Multi-scale dual-stream architecture for long-term time series forecasting. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(8): 1770-1781 doi:10.3785/j.issn.1008-973X.2026.08.016

时间序列预测广泛应用在能源、金融、交通、物流、云计算等各个领域,是时间序列分析的基础构建块[1-2]. 长期时间序列预测[3]旨在基于历史观测推断未来较长时域内的序列值,但复杂的多尺度动态与非平稳性使该任务的建模更具挑战.

为了解决时间序列中复杂的时间模式,越来越多的研究侧重于利用先验知识将时间序列分解为更简单的组件,通过对序列进行解构来识别潜在的模式与结构,为预测提供关键支撑. Autoformer[4]和FEDformer[5]通过平均池化实现趋势与季节性分解,DLinear[6]进一步引入多尺度季节趋势分解,通过多个卷积核大小来提取不同时间尺度上的趋势与季节变化. TimesNet[7]和SparseTSF[8]强调时间序列中周期性的重要性,将长序列划分为多个片段以捕捉周期内与周期间的依赖关系. 这些方法的分解手段不同,但核心都是通过将复杂序列划分为更简单、可解释的子结构来提升预测精度与可解释性.

本研究提出新颖的双流架构:Patchflow,集成卷积神经网络(CNN)[9]、多层感知机(MLP)、补丁划分机制[10]与指数形式的季节-趋势分解等方法,旨在充分发掘时间序列中的多尺度时空依赖,实现更稳健的长期预测能力. 1) Patchflow通过并行子网络建模不同粒度的依赖结构,实现高效的信息解耦与融合. 2)设计多尺度分割模块,将序列划分为不同大小的补丁并独立建模季节性行为,提升模型对多粒度特征的感知能力. 3)引入切比雪夫多项式[11]层,以非线性基函数逼近复杂结构,提升对非平稳序列的建模能力,并将该分支提取的季节性特征与线性趋势建模结合,以增强预测鲁棒性与泛化性.

1. 相关工作

1.1. 补丁应用于长期时间序列预测

长期时间序列预测在金融交易、气象监测、交通调度、电力负荷预测、能源管理[12]等实际任务中具有广泛应用前景. 随着深度学习尤其是Transformer架构的发展,基于深度学习的模型已成为解决长期时间序列预测任务的主流方法. 传统Transformer在长序列场景下计算复杂度过高,受Vision Transformer[13]模型启发,研究者引入补丁机制,将长序列划分为局部块以降低计算开销并增强局部建模能力. PatchTST[10]通过等长划分与共享线性投影提升模型的泛化与效率;Crossformer[14]进一步结合多尺度补丁与交叉注意力,实现跨周期序列的增强建模;TimesNet[7]将时间序列视作二维结构并结合频谱变换,以兼顾局部与全局模式. 上述基于补丁的方法有效缓解了滑动窗口的冗余问题,成为时间序列建模的重要方向.

1.2. 时间序列预测中的多尺度建模

时间序列往往同时包含日、周及长期趋势等不同尺度特征,单一尺度难以充分刻画这些动态模式,多尺度建模是提升时间序列预测性能的核心方法. Conditional CNN[15]通过多尺度卷积并行提取局部特征;TimesNet[7]结合时域卷积与频谱建模以增强多周期表示;Time-Adaptive RNN[16]通过时间感知门控自适应建模不同时间粒度的依赖关系. 上述多尺度建模方法表明,多尺度结构能够显著提升模型对复杂波动的感知与泛化能力. 本研究提出的Patchflow融合多尺度补丁划分与双流建模机制以更好捕捉复杂时间依赖.

1.3. 切比雪夫多项式

切比雪夫多项式[16]是正交多项式,因其良好的数值稳定性和最小最大误差性质而广泛应用于函数逼近与信号处理. 与泰勒展开相比,切比雪夫多项式在全局逼近精度上更优,能够显著减轻高阶插值常见的振荡现象;与拉格朗日插值和勒让德多项式相比,切比雪夫多项式的节点分布在边界区域更加稳定,适合处理长时间跨度和强波动趋势的函数. 在深度学习领域,Defferrard等[17]提出的ChebNet,将切比雪夫多项式引入图神经网络,通过频谱图卷积实现高效的图信号处理,避免了传统图卷积对特征分解的依赖;ChebNetII[18]进一步完善ChebNet的网络结构,从频率响应的角度分析高阶项引发的振荡问题,通过限制谱域范围减少了 Runge现象,显著提升了图神经网络的表达能力与训练稳定性. 在时间序列建模方面,ChebyshevNet[19]将切比雪夫多项式显式用作非线性映射模块,用于拟合序列中潜在的非平稳趋势与多尺度变化. 本研究设计切比雪夫多项式层,并与双流结构结合,一方面保留线性路径以捕捉长期趋势,另一方面利用切比雪夫映射增强非线性分支对非平稳性和多频特征的适应能力,从而提升整体预测的稳健性与泛化性能.

2. 多尺度双流网络架构

2.1. 整体架构

多元时间序列预测任务的目标是根据给定的历史观测序列$ {\boldsymbol{X}}^{C\times L}=\left[\boldsymbol{x}_{1}^{C},\boldsymbol{x}_{2}^{C},\cdots ,\boldsymbol{x}_{L}^{C}\right] $,来预测未来时间步$ {\boldsymbol{\hat{X}}}^{C\times L}=\left[\boldsymbol{x}_{L+1}^{C},\boldsymbol{x}_{L+2}^{C},\cdots ,\boldsymbol{x}_{L+T}^{C}\right] $. 在时间步$ t $处的每个$ \boldsymbol{x}_{t}^{C} $代表时间序列变量有$ C $个变量. 基于补丁的方法的局部建模能力强且计算效率高,被广泛应用于长期时间序列预测[10,13]. 如图1所示为本研究提出的多尺度结合双流协同建模框架整体结构.

图 1

图 1   所提多尺度双流架构

Fig.1   Proposed multi-scale dual-stream architecture


2.2. 多尺度分割

为了简化标记,使用单变量时间序列进行描述,独立考虑每个变量,使Patchflow扩展到多变量情况. 定义$ N $个补丁大小的集合$ P_{\mathrm{P}}=\{{P}_{1},{P}_{2},\cdots ,{P}_{N}\} $,每个补丁大小$ P $对应一个补丁分割操作. 对于输入时间序列$ \boldsymbol{X}\in {\mathbf{R}}^{C\times L} $$ C $为时间序列的变量数,$ L $为时间序列的长度. 补丁分割操作的具体过程:

$ \begin{split}& {\boldsymbol{X}}=\text{Patching}\;(\text{Padding}\;({\boldsymbol{X}},S),P),\\& N=\left[\frac{L-P}{S}\right]+1.\end{split} $

$ \boldsymbol{X} $被分成$ N $个补丁,分别为$ ({\boldsymbol{X}}^{1},{\boldsymbol{X}}^{2},\cdots ,{\boldsymbol{X}}^{{{}^{N}}}) $,其中每个补丁$ {\boldsymbol{X}}^{i}\in {\mathbf{R}}^{C\times P} $包含$ P $个时间步;$ \mathrm{Padding}(\cdot ) $为序列边界填充运算,用于保证分块边界完整;$ \mathrm{Paching}(\cdot ) $为采用滑动窗口截取局部序列的补丁划分运算,S为时间步长. 每种补丁尺度对应一套完整的子网络进行独立建模,进而得到对应尺度的预测输出. 这样设计的优势:多种补丁尺度感知不同的时间分辨率信息,通过独立预测后加权融合,充分捕获多频率、多时间尺度下的依赖结构,有效缓解传统模型单一尺度建模下的频率混淆问题.

2.3. 双流预测模块

在补丁划分的基础上,Patchflow对每个尺度的输入进行时序分解,原始输入时间序列被有效地划分为2个互补的组成部分:季节性分量与趋势性分量. 该分解策略旨在简化时间序列的建模难度,使模型能够分别针对不同的动态特征进行建模与优化. 采用双流预测策略分别对季节性和趋势性部分进行独立建模与预测,充分保留各自的动态特征. 每个分量的预测结果将通过单独的全连接层进行非线性映射,输出相应的子预测序列. 所有尺度下的输出分量将被送入多尺度聚合器中进行集成. 这种分解-预测-聚合的结构不仅提升了模型的表达能力,还增强了对复杂时间序列中长期依赖的建模鲁棒性.

2.3.1. 季节性分量预测

针对季节性分量的高频周期特性,引入切比雪夫多项式层,增强对复杂模式的拟合能力. 如图2所示,输入时间序列$ {\boldsymbol{X}}_{{\mathrm{in}}}\in {\mathbf{R}}^{b\times c} $先进行双重归一化操作(b为切比雪夫线性层的批次大小,$ b=B\times L $$ c $为切比雪夫线性层的输入通道数,每个时间序列变量对应一个独立的输入通道):

图 2

图 2   切比雪夫多项式层

Fig.2   Chebyshev polynomial layer


$ \boldsymbol{x}=\tanh \;(\tanh \;({\boldsymbol{X}}_{{\mathrm{in}}})). $

接着,进行切比雪夫多项式计算:

$ {T}_{n}(\boldsymbol{x})=\cos \;(n\cdot \arccos \;(\boldsymbol{x})). $

将各阶切比雪夫多项式在输入上的取值与模型学习得到的切比雪夫系数进行加权求和,实现对时间序列局部结构的非线性建模与特征融合:

$ {{\boldsymbol{y}}}_{j}=\sum \limits_{i=0}^{{D}_{x}}\sum \limits_{k=0}^{d}{{\boldsymbol{w}}}_{i,j,k}\cdot {T}_{k}({{\boldsymbol{x}}}_{i});\;\; j=1,\cdots ,{D}_{y}. $

式中:$ {{\boldsymbol{w}}}_{i,j,k}\in {\mathbf{R}}^{{{D}_{x}}\times {{D}_{y}}\times (d+1)} $为可学习系数,$ {D}_{x} $为切比雪夫线性层的输入特征维度,$ {D}_{y} $为该层的输出特征维度,$ d $为切比雪夫多项式的最高阶数. 结果输出得到$ \boldsymbol{Y}\in {\mathbf{R}}^{b\times {{D}_{y}}} $. 通过上述切比雪夫多项式展开与加权融合过程,输入特征在保留原始时序信息的基础上,被映射至更具表达能力的非线性特征空间,为后续的预测任务提供更强的建模基础与表示能力.

经过非线性增强的特征被送入局部-全局卷积模块,进一步挖掘序列的局部动态模式. 如图3所示,局部卷积子模块集成双分支预测机制,从不同视角建模时间序列的细粒度变化与趋势信息. 经过分割后的序列$ {\boldsymbol{X}}_{p} $进行嵌入操作:

图 3

图 3   局部-全局卷积模块

Fig.3   Local-global convolution module


$ {\boldsymbol{x}}_{{\mathrm{emb}}}=\mathrm{Embedding}\;({\boldsymbol{X}}_{p}). $

式中:$ {\boldsymbol{X}}_{p}\in {\mathbf{R}}^{C\times N\times P} $$ {\boldsymbol{x}}_{{\mathrm{emb}}}\in {\mathbf{R}}^{C\times N\times D} $$ \mathrm{Embedding}\;(\cdot ) $为嵌入操作,$ D $为嵌入维度大小. 嵌入序列$ {\boldsymbol{x}}_{{\mathrm{emb}}}$通过多层感知机展平头部实现一次粗略的趋势预测,输出为$ {\boldsymbol{s}}_{1}\in {\mathbf{R}}^{C\times T} $,维度对应预测步长$ T $. 与此同时,序列$ {\boldsymbol{x}}_{{\mathrm{emb}}} $将输入由深度可分离卷积与多层感知机展平头部组成的模块中,进一步提取局部动态特征并生成更具细节的预测结果$ {\boldsymbol{s}}_{2}\in {\mathbf{R}}^{C\times T} $. 深度可分离卷积由2个关键步骤构成:深度卷积对每个通道独立执行空间卷积,用于捕捉通道内的时序特征;逐点卷积通过 $ 1\times 1 $卷积操作实现跨通道的信息整合. 此种卷积设计在保留建模能力的同时,能够显著降低参数量与计算开销,具体实现公式为

$ \begin{split}& {\boldsymbol{x}}_{1}=\text{BN}\;(\sigma \;(\mathrm{Depthwise}\;({\boldsymbol{x}}_{0}),\;k=K)),\\& {\boldsymbol{x}}_{2}={\boldsymbol{x}}_{1}+{\boldsymbol{x}}_{0},\\& {\boldsymbol{x}}_{3}=\text{BN}\;(\sigma \;(\text{Pointwise}\;({\boldsymbol{x}}_{2}),k=1)).\end{split} $

式中:$ \mathrm{Depthwise}\;(\cdot ) $为深度卷积操作,$ \text{Pointwise}\;(\cdot ) $为逐点卷积操作,$ \text{BN(}\cdot ) $为批归一化操作,$ k $为卷积核,K为深度卷积核尺寸,$ {\boldsymbol{x}}_{0}\in {\mathbf{R}}^{C\times N\times D} $为输入时间序列. $ {\boldsymbol{x}}_{1}\in {\mathbf{R}}^{C\times N\times D} $为深度卷积的输出,与原始输入$ {\boldsymbol{x}}_{0} $构建残差连接,得到残差增强表示$ {\boldsymbol{x}}_{2}\in {\mathbf{R}}^{C\times N\times D} $. $ {\boldsymbol{x}}_{2} $接着作为逐点卷积的输入,通过$ 1\times 1 $卷积实现跨通道信息融合,最终生成输出特征$ {\boldsymbol{x}}_{3} $. 为了提升非线性表达能力与训练稳定性,在卷积模块中引入GELU激活函数$ \sigma $与批量归一化BN. 为了确保特征长度一致性,设置$ K=8 $. 经过深度可分离卷积模块的处理后,将特征$ {\boldsymbol{x}}_{3} $输入多层感知机展平头部模块,生成更具局部细节的预测结果$ {\boldsymbol{s}}_{2}\in {\mathbf{R}}^{C\times T} $. s2$ {\boldsymbol{s}}_{1} $加和,得到季节性分量的预测输出$ \boldsymbol{s}\in {\mathbf{R}}^{C\times T} $,计算式为

$ \boldsymbol{s}={\boldsymbol{s}}_{1}+{\boldsymbol{s}}_{2}. $

2.3.2. 趋势性分量预测

趋势性分量建模采用轻量的多层感知器网络,结合层归一化、平均池化机制,从长期视角捕获时间序列的平稳演变趋势. 该部分与季节流协同运作,整体构成双流预测架构. $ \hat{\boldsymbol{T}}\in {\mathbf{R}}^{B\times C\times T} $为趋势性预测模块的输出,表达式为

$ \hat{\boldsymbol{T}}=\mathrm{FC}\;(\text{FAN}\;(\text{FAN}\;({\boldsymbol{X}}_{{\mathrm{tre}}}))). $

式中:$ {\boldsymbol{X}}_{{\mathrm{tre}}}\in {\mathbf{R}}^{B\times C\times L} $为趋势分支的输入序列;$ \text{FAN(}\cdot ) $为级联特征提纯与平滑算子,其内部依次执行线性全连接映射、平均池化下采样与层归一化操作,用于滤除输入序列中的高频局部扰动;$ \mathrm{FC}\;(\cdot ) $为全连接输出映射算子,用于将平滑后的特征对齐至目标预测维度.

2.4. 多尺度聚合

为了更好地建模时间序列中的多尺度依赖特征,将输入时间序列依据不同的补丁大小进行划分,形成多组不同时间分辨率的子序列. 每一组补丁分别通过独立的双流预测模块进行处理,获得多个预测结果,这些结果经过多尺度聚合器整合为模型的最终输出. 具体而言,对于每个补丁尺度$ {p}_{i} $,模型通过双流结构得到对应的输出$ {\hat{\boldsymbol{y}}}_{i} $. 所有尺度的预测输出直接进行逐元素求和操作:

$ {\hat{\boldsymbol{y}}}_{{\mathrm{sum}}}=\sum \limits_{i=1}^{N}{\hat{\boldsymbol{y}}}_{i}. $

式中:$ N $为补丁大小的种类. Patchflow引入可学习的缩放因子$ \omega \in \mathbf{R} $,用于统一调整聚合结果的整体幅度,以适配不同任务对预测尺度的敏感度. ω经端到端训练自适应更新,对不同尺度的特征分量进行动态加权,以校准多尺度融合过程中的幅度差异. 最终模型输出为

$ \hat{\boldsymbol{y}}=\omega \cdot {\hat{\boldsymbol{y}}}_{{\mathrm{sum}}}. $

式中:$ \hat{\boldsymbol{y}}\in {\mathbf{R}}^{B\times T \times C} $$ B $为批量大小. 多尺度加权融合策略充分利用各尺度的建模优势,能够显著提升模型对多频动态变化的感知能力与整体预测精度.

3. 实验分析与讨论

3.1. 时间序列预测实验

3.1.1. 数据集

在9个真实的数据集上进行实验,各个数据集的统计数据如表1所示,其中f为采样频率.

表 1   用于基准测试的公开数据集统计数据

Tab.1  Statistical data of public datasets for benchmarking

数据集种类Cf
ETTh1,ETTh2变压器温度71 h
ETTm1,ETTm2变压器温度715 min
Weather气象观测2110 min
Traffic道路占用率8621 h
Electricity用电负荷3211 d
Exchange全球8国汇率波动81 d
ILI流感样病例就诊比例77 d

新窗口打开| 下载CSV


3.1.2. 基线和指标

选择先进模型充当基线,包括xPatch[20]、SimpleTM[21]、Pathformer[1]、TimeMixer[22]、PatchTST[10]、TimesNet[7]、MICN[23]和DLinear[6]. 为了确保公平,所有模型都遵循相同的输入长度$ L $和预测长度$ T $(ILI数据集$ L=36 $$ T\in \{24,36,48,60\} $;其他数据集$ L=96 $$ T\in \{96,192,336,720\} $).

在时间序列预测任务中,为了全面评估模型性能,选用2个常用的回归评估指标:平均绝对误差MAE与均方误差MSE. MAE衡量预测值与真实值之间的平均绝对偏差,能够反映模型在整体上的预测稳定性与一致性;MSE对较大误差具有更强的惩罚效应,适用于评估模型对极端预测误差的敏感性和控制能力;这2种评估指标的数值越小,表示模型的预测越准确. 设预测值序列$ \hat{\boldsymbol{y}}= [{\hat{y}}_{1},{\hat{y}}_{2},\cdots ,{\hat{y}}_{T}] $,真实值序列$ \boldsymbol{y}=[{y}_{1},{y}_{2},\cdots ,{y}_{T}] $$ T $为预测长度,则

$ \begin{split}& {\mathrm{MAE}}=\frac{1}{T}\sum \limits_{i=1}^{T}\left| {\hat{y}}_{i}-{y}_{i}\right| ,\\& {\mathrm{MSE}}=\frac{1}{T}\sum \limits_{i=1}^{T}{\left({\hat{y}}_{i}-{y}_{i}\right)}^{2}.\end{split} $

3.1.3. 主要实验结果

为了清晰呈现对比细节并直观突出核心性能,将各模型在多个标准多元时间序列数据集上的长期预测结果按评价指标进行拆分,MSE与MAE的详细对比分别如表2表3所示,最优结果加粗表示,次优结果用下划线标出.整体来看,Patchflow在这2张表中,有12次取得最优结果. 与当前主流方法的具体对比结果如下:与xPatch相比,Patchflow在ETT系列数据集上的平均MSE降低了2.16%,在Exchange数据集上的平均MSE降低了8.27%;相较于SimpleTM, Patchflow评估指标呈现一致或数值更低;与Pathformer相比,Patchflow在除Electricity外的所有数据集上,评估指标数值均有所下降.

表 2   不同模型在多个标准多元时间序列数据集上的长期预测结果(MSE)

Tab.2  Long-term forecasting results of different models on multiple standard multivariate time series datasets (MSE)

数据集MSE
PatchflowxPatchSimpleTMFilterTSPathformerTimeMixerPatchTSTTimesNetMICNDLinear
ETTh10.4200.4280.4230.4340.4390.4470.4460.4580.4400.456
ETTh20.3110.3190.3540.3760.3440.3650.3760.4140.4080.559
ETTm10.3690.3770.3810.3850.3820.3810.3910.4000.4060.403
ETTm20.2610.2670.2750.2770.2730.2750.2820.2910.2900.350
Weather0.2360.2320.2430.2450.2390.2400.2560.2590.2740.265
Traffic0.5000.5000.4440.4700.5010.4850.5150.6200.5850.625
Electricity0.1830.1790.1860.1810.1820.1820.2030.1930.2090.212
Exchange0.3440.3750.4240.3500.4010.4080.3690.4160.5890.354
ILI1.4321.4424.9152.4251.5631.7082.1102.1842.6532.616

新窗口打开| 下载CSV


表 3   不同模型在多个标准多元时间序列数据集上的长期预测结果(MAE)

Tab.3  Long-term forecasting results of different models on multiple standard multivariate time series datasets (MAE)

数据集MAE
PatchflowxPatchSimpleTMFilterTSPathformerTimeMixerPatchTSTTimesNetMICNDLinear
ETTh10.4130.4190.4280.4300.4300.4400.4410.4500.4620.452
ETTh20.3590.3610.3910.3980.3790.3950.4010.4270.4400.515
ETTm10.3790.3840.3960.3960.3860.3960.4030.4060.4320.407
ETTm20.3100.3130.3220.3220.3160.3230.3250.3330.3430.401
Weather0.2600.2610.2720.2740.2630.2970.2800.2870.3250.317
Traffic0.3100.2790.2880.3150.2990.2980.3320.3360.3500.383
Electricity0.2740.2640.2870.2720.2690.2730.2900.2950.3190.300
Exchange0.3970.4090.4340.3970.4190.4220.4060.4430.5410.414
ILI0.7300.7251.5401.0200.7530.8200.9170.9311.0731.090

新窗口打开| 下载CSV


3.2. 消融实验

为了确定Patchflow中不同模块的影响,在保证其他参数相同的情况下,进行聚焦多尺度分割和切比雪夫多项式模块的消融实验,结果如表4所示. 表4中,$ L=96 $;最佳性能加粗表示,次佳性能用下划线标出. 实验统一采用补丁尺度$ P=16 $,在其他参数保持一致的前提下,将多尺度结构替换为单尺度划分.可以看出,去除多尺度聚合模块后,模型在各个预测长度下的MSE和MAE均出现显著上升. 整体性的性能回退表明,单一尺度输入无法充分表征时序数据,多尺度分割机制在提取时间序列多粒度特征方面具有不可忽视的量化贡献. 移除切比雪夫多项式模块同样导致预测精度的明显劣化,且在长预测视界下误差累积更为突出. 这从实验层面直接证实了该处理模块的必要性,表明引入切比雪夫多项式结构确实能有效提升模型对长序列全局演变趋势的拟合准确度. 2组消融结果共同佐证了核心组件协同建模在控制长期预测误差方面的实际效用.

表 4   所提多尺度双流架构的模块消融实验结果

Tab.4  Module ablation results of proposed multi-scale dual-stream architecture

数据集TPatchflow去除多尺度聚合去除切比雪夫层
MSEMAEMSEMAEMSEMAE
ETTh1960.3700.3870.3730.3890.3710.388
1920.4170.4010.4330.4130.4170.405
3360.4380.4170.4530.4290.4670.435
7200.4540.4460.4950.4730.4860.462
ETTm1960.2990.3390.3110.3510.3090.342
1920.3410.3630.3540.3690.3550.369
3360.3810.3890.3920.3910.3900.393
7200.4540.4240.4640.4280.4570.429
ETTm2960.1620.2450.1660.2510.1640.248
1920.2270.2870.2310.2910.2300.290
3360.2830.3250.2910.3300.2920.331
7200.3710.3810.3800.3840.3810.383
Weather960.1520.1910.1570.1990.1680.203
1920.2010.2370.2060.2410.2130.245
3360.2560.2800.2640.2850.2670.286
7200.3380.3330.3450.3400.3440.339

新窗口打开| 下载CSV


3.3. 强插件分析

强插件实验是验证方法组件必要性或优越性的实验设计策略. 为了进一步验证切比雪夫多项式模块的通用性,将其作为插件组件添加至现有的强基线模型xPatch中,并分别在ETTh2、ETTm2和Weather数据集上进行实验,结果如表5所示. 观察实验结果可以得知:引入切比雪夫多项式模块导致预测误差普遍降低,验证了它在降低预测精度上的有效性. 这也说明该模块不仅适用于Patchflow,也具备良好的通用性,可用于增强其他现有架构的建模能力.

表 5   在强基线模型中引入切比雪夫多项式层的实验结果

Tab.5  Experimental results of introducing Chebyshev polynomial layer into strong baseline

数据集TxPatchxPatch*
MSEMAEMSEMAE
ETTh2960.2330.3000.2270.298
1920.2910.3380.2850.335
3360.3440.3770.3430.376
7200.4070.4270.4180.436
ETTm2960.1660.2480.1650.247
1920.2300.2910.2280.290
3360.2920.3310.2900.330
7200.3810.3830.3780.382
Weather960.1680.2030.1580.197
1920.2140.2450.2050.240
3360.2360.2730.2330.272
7200.3090.3210.3060.321

新窗口打开| 下载CSV


3.4. 切比雪夫多项式层的性能分析
3.4.1. 拟合能力分析

为了进一步验证切比雪夫多项式层在简化复杂信号与信号平滑方面的能力,构建示例函数拟合任务作为测试,如图4所示. 该函数由线性趋势项与周期性正弦项叠加而成,同时叠加微弱的高斯噪声,可有效模拟实际时间序列中常见的多尺度变化模式,表达形式为

图 4

图 4   多层感知机和切比雪夫多项式层的拟合效果比较

Fig.4   Comparison of fitting effects for multi-layer perceptrons and Chebyshev polynomial layers


$ y(t)=0.5t+\sin \left(\frac{2{\text{π}} t}{12}\right)+\varepsilon ,\;\; \varepsilon \sim \mathrm{N }(0,{0.05}^{2}). $

为了提升拟合的稳定性,切比雪夫多项式层的输入特征经过区间$ [-1,1] $归一化处理,使用18阶多项式展开,所有模型均训练1 000步,使用MSE作为优化目标. 图4展示了切比雪夫多项式层与多层感知机的对比拟合曲线. 结果表明,切比雪夫层在训练初期收敛较慢,且最终误差略高于多层感知机,原因可能在于其未显式引入非线性激活函数,仅依赖多项式基展开进行表达. 当输入归一化不足或阶数受限时,该层易出现表达力不足与训练不稳定;同时,其系数优化过程对参数初始化、学习率与正则化较为敏感. 这一现象表明,切比雪夫多项式层虽具备较强的信号平滑能力,但更适合用于趋势建模或低频成分提取,难以直接替代含多层激活函数的深度多层感知机. 未来可通过引入正交基正则、改进训练策略或优化参数初始化等方式,以进一步释放切比雪夫多项式层的理论潜力.

3.4.2. 特征可视化分析

为了更直观地评估切比雪夫多项式层的效果,在上述示例函数拟合实验的基础上,对输入信号在进入切比雪夫层前后的特征分布进行可视化对比. 选取ETTh1数据集为例,$ L=96 $$ T=192 $,将切比雪夫层输入序列与输出序列绘制在同一坐标系中进行对照分析,如图5所示. 其中λ为对应数据集归一化后的特征值,t为时间步. 可视化结果表明,经过切比雪夫层处理后,信号的高频噪声成分显著削弱,整体曲线更加平滑,同时保留了主要的低频趋势信息. 这一特征与切比雪夫多项式层的低通滤波特性高度一致,验证了其在噪声抑制与趋势提取任务中的有效性. 该实验不仅提供了理论与实验结果的一致性证据,也为切比雪夫多项式层在多尺度时间序列建模中的应用潜力提供了可视化支撑.

图 5

图 5   切比雪夫多项式层输入与输出特征对比图

Fig.5   Comparison of input and output features for Chebyshev polynomial layer


3.5. 参数敏感性分析

参数敏感性分析是通过系统性地调整模型参数,观察性能指标变化,从而评估某个参数对模型性能的影响以及参数之间的交互作用.

3.5.1. 卷积核参数敏感性分析

选取ETT 数据集,分析深度可分离卷积中的卷积核(k=2,4,6,8,10)对模型预测精度的影响. 在不同预测长度下的MSE和MAE变化被可视化为雷达图形式,如图6所示. 通过观察可知,中等尺度的卷积核通常能取得更佳的预测效果,原因在于它能在平衡局部精细特征与全局趋势信息提取方面提供良好的折中.

图 6

图 6   ETT数据集上卷积核的参数敏感性分析

Fig.6   Parameter sensitivity analysis of convolutional kernels on ETT dataset


3.5.2. 嵌入维度参数敏感性分析

选取Weather数据集,对嵌入维度进行敏感性分析(D=32、64、128、256、512),以折线图方式展现其与预测精度之间的关系,如图7所示. 实验结果表明,随着嵌入维度的增加,模型的性能逐渐提升,但在超过某一阈值后提升幅度趋于平缓甚至下降,表明过大的模型容量可能引发过拟合问题,须结合数据复杂度谨慎选择.

图 7

图 7   Weather数据集上嵌入维度的参数敏感性分析

Fig.7   Parameter sensitivity analysis of embedded dimensions on Weather dataset


3.6. 模型复杂度分析

为了验证Patchflow在实时预测场景下的实用性,在ETTh1、ETTm1和Electricity数据集上将其与多种近期长序列预测方法的计算开销FLOPs、模型规模Par和单样本推理时间I进行对比,结果如表6所示,最小值加粗表示. 在ETTm1数据集中,Patchflow的计算复杂度高于xPatch、SimpleTM、iTransformer、Pathformer和TimeMixer,但显著低于PatchTST;在ETTh1数据集上表现类似,继续保持对Pathformer和TimeMixer的时延优势;在更大规模的Electricity数据集上,Patchflow相较于其他方法仍具较高负担,仍优于PatchTST. 综合来看,Patchflow在中小规模数据集上能以较高计算代价换取显著精度提升,在大规模场景中能保持良好的推理效率,兼顾预测精度与扩展性;对于实时性要求极高的边缘部署,更适合采用如SimpleTM或iTransformer的轻量模型.

表 6   模型复杂度分析

Tab.6  Model complexity analysis

数据集模型FLOPs/106Par/106I/ms
ETTh1Patchflow123.4718.458.28
xPatch10.421.374.66
SimpleTM0.750.055.61
iTransformer23.802.172.54
Pathformer12.060.54205.41
TimeMixer16.540.129.20
PatchTST1934.6413.5667.24
ETTm1Patchflow123.4218.448.67
xPatch10.421.375.88
SimpleTM0.220.023.87
iTransformer2.800.262.44
Pathformer30.090.87247.52
TimeMixer16.540.128.72
PatchTST140.662.2118.29
ElectricityPatchflow4438.4015.69320.21
xPatch477.921.37221.20
SimpleTM542.810.9060.52
iTransformer1609.864.9693.01
Pathformer3792.404.319893.60
TimeMixer971.680.151410.86
PatchTST5939.852.21615.75

新窗口打开| 下载CSV


3.7. 模型轻量化与模型剪枝实验

为了增强Patchflow在资源受限环境中的部署适应性,设计并评估2种轻量化策略:1)降维版本的Patchflow-Lite和2)基于结构化与非结构化剪枝的模型稀疏化方案. Patchflow-Lite在保留主干架构优势的同时,通过将嵌入维度由 128、256降至64,压缩隐藏表示空间,显著降低了模型复杂度;模型剪枝直接在训练完成的Patchflow模型上裁剪部分权重连接,以进一步减小规模与加速推理.

3.7.1. 模型轻量化

在ETTh1、ETTm1和Electricity数据集上进行对比实验,设置$ L=96 $$ T=336 $. 考察模型在计算开销、推理时间及预测精度方面的表现,结果如表7所示. 从结果可见,Patchflow-Lite在保持预测精度基本不变的前提下,显著降低了模型复杂度与推理延迟,在时间效率与预测精度之间实现了良好的平衡.

表 7   轻量化模型的性能评估

Tab.7  Performance evaluation of lightweight models

数据集模型FLOPs/106I/msMSEMAE
ETTh1Patchflow113.289.160.4380.417
Patchflow_Lite46.636.480.4390.421
ETTm1Patchflow113.289.580.3810.389
Patchflow_Lite46.636.570.3870.389
ElectricityPatchflow5194.54819.100.1820.275
Patchflow_Lite2138.46140.550.1870.281

新窗口打开| 下载CSV


3.7.2. 模型剪枝实验

选择ETTh1和Electricity数据集评估结构化与非结构化剪枝的性能表现. 剪枝率设置为30%,$ L=96 $$ T=96 $,结果如表8所示. 观察可知,通过结构化剪枝虽实现了权重稀疏化,但在各数据集上均引入明显精度下降,且推理延迟反而增加. 通过分析可知,主要原因在于当前实现中FLOPs未随稀疏率下降而减少,相比之下,非结构化剪枝几乎不影响预测精度,但推理时间略有上升. 这表明,在现有硬件与框架支持有限的条件下,剪枝更适用于模型存储压缩与部署带宽优化,而非直接加速推理计算.

表 8   模型剪枝实验结果

Tab.8  Model pruning experiment results

数据集剪枝类型FLOPs/106I/msMSEMAE
ETTh1无剪枝315.240.3720.388
结构化剪枝316.970.4990.468
非结构化剪枝316.700.3720.388
Electricity无剪枝774.615.660.1540.249
结构化剪枝774.617.030.3410.433
非结构化剪枝774.617.140.1550.250

新窗口打开| 下载CSV


综上所述,Patchflow-Lite在兼顾效率与精度方面表现出强鲁棒性,证明了该轻量化设计的有效性. 模型剪枝在压缩与加速方面的收益依赖于稀疏计算优化与硬件支持,后续可结合稀疏注意力、动态路由机制进一步提升部署性能.

3.8. 鲁棒性测试实验

为了全面评估 Patchflow 在实际应用中应对噪声干扰与异常值扰动的能力,设计系统性的鲁棒性测试实验,涵盖不同类型与强度的干扰条件,并与多种基线模型进行对比分析.

3.8.1. 缺失值填补实验

为了进一步验证模型在统一预测任务之外的泛化能力,特别是在面对真实世界中常见的缺失数据问题时的鲁棒性,引入时间序列插值任务作为扩展实验. 现实中,许多传感系统会由于传输故障或设备异常导致数据不完整,影响下游分析任务的准确性. 为了模拟这一场景,在3个典型的时间序列数据集上进行插值实验,包括ETTh1、ETTm1以及Weather. 这些数据集覆盖电力调度与气象监测等真实应用场景,且具有周期性强、趋势变化明显等特点,适合评估模型的重建能力. 实验结果如表9所示,最佳结果加粗标注. 具体而言,对原始输入序列按比例随机遮蔽,遮蔽比例为{12.5%、25%、37.5%、50%},要求模型在给定部分可观测输入的条件下预测缺失值,最终输出完整序列. 观察结果可知,通过在模型中引入遮蔽机制以模拟部分可观测的时间序列预测场景,并针对前向传播和损失函数进行定制化设计,其在输入缺失情况下仍能有效学习,体现其良好的实用潜力.

表 9   不同模型的时间序列插值性能对比

Tab.9  Comparison of time series interpolation performance across different models

模型ETTh1ETTm1Weather
MSEMAEMSEMAEMSEMAE
Patchflow0.1060.2280.0540.1610.0380.089
xPatch0.1630.2830.0710.1850.0500.115
SimpleTM0.2150.3530.1110.2300.0620.128

新窗口打开| 下载CSV


3.8.2. 异常扰动鲁棒性测试实验

为了更全面的评估Patchflow在不同干扰条件下的预测性能,进一步对输入时间序列施加多种类型的扰动. 具体扰动类型包括高斯噪声(方差分别为0.01、0.05和0.10)、随机正负尖峰(分别占总长度的0.5%和1.0%),以及一定比例的脉冲替换(以序列最大值替换5%数据点). 每种扰动均对测试集样本施加后进行模型推断,并与未扰动输入的预测结果进行对比. 实验采用公开典型的时间序列数据集ETTh1,在$ L=96 $$ T=96 $条件下测试模型在扰动条件下的预测性能变化. 评估指标为MSE和MAE,以量化模型鲁棒性,实验结果如图8所示. 结果表明, Patchflow在高斯噪声及随机尖峰扰动下,MSE与 MAE与未扰动条件相比变化幅度较小,体现出对平稳噪声及少量异常点的良好鲁棒性. 在脉冲替换Imp5%条件下,2项评估指标均显著上升,显示模型对突发幅值异常较为敏感.

图 8

图 8   模型的异常扰动鲁棒性测试结果

Fig.8   Robustness test results of model under anomalous perturbation


综上,Patchflow能够在大多数常见噪声条件下保持稳定性能,但在应对极端突变型扰动方面仍有改进空间.

3.9. 全局缩放系数的行为分析

为了验证可学习权重参数的有效性,在4个基准数据集上可视化权重参数$ \omega $在训练过程中的变化轨迹. 设置$ L=96 $$ T=192 $ω初始值为1.0,表示不缩放,结果如图9所示. 在Electricity数据集上,权重从初始值1.0快速下降至约0.15并趋于稳定,表明该数据集的多尺度特征融合产生了显著的幅度放大效应,需要大幅度缩放校正. 相比之下,ETTh1和ETTm1数据集的权重始终维持在1.0附近,说明这些数据集具有良好的尺度一致性,多尺度融合结果无需额外调整. Weather数据集呈现温和的下降趋势,权重最终稳定在0.85,反映了轻微的幅度校正需求. 这种数据集特异性的权重学习行为充分验证了可学习权重设计的必要性和有效性. 该机制使模型能够自适应地调节不同数据集下多尺度特征融合的输出幅度,避免了固定权重可能导致的幅度失配问题, 提升了模型的泛化能力和预测精度.

图 9

图 9   全局缩放系数可视化

Fig.9   Global scaling factor visualization


3.10. 多尺度机制有效性分析

为了探究不同补丁尺度在时间序列预测中的作用,在ETTh1、ETTm1、Weather、Electricity数据集上分别设置单一尺度补丁(P=8、16、32)与多尺度融合方案,比较在相同预测长度下的预测性能,结果如图10所示. 从整体趋势看,单一尺度补丁的最佳选择因数据集而异:较小尺度的补丁能够更精细地刻画局部变化,对高频成分和短期波动的捕捉更敏感;较大尺度的补丁具有更长的时间覆盖范围,更适合建模低频趋势和长期依赖. 单一尺度在不同数据集上的表现差异总体较小,说明仅依赖单一尺度难以稳定适应多样化的时间序列模式. 相比之下,多尺度方案在所有数据集上均优于任一单尺度设定. 这表明:不同尺度补丁能够互补短期波动与长期趋势的建模能力,在多样化时间序列模式下具有更强的适应性.

图 10

图 10   补丁尺度与多尺度融合方案在不同数据集上的预测性能对比

Fig.10   Comparison of prediction performance between patch-scale and multi-scale fusion schemes across different datasets


3.11. 预测结果可视化对比

为了更直观地评估模型的多步预测性能,在多个数据集上绘制典型样本片段的真实值与预测值对比曲线.

图11所示为模型在Electricity和Weather 数据集上预测值与真实值的可视化对比. 设置$ L=96 $$ T=192 $. 可以看到,在Electricity数据集中,Patchflow能够精准拟合具有强烈周期性的整体趋势,并在波峰与波谷位置高度匹配. 在具有更高波动性的Weather数据集中,相比基线模型xPatch表现出的显著幅度衰减与远端相位偏移,Patchflow的预测曲线展现出趋势与细节的双重匹配能力,有效捕捉了局部的随机波动.

图 11

图 11   在Electricity和Weather数据集上2种模型的预测值与真实值对比

Fig.11   Comparison of predictions and ground truth for two models on Electricity and Weather datasets


图12所示为模型在ETTh1和ETTm1数据集上预测值与真实值的可视化对比. 设置$ L=96 $$ T=192 $. 观察Patchflow,模型在序列的高波动区间以及趋势转折区间(如ETTh1中的陡降与回升部分)也能有效响应. 相比基线模型xPatch, Patchflow在多种时间序列模式下拟合稳定性更好,在幅度和趋势一致性上更接近真实序列.

图 12

图 12   在ETTh1和ETTm1数据集上2种模型的预测值与真实值的对比

Fig.12   Comparison of predictions and ground truth for two models on ETTh1 and ETTm1 datasets


Patchflow之所以能有效响应复杂波动,得益于多尺度补丁机制与双流网络架构的协同设计,使模型不仅在平稳区间保持稳定拟合,也能在远端预测和趋势突变中表现出更强的泛化能力.

4. 结 语

本研究提出名为Patchflow的双流结构时间序列预测框架,结合多尺度时间分割与切比雪夫多项式建模策略,针对长期依赖建模与复杂周期问题进行优化. 在多个标准长期预测数据集上的实验表明,Patchflow在准确性和泛化性方面均优于现有主流基线模型. 未来工作考虑将切比雪夫模块作为可插拔组件应用于如分类、异常检测的时间序列分析任务中,进一步提升Patchflow的通用性与实用价值.

参考文献

CHEN P, ZHANG Y, CHENG Y, et al. Pathformer: multi-scale transformers with adaptive pathways for time series forecasting [EB/OL]. (2024–09–15)[2025–08–24]. https://arxiv.org/pdf/2402.05956.

[本文引用: 2]

CIRSTEA R G, YANG B, GUO C, et al. Towards spatio- temporal aware traffic time series forecasting [C]// Proceedings of the IEEE 38th International Conference on Data Engineering. Kuala Lumpur: IEEE, 2022: 2900–2913.

[本文引用: 1]

LI Z, QI S, LI Y, et al. Revisiting long-term time series forecasting: an investigation on linear mapping [EB/OL]. (2023–05–18)[2025–08–24]. https://arxiv.org/pdf/2305.10721.

[本文引用: 1]

WU H, XU J, WANG J, et al. Autoformer: decomposition transformers with auto-correlation for long-term series forecasting [C]// Proceedings of the Neural Information Processing Systems. [S.l.]: Curran Associates Inc. , 2021: 22419–22430.

[本文引用: 1]

ZHOU T, MA Z, WEN Q, et al. FEDformer: frequency enhanced decomposed transformer for long-term series forecasting [C]// Proceedings of the International Conference on Machine Learning. [S.l.]: PMLR, 2022: 27268–27286.

[本文引用: 1]

ZENG A, CHEN M, ZHANG L, et al

Are transformers effective for time series forecasting?

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2023, 37 (9): 11121- 11128

[本文引用: 2]

WU H, HU T, LIU Y, et al. TimesNet: temporal 2D-variation modeling for general time series analysis [EB/OL]. (2023–04–12)[2025–08–24]. https://arxiv.org/pdf/2210.02186.

[本文引用: 4]

LIN S, LIN W, WU W, et al. SparseTSF: modeling long-term time series forecasting with 1k parameters [EB/OL]. (2024–06–03)[2025–08–24]. https://arxiv.org/pdf/2405.00946.

[本文引用: 1]

O’SHEA K, NASH R. An introduction to convolutional neural networks [EB/OL]. (2015–12–02)[2025–08–24]. https://arxiv.org/pdf/1511.08458.

[本文引用: 1]

NIE Y, NGUYEN N H, SINTHONG P, et al. A time series is worth 64 words: long-term forecasting with transformers [EB/OL]. (2023–03–05)[2025–08–24]. https://arxiv.org/pdf/2211.14730.

[本文引用: 4]

张帆, 王桦, 范辉, 等

基于边缘和距离约束的有理多项式图像放大

[J]. 中国科学: 信息科学, 2021, 51 (8): 1270- 1286

[本文引用: 1]

ZHANG Fan, WANG Hua, FAN Hui, et al

Rational polynomial image magnification based on edge and distance constraints

[J]. Scientia Sinica: Informationis, 2021, 51 (8): 1270- 1286

[本文引用: 1]

LIM B, ZOHREN S

Time-series forecasting with deep learning: a survey

[J]. Philosophical Transactions Series A, Mathematical, Physical, and Engineering Sciences, 2021, 379 (2194): 20200209

[本文引用: 1]

FAN H, XIONG B, MANGALAM K, et al. Multiscale vision transformers [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2022: 6804–6815.

[本文引用: 2]

ZHANG Y, YAN J. Crossformer: transformer utilizing cross-dimension dependency for multivariate time series forecasting [C]// Proceedings of the International Conference on Learning Representations. Kigali: [s.n.], 2023: 1–12.

[本文引用: 1]

BOROVYKH A, BOHTE S, OOSTERLEE C W. Conditional time series forecasting with convolutional neural networks [EB/OL]. (2018–09–17)[2025–08–24]. https://arxiv.org/pdf/1703.04691.

[本文引用: 1]

KAG A, SALIGRAMA V. Time adaptive recurrent neural network [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2021: 15144–15153.

[本文引用: 2]

DEFFERRARD M, BRESSON X, VANDERGHEYNST P. Convolutional neural networks on graphs with fast localized spectral filtering [C]// 30th Conference on Neural Information Processing Systems. Barcelona: [s.n.], 2016: 1–9.

[本文引用: 1]

HE M, WEI Z, WEN J R. Convolutional neural networks on graphs with Chebyshev approximation, revisited [EB/OL]. (2024–03–12)[2025–08–24]. https://arxiv.org/pdf/2202.03580.

[本文引用: 1]

DIAO J, CUI K, HUANG Y, et al

ChebyshevNet: a novel time series analysis model using Chebyshev polynomial

[J]. The Journal of Supercomputing, 2024, 81 (1): 179

DOI:10.1007/s11227-024-06672-y      [本文引用: 1]

STITSYUK A, CHOI J

xPatch: dual-stream time series forecasting with exponential seasonal-trend decomposition

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2025, 39 (19): 20601- 20609

DOI:10.1609/aaai.v39i19.34270      [本文引用: 1]

CHEN H, LUONG V, MUKHERJEE L, et al. SimpleTM: A Simple Baseline for Multivariate Time Series Forecasting [C]// Proceedings of the 13th International Conference on Learning Representations. Singapore: [s.n.], 2025: 1–26.

[本文引用: 1]

WANG S, WU H, SHI X, et al. TimeMixer: decomposable multiscale mixing for time series forecasting [EB/OL]. (2024–05–23)[2025–08–24]. https://arxiv.org/pdf/2405.14616.

[本文引用: 1]

WANG H, PENG J, HUANG F, et al. MICN: Multi-scale local and global context modeling for long-term series forecasting [C]// Proceedings of the 11th International Conference on Learning Representations. Kigali: [s.n.], 2023: 1–22.

[本文引用: 1]

/