浙江大学学报(工学版), 2026, 60(8): 1730-1738 doi: 10.3785/j.issn.1008-973X.2026.08.012

计算机技术

基于多尺度外观运动融合的视频异常检测

赵明华,, 吕雨萱, 吕佳豪,, 陈逸飞, 石程, 胡静

1. 西安理工大学 计算机科学与工程学院,陕西 西安 710048

2. 陕西省网络计算与安全技术重点实验室,陕西 西安 710048

Video anomaly detection based on multi-scale appearance and motion fusion

ZHAO Minghua,, LYU Yuxuan, LYU Jiahao,, CHEN Yifei, SHI Cheng, HU Jing

1. School of Computer Science and Engineering, Xi’an University of Technology, Xi’an 710048, China

2. Shaanxi Key Laboratory of Network Computing and Security Technology, Xi’an 710048, China

收稿日期: 2025-07-11  

基金资助: 陕西省自然科学基金资助项目(2024JC-ZDXM-35, 2024JC-YBMS-573, 2024JC-YBMS-458);陕西省科协青年人才托举计划资助项目(20240146);西安理工大学博士创新基金资助项目(BC202621).

Received: 2025-07-11  

Fund supported: 陕西省自然科学基金资助项目(2024JC-ZDXM-35,2024JC-YBMS-573,2024JC-YBMS-458);陕西省科协青年人才托举计划资助项目(20240146);西安理工大学博士创新基金资助项目(BC202621).

作者简介 About authors

赵明华(1979—),女,教授,从事计算机视觉与模式识别研究.orcid.org/0000-0001-8062-2982.E-mail:zhaominghua@xaut.edu.cn , E-mail:zhaominghua@xaut.edu.cn

摘要

现有的基于帧预测的视频异常检测方法仅关注外观特征而忽略运动信息,难以同时捕捉局部变化与全局异常,为此,提出基于多尺度外观运动融合的视频异常检测方法. 设计基于Inception模块的双流编码器,用于提取多尺度的外观特征与光流特征;将不同尺度外观和运动特征的融合特征输入动态原型单元模块,进行正常特征表征学习;在外观编码器和解码器之间的跳跃连接过程中添加基于CNN-Transformer的混合注意力机制,实现全局上下文信息与局部细节信息的融合,以提升检测性能. 在3个基准数据集UCSD Ped2、CUHK Avenue和ShanghaiTech上进行广泛实验和消融研究,AUC值分别达到了99.1%、88.5%和74.5%,充分验证了所提方法的有效性和优越性.

关键词: 视频异常检测 ; 卷积神经网络 ; 时序运动特征 ; 混合注意力机制 ; 无监督学习

Abstract

A new video anomaly detection method was proposed to address the issue that existing frame prediction-based video anomaly detection methods focus only on appearance features while ignoring motion information and are difficult to simultaneously capture local changes and global anomalies. A dual-stream encoder based on the Inception module was designed to extract multi-scale appearance and optical flow features. The fused features of appearance and motion features at different scales were input into a dynamic prototype unit module to learn the representations of normal features. A hybrid attention mechanism based on CNN-Transformer was added to the skip connection process between the appearance encoder and decoder to realize the integration of global contextual information and local detailed information, therefore enhancing the detection performance. Extensive experiments and ablation studies were conducted on three benchmark datasets: UCSD Ped2, CUHK Avenue, and ShanghaiTech. The AUC values of 99.1%, 88.5%, and 74.5% were achieved, respectively, demonstrating the effectiveness and superiority of the proposed method.

Keywords: video anomaly detection ; convolutional neural network ; temporal motion feature ; hybrid attention mechanism ; unsupervised learning

PDF (2340KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

赵明华, 吕雨萱, 吕佳豪, 陈逸飞, 石程, 胡静. 基于多尺度外观运动融合的视频异常检测. 浙江大学学报(工学版)[J], 2026, 60(8): 1730-1738 doi:10.3785/j.issn.1008-973X.2026.08.012

ZHAO Minghua, LYU Yuxuan, LYU Jiahao, CHEN Yifei, SHI Cheng, HU Jing. Video anomaly detection based on multi-scale appearance and motion fusion. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(8): 1730-1738 doi:10.3785/j.issn.1008-973X.2026.08.012

视频异常检测(video anomaly detection, VAD)作为智能视频监控系统的核心技术,目标是监测和定位监控视频中偏离预期的异常行为[1],在公共安全防护、交通管理等领域具有重要的应用价值[2]. 由于异常行为的发生频率较低,其视频样本获取难度较大且种类难以统计,难以对其建立统一的形式化定义[3]. 因此,现有的基于深度学习的异常行为检测方法大多采用基于重建[1,4-7]或基于预测[8-14]的无监督方法,即通过训练大量正常视频数据来构建正态性模型,以重建/预测帧与真实帧的偏差作为异常行为检测的判据.

当异常行为展现出与正常行为相似的空间特征及运动模式时,模型如果仅依赖空间特征进行学习,则很可能产生误判问题. 这会导致异常行为的预测误差值较小,进而造成模型对该异常行为的忽略. 当前大多数算法着重于分析空间内的局部特征,但是这些算法不完全适用于包含时间信息的视频序列处理[9,14-15]. 为了更准确地捕捉异常行为,模型应该不仅限于空间局部特征的学习,而应深入研究同一目标随时间演变的动态特征. 此外,在现有的基于双流网络的研究中,多数方法利用单一卷积核提取外观或运动特征,难以捕捉不同尺度的高级特征,导致其对不同行为特征间局部空间纹理及运动轨迹细节不够敏感,进而削弱了模型对细微异常模式的判别能力[16-17].

针对上述问题,提出基于多尺度外观运动融合的视频异常检测方法. 在编码阶段,首先使用基于Inception模块[18]的双流编码器对外观和运动图像进行特征提取. 随后,为了有效融合不同粒度的特征,将不同尺度的特征输入运动外观语义特征融合模块. 将融合特征送入动态原型单元(dynamic prototype unit, DPU)模块[19]中,生成原型动态池,并根据原型重建常态编码,从而扩大正常样本和异常样本之间的预测误差. 通过跳跃连接过程中的混合注意力机制,融合全局上下文信息与局部细节信息,以进一步增强模型对视频内容的分析能力. 最终在解码阶段,通过基于Inception模块的解码器预测未来帧,从而实现对异常行为的高性能检测.

1. 相关工作

无监督异常检测方法大致可以分为2类:基于重建的方法和基于预测的方法.

1.1. 基于重建的视频异常检测方法

基于重建的方法通过自编码器学习数据的正常分布模式,对下一帧内容进行重构. 由于异常行为与训练数据的分布存在差异,模型对异常帧的重构会产生显著误差. 测试时计算重构误差,并将其作为异常得分;当得分超过预设阈值时,判定为异常事件. Hasan等[5]提出基于卷积自编码器的视频异常检测方法,但是由于神经网络具有强大的泛化能力,有些异常行为可以被模型很好地重建,从而影响了异常检测的准确性. 为了应对过度泛化问题,Li等[20]提出超像素掩码修复(superpixel masking and inpainting, SMAI)方法,在重构时对输入图像的部分区域进行掩码覆盖后再将图像送入网络中进行复原. 许多研究借助生成对抗网络(generative adversarial network, GAN)[21],以提升对正常事件的重建效果. 为了解决GAN固有的训练波动缺陷,Zaheer等[22]利用同一生成器的当前状态和先前状态创建高质量和低质量的重建示例. 然而,这些基于重建的方法都只考虑到空间特征,忽略了视频帧之间的时序信息. 因此,当处理在时间上具有连续运动变化的正常和异常事件时,其重建能力均表现不佳.

1.2. 基于预测的视频异常检测方法

基于预测的方法根据输入的视频帧序列来预测下一时刻的视频帧,并通过比较预测帧与真实帧之间的差异来检测异常行为. Liu等[8]提出利用视频帧预测方法来进行异常检测. 为了更好地利用视频的上下文相关信息,Li等[16]基于GAN设计具有上下文学习能力的多分支预测模型,该模型不仅从当前帧预测下一帧,而且利用后续视频帧反向预测先前帧,从而提高视频异常检测的准确性. Lyu等[15]提出双向跳跃帧预测方法,通过2种域内差异注意力机制与不同的输入策略,实现了对复杂场景下异常行为的高效检测. 除了通常使用的强度约束和外观约束外,现有研究还关注运动约束. Lu等[12]提出基于变分自动编码[23]的新型顺序生成模型,利用ConvLSTM模块[24]进行未来帧预测,在未来帧预测任务中保留了时间信息. 为了充分利用运动模式,Chen等[25]提出双向预测框架,在前向传播和后向传播子网络中同步生成目标帧的双向预测结果,根据2个生成帧和目标帧之间的相似性度量结果,综合评估视频帧的异常程度. Sun等[26]提出基于骨架运动增强的分层语义对比学习方法,引入对象级与场景级的对比学习策略,提升了模型的泛化能力. Liu等[27]提出融合光流重建与帧预测的混合框架,基于前景目标聚焦的新思路,利用多级记忆模块学习正常运动模式,并引导异常光流来放大预测误差,从而实现对局部前景异常的精准检测. 尽管这些基于预测的方法能够有效学习视频的上下文信息,但是在正常特征的学习和运动变化特征的提取上表现较弱,缺乏对外观和运动特征更加有效的探索.

2. 研究方法

提出基于多尺度外观运动融合的视频异常检测方法,其框架如图1所示. 首先,在训练阶段,以正常视频片段作为输入,通过FlowNet2光流估计网络[28]提取对应的T−1幅光流图像,并将视频帧与光流分别输入外观编码器$ ({E_{\mathrm{a}}}) $与运动编码器$( {E_{\mathrm{m}}}) $网络中,以提取多尺度的外观与运动特征. 其次,将得到的2类特征送入运动外观语义特征融合(motion and appearance semantic feature fusion, MASFF)模块. 将融合特征送入DPU中,通过注意力生成、原型检索和编码聚合过程增强融合特征的表征,从而更有效地学习正常行为. 最后,在$ {E_{\mathrm{a}}} $和解码器$(D)$之间通过跳跃连接实现全局-局部混合自注意力(global-local mixed attention, GLmix)机制,融合全局上下文信息与局部细节信息,进而预测出下一时刻的未来帧.

图 1

图 1   基于多尺度外观运动融合的视频异常检测方法框架图

Fig.1   Framework diagram of video anomaly detection method based on multi-scale appearance and motion fusion


2.1. 双流网络架构

为了实现帧预测任务,提出基于改进U-Net的双编码单解码架构,并采用多尺度Inception模块构建编码器-解码器主干网络. 编码器${E_{{\mathrm{a}}}}$用于捕捉视频的空间特征,其输入为T个连续的视频帧${{\boldsymbol{I}}_{1:T}}$;编码器${E_{\mathrm{m}}}$用于捕捉视频时序特征,其输入是T−1个对应的光流${{\boldsymbol{F}}_{1:T - 1}}$;解码器$D$对融合特征进行上采样,通过跳跃连接将其与编码器中具有相同分辨率的特征融合,以实现对最终未来帧${\hat {\boldsymbol{I}}_{t+1}}$的预测. Inception模块通过并联方式将不同尺度的卷积层在深度维度上进行拼接;这种并行卷积设计可以扩展网络的深度,并提高编码器、解码器自动兼容不同尺度特征的能力.

2.2. 运动外观语义特征融合

为了有效结合多尺度的外观和运动特征,设计运动外观语义特征融合模块. 通过跨尺度特征聚合和外观语义融合,有效整合多层级时空信息,实现外观与运动信息的互补增强,从而为视频异常检测提供丰富的表示.

对于外观特征的聚合,通过最大池化操作Maxpool将${{\boldsymbol{F}}_1}$${{\boldsymbol{F}}_2}$特征降维到与${{\boldsymbol{F}}_3}$维度相同,并将3个相同尺寸的特征相加,得到${{\boldsymbol{F}}_{\rm{f}}}$. 运动特征${{\boldsymbol{O}}_{\rm{f}}}$的聚合过程同上. 计算过程表示为

$ {{{\boldsymbol{F}}_{\text{f}}} = {\rm{Maxpool}}\;({\rm{Maxpool}}\;({{\boldsymbol{F}}_1}))+{\rm{Maxpool}}\;({{\boldsymbol{F}}_2})+{{\boldsymbol{F}}_3},} $

$ {{{\boldsymbol{O}}_{\text{f}}} = {\rm{Maxpool}}\;({\rm{Maxpool}}\;({{\boldsymbol{O}}_1}))+{\rm{Maxpool}}\;({{\boldsymbol{O}}_2})+{{\boldsymbol{O}}_3}.} $

对聚合后的运动特征和外观特征沿通道维度进行拼接,再通过$3 \times 3$$1 \times 1$卷积进行特征提取,最终得到运动、外观融合的特征$ {{\boldsymbol{F}}_{{\text{fusion}}}} $,计算过程表示为

$ {{\boldsymbol{F}}_{{\text{fusion}}}} = {{\mathrm{Conv}}_{1\times1}}({{\mathrm{Conv}}_{3\times3}}({\mathrm{Cat}}({{\boldsymbol{F}}_{\text{f}}},{{\boldsymbol{O}}_{\rm{f}} }))). $

2.3. 全局-局部混合注意力

为了提高模型对输入数据的理解能力,捕获不同的纹理细节特征,并获取全局上下文信息,以实现准确、高效的异常检测,提出全局-局部混合注意力结构,如图2所示. 首先,对于输入特征${\boldsymbol{x}} \in {{\bf{R}}^{H \times W \times C}}$,分别通过3个独立的$1 \times 1$卷积进行特征提取,得到包含$3 \times N$个特征图的中间特征${{\boldsymbol{F}}_{\rm{mid}}^i}$

图 2

图 2   混合注意力机制(GLmix)结构图

Fig.2   Structural diagram of hybrid attention mechanism (GLmix)


$ {\boldsymbol{F}}_{\rm{mid}}^i = {\rm{Conv}_{1\times1}}({\boldsymbol{x}});\;\;{\text{ }}i = {\text{1, 2, 3}}{\text{.}} $

随后,将${{\boldsymbol{F}}_{\rm{mid}}^i}$分别输入CNN分支和Transformer分支,以捕获局部与全局特征. 在CNN分支中,首先通过轻量化全连接层生成${k^2}$个通道的特征图. 通过对特征图进行位置平移与特征聚合操作,在遵循传统卷积局部感受野特性的同时,以参数化方式实现对输入特征的处理,得到输出特征$ {{\boldsymbol{F}}_{{\text{conv}}}} $. 在Transformer分支中,键(key)和值(value)矩阵通过重塑${{\boldsymbol{F}}_{\rm{mid}}^i}$得到(${\boldsymbol{K}},{\boldsymbol{V}} \in {{\bf{R}}^{C \times C}}$),查询(query)矩阵由可学习的全1矩阵初始化构成(${\boldsymbol{Q}} \in {{\bf{R}}^{C \times C}}$),计算过程为

$ {\boldsymbol{Q}} = {{1}}, \; {\boldsymbol{K}} = {\rm{reshape}}\;({\boldsymbol{F}}_{\rm{mid}}^2), \; {\boldsymbol{V}} = {\rm{reshape}}\;({\boldsymbol{F}}_{\rm{mid}}^{3}). $

通过自注意力机制得到输出特征${{\boldsymbol{F}}_{\rm{att}}}$,计算过程表示为

$ {{\boldsymbol{F}}_{\rm{att}}} = ({\rm{Softmax}}\;({\boldsymbol{Q}} \otimes {{\boldsymbol{K}}^{{\mathrm{T}}}}) \otimes {\boldsymbol{V}}) \times {\boldsymbol{x}}. $

最后,对不同特征进行自适应相加,得到${{\boldsymbol{F}}_{\rm{out}}}$

$ {{\boldsymbol{F}}_{\rm{out}}} = \alpha {{\boldsymbol{F}}_{\rm{att}}}+\beta {{\boldsymbol{F}}_{\rm{conv}}}. $

式中:$\alpha $$\beta $为特征融合权重.

2.4. 动态原型单元

为了增强外观、运动融合特征的表征,引入动态原型单元(DPU). 在本研究的双流编码器框架中,DPU接收双流编码器融合后的特征,通过动态原型学习机制压缩视频序列中的正常时空模式,生成具有语义代表性的原型集合. 整个过程可以分为3个子过程,分别为注意力生成、原型检索和编码聚合.

具体来说,双编码器提取的外观和运动特征经过多尺度融合后,得到序列$ \left[ {{\boldsymbol{h}}_t^1{,}{\boldsymbol{h}}_t^2, \cdots ,{\boldsymbol{h}}_t^N} \right] $,记作${{\boldsymbol{x}}_t}$,将其映射为$ {{\boldsymbol{X}}_t} = {f_\theta }{(}{{\boldsymbol{x}}_t}) \in {{\bf{R}}^{H \times W \times C}} $. $ \theta $为编码器网络的参数,用于从输入帧中提取特征表示. 在注意力生成过程中,使用M个注意力映射函数$ \left\{ {\psi _m}: {{\bf{R}}^C} \to {{\bf{R}}^1} \right\}_{m = 1}^M $,为编码向量${\boldsymbol{\omega}} _t^{n,m} \in {\boldsymbol{W}}_t^m = {\psi _m}({{\boldsymbol{X}}_t})$分配正态权重. 对于每个像素位置,使用正常权重来评估融合向量的正常性. ${\boldsymbol{W}}_m^t \in {{\bf{R}}^{H \times W \times 1}}$表示由第m个注意力机制生成的第m个正态映射. 在原型检索过程中,从N个融合向量编码的集合中得出唯一原型${\boldsymbol{p}}_t^m$. ${\boldsymbol{p}}_t^m$综合反映了这些融合向量的特征,表示一种潜在的正常模式. 计算过程表示为

$ {\boldsymbol{p}}_t^m = \displaystyle \sum\limits_{n = 1}^N {\dfrac{{{\boldsymbol{\omega}} _t^{n,m}}}{{\displaystyle \sum\nolimits_{n' = 1}^N {{\boldsymbol{\omega}} _t^{n',m}} }}{\boldsymbol{x}}_t^n} . $

类似地,通过多个注意力机制得到M个原型,组成原型池${{\boldsymbol{P}}_t} = \{ {\boldsymbol{p}}_t^m\} _{m = 1}^M$. 在编码聚合过程中,将每一个输入的融合向量$ {\boldsymbol{x}}_t^n $($n \in N$)均作为查询项对原型池进行访问,找到最相关的原型,重建出代表正常模式的编码$ {\tilde {\boldsymbol{X}}_t} \in {{\bf{R}}^{H \times W \times C}} $. 计算过程表示为

$ \tilde {\boldsymbol{x}}_t^n = \displaystyle \sum\limits_{m = 1}^M {\beta _t^{n,m}{\boldsymbol{p}}_t^m} . $

式中:$\beta _t^{n,m} = {{{{{\boldsymbol{x}}_t^n{\boldsymbol{p}}_t^m}}} \mathord{\left/ {\vphantom {{{{{\boldsymbol{x}}_t^n{\boldsymbol{p}}_t^m}}} {{{\displaystyle \sum\nolimits_{m' = 1}^M {{\boldsymbol{x}}_t^n{\boldsymbol{p}}_t^{m'}} }}}}} \right. \kern-\nulldelimiterspace} {{{\displaystyle \sum\nolimits_{m' = 1}^M {{\boldsymbol{x}}_t^n{\boldsymbol{p}}_t^{m'}} }}}} $为第n个编码向量${\boldsymbol{x}}_t^n$和第m个原型项${\boldsymbol{p}}_t^m$之间的归一化相似度得分. 通过通道求和运算,将生成的正态图与原始编码$ {{\boldsymbol{X}}_t} $进行聚合,形成最终的输出. 在编码聚合步骤中,采用正常模式信息来增强融合特征的编码表示,从而更好地预测视频帧中的正常部分,并抑制异常部分的影响. 最后,DPU模块生成的输出编码会继续通过剩余解码层,用于后续帧的预测.

2.5. 损失函数

整体损失函数${L}$由预测损失${{L}_{\rm{pred}}}$、光流损失$ {{L}_{\rm{flow}}} $和特征重构损失${{L}_{\rm{fra}}}$构成:

$ {L} = {{L}_{\rm{pred}}}+{{L}_{\rm{flow}}}+{{L}_{\rm{fra}}}. $

采用均方误差(MSE)来计算帧预测损失:

$ {{L}_{\rm{pred}}} = \left\| {{{\boldsymbol{I}}_{t+1}} - {{\hat {\boldsymbol{I}}_{t+1}}}} \right\|_2^2. $

式中:${{\boldsymbol{I}}_{t+1}}$${\hat {\boldsymbol{I}}_{t+1}}$分别为真实的未来帧和预测的未来帧.

光流损失衡量的是从预测帧$ {\hat{\boldsymbol{I}}_{t+1}} $估计的运动场$ {\rm{Flow}}({{\boldsymbol{I}}_t},{\hat{\boldsymbol{I}}_{t+1}} ) $与从真实帧${{\boldsymbol{I}}_{t+1}}$估计的运动场${\rm{Flow}} ({{\boldsymbol{I}}_t}, {{\boldsymbol{I}}_{t+1}})$之间的相似程度:

$ {{L}_{\rm{flow}}} = \sum\limits_t^T {{{\left\| {{\rm{Flow}}\left( {{{\boldsymbol{I}}_t} , {\hat{\boldsymbol{I}}_{t+1}} } \right) - {\rm{Flow}}\left( {{{\boldsymbol{I}}_t} , {{\boldsymbol{I}}_{t+1}}} \right)} \right\|}_2}} . $

特征重构损失${{L}_{\rm{fra}}}$使模型学习到的正常原型具有紧凑型和多样性,包含紧凑性损失${L_{{\mathrm{c}}}}$和多样性损失${L_{{\mathrm{d}}}}$2项:

$ {L_{\rm{fra}}} = {L_{{\mathrm{c}}}}+{\lambda _1}{L_{{\mathrm{d}}}}. $

式中:${\lambda _1}$为权重参数,设置为0.5;${L_{{\mathrm{c}}}}$用于通过紧凑原型重建正常编码,并测量输入编码向量及其最相关原型的平均L2距离:

$ \left.\begin{split} &{L_{{\mathrm{c}}}} = \frac{1}{N}\sum\limits_{n = 1}^N {{{\left\| {{\boldsymbol{x}}_t^n - {\boldsymbol{p}}_t^*} \right\|}_2}} , \\&{\mathrm{s.t}}.{\text{ }} * = \mathop {\arg \max }\limits_{m \in \left[ {1,M} \right]} \beta _t^{n,m}.\end{split}\right\}$

通过最大化不同原型之间的差异来进一步促进原型项目之间的多样性项:

$ {L_{{\mathrm{d}}}} = \dfrac{2}{{M(M - 1)}}\displaystyle \sum\limits_{m = 1}^M {\displaystyle \sum\limits_{m' = 1}^M {{{\left[ { - {{\left\| {{{\boldsymbol{p}}_m} - {{\boldsymbol{p}}_{m'}}} \right\|}_2}+\gamma } \right]}_+}} } . $

式中:$\gamma $用于控制原型之间所需的边距;$[\cdot]_+ $为截断函数,若变量为正数,则保留原值,若为负数,则取值为0. 利用上述${L_{\mathrm{c}}}$${L_{\mathrm{d}}}$,使原型记忆库能够学习到编码紧凑且多样化的正常动态表征,从而增强对正常帧的预测精度.

在测试阶段,使用文献[29]中的异常评估法来计算真实帧It和预测帧$\hat {\boldsymbol{I}_t}$之间的误差值,并使用信噪峰值比(PSNR)计算预测帧在t时刻的异常分数S(t),计算公式为

$ {\mathrm{PSNR}}\left( {{{\boldsymbol{I}}_t},\hat {{{\boldsymbol{I}}_t}}} \right) = 10\;{\lg }\left(\dfrac{1}{{\displaystyle \sum\nolimits_{i = 0}^{{E}} {{e_i}} }}\right), $

$ S({{\boldsymbol{I}}_t}) = \frac{{{\mathrm{PSNR}}\left( {{{\boldsymbol{I}}_t},\hat {{{\boldsymbol{I}}_t}}} \right) - {{\min }}\left( {{\mathrm{PSNR}}\left( {{{\boldsymbol{I}}_t},\hat {{{\boldsymbol{I}}_t}}} \right)} \right)}}{{{{\max }}\left( {{\mathrm{PSNR}}\left( {{{\boldsymbol{I}}_t},\hat {{{\boldsymbol{I}}_t}}} \right)} \right) - {{\min }}\left( {{\mathrm{PSNR}}\left( {{{\boldsymbol{I}}_t},\hat {{{\boldsymbol{I}}_t}}} \right)} \right)}}. $

式中:${e_i}$为最大预测误差,E为误差金字塔中包含的比例总数. 应用高斯滤波器在时间维度上对$ S({{\boldsymbol{I}}_t}) $进行平滑处理,得到最终的异常得分.

3. 实验结果对比与分析

3.1. 数据集

为了验证所提方法的有效性,分别在UCSD Ped2[30]、CUHK Avenue[31]和ShanghaiTech[17]这3个基准VAD数据集上进行实验,其中正常和异常样本示例如图3所示.

图 3

图 3   正常和异常样本示例

Fig.3   Examples of normal and abnormal samples


表1中统计了各个数据集的样本数目情况. 其中,Ped2、Avenue、SHT分别为UCSD Ped2、CUHK Avenue和ShanghaiTech数据集,Nf_trNf_te为数据集中训练集、测试集包含的帧数,Nv_trNv_te为训练集、测试集包含的视频数,Ns为场景数. 在每个数据集中,训练集只包含正常帧,而测试集同时包含正常帧和异常帧. 在每个测试视频中,视频帧的真实标注信息采用二元分类形式,即采用数值0标记正常帧,数值1标记异常帧.

表 1   3个数据集的帧数、视频数与场景数统计

Tab.1  Statistics of frame, video and scene counts in three datasets

数据集Nf_tr/Nf_teNv_tr/Nv_teNs
Ped22 550 / 2 01016 / 121
Avenue15 328 / 15 32416 / 211
SHT274 515 / 42 883330 / 10713

新窗口打开| 下载CSV


3.2. 实验设置

在预处理阶段,将每个视频帧的大小调整为256像素×256像素,并对每帧像素值进行归一化处理,使其分布在[−1, 1]内. 在模型的训练阶段,从训练集中获取5个连续的视频帧序列,以前4帧作为输入来预测第5帧. 在UCSD Ped2、CUHK Avenue和ShanghaiTech这3个数据集上都使用$\beta = 0.9$的Adam优化器,批量大小为2,分别进行60、60和10次迭代. 初始学习率设置为2×10−4,并使用余弦退火方法进行衰减[32]. 所有模型均使用PyTorch[33]进行端到端训练.

与先前的研究[34-35]一致,使用帧级别的曲线下面积(area under curve, AUC)作为主要评价指标. 通过计算不同的异常分数阈值下受试者工作特征(receiver operating characteristic, ROC)曲线下面积来量化模型性能;AUC值越高,表明模型的异常检测性能越优.

3.3. 与先进方法的对比分析

在3个数据集上对所提方法与先进方法进行比较,如表2所示. 其中,最优值以粗体显示,次优值用下划线标出. 在标准无监督设置下进行评估,结果显示,所提方法在UCSD Ped2、CUHK Avenue和ShanghaiTech这3个数据集上均取得了较好的性能,AUC值分别为99.1%、88.5%和74.5%. 与主流方法的对比分析表明:1)相较于MemAE和文献[9]的方法所采用的静态记忆池策略,所提算法通过学习以输入数据为条件的动态正常原型,在提升内存效率的同时得到了更准确的预测结果;2)MPN方法尽管使用了DPU模块来学习正常行为,但是未能充分考虑运动信息,而所提方法使用双流网络提取多尺度的外观、运动信息并进行有效的融合,在检测结果上有较为明显的提升;3)文献[8]方法尽管引入了光流损失,但是未能充分考虑正常特征的多样性,因此相比于该方法,所提方法在UCSD Ped2、CUHK Avenue和ShanghaiTech数据集上得到的AUC值分别提高了3.7、3.4和1.7个百分点;4)AMAE方法提取了多尺度的外观、运动信息,但是没有关注全局信息与局部信息之间的关联,而所提方法提出的GLmix混合注意力机制有效增强了模型对复杂场景下异常行为的敏感度,其AUC在3个数据集上均有较为明显的提升,也证明了多模块协同优化在性能提升上的显著作用. 值得注意的是,多数方法在CUHK Avenue数据集上表现不佳,这是因为该数据集中的异常行为与正常行为在外观上难以区分,包含多种非结构化动作,如投掷物体、突然转身等,难以通过模型的预测机制产生具有判别性的误差差异.

表 2   所提方法与先进方法在AUC指标上的对比

Tab.2  Comparison of proposed method and advanced methods in terms of AUC metric

类型方法AUC/%
Ped2AvenueSHT
重建MemAE[1]94.183.371.2
Astrid等[36]94.884.972.5
GMFC-VAE[37]92.283.4
CR-AE[38]95.673.1
MESDnet[35]95.686.373.2
预测Park等[9]97.088.570.5
Liu等[8]95.485.172.8
MPN[19]96.989.573.8
Conv-VRNN[12]96.185.8
FSCN[13]92.885.5
AMMC-Net[11]96.686.673.7
Li等[16]96.587.173.6
PDM-Net[39]97.788.174.2
GroupGAN[40]96.688.174.2
AMAE[41]97.488.273.6
本研究99.188.574.5

新窗口打开| 下载CSV


3.4. 可视化分析

3.4.1. 误差可视化

对3个数据集上的误差进行可视化,如图4所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4(a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4(b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4(c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布.

图 4

图 4   3个数据集上的视频异常检测误差可视化图

Fig.4   Visualization of video anomaly detection errors on three datasets


3.4.2. 异常分数曲线

图5展示了不同数据集上的异常分数变化曲线,其中s为异常分数. 图5(a)来自UCSD Ped2数据集,该数据集的异常事件包括自行车和小汽车闯入人行道. 图5(b)来自CUHK Avenue数据集,其异常事件是行人突然加速奔跑并投掷物品. 图5(c)来自ShanghaiTech数据集,异常事件包括行人打闹以及汽车突然闯入. 可视化分析结果表明,模型的预测分数与实际标签高度吻合. 当异常事件出现时,预测得分和曲线急剧升高;正常时预测得分降低,曲线恢复平稳.

图 5

图 5   异常分数变化曲线

Fig.5   Anomaly score variation curves


3.5. 消融实验

为了验证各模块的有效性,针对运动编码器${E_{\mathrm{m}}}$、动态原型单元DPU、运动外观语义特征融合模块MASFF、全局-局部注意力模块GLmix这4个主要模块,在UCSD Ped2和ShanghaiTech数据集上进行消融实验,结果如表3所示.

表 3   不同模块组合在不同数据集上的消融实验结果

Tab.3  Ablation experiment results of different module combinations on different datasets

${E_{\mathrm{m}}}$DPUMASFFGLmixAUC/%
Ped2SHT
98.173.1
97.573.9
97.374.1
96.974.0
99.174.5

新窗口打开| 下载CSV


UCSD Ped2数据集中异常发生区域较小,而GLmix混合注意力模块可以捕捉到微小异常,因此具有较高的检测准确率. 由于ShanghaiTech数据集中异常行为的外观与运动模式同时偏离常态,其中运动模式区分度较高,通过添加运动编码器模块,使模型精度得到了显著提升. 同时,设计的多尺度融合方法相较于简单的线性拼接,在不同数据集上均取得了更好的效果. 总体来说,该消融实验证明了各个模块的有效性,并表明4个模块的组合优于其中任意3个模块的组合,进一步验证了所提方法的有效性.

为了进一步验证每个模块对检测性能的影响,对单一模块进行消融实验,结果如表4所示. 在UCSD Ped2和ShanghaiTech数据集上,当仅保留运动编码器模块时取得了最佳性能,表明时序运动信息对视频异常检测具有关键作用. 使用单一GLmix注意力模块时的检测精度紧随其后,印证了全局-局部信息融合对复杂场解析的有效性. 特别地,当仅保留MASFF模块时,由于缺少双流运动信息的输入,该模块仅对不同尺度的外观信息进行融合,AUC值较低. 所有单一模块的表现均显著低于完整模型,这充分表明了所有模块之间协同优化的必要性以及每个模块的有效性.

表 4   单一模块在不同数据集上的消融实验结果

Tab.4  Ablation experiment results of individual modules on different datasets

模块AUC/%
Ped2SHT
${E_{\mathrm{m}}}$98.474.1
DPU97.473.9
MASFF97.073.8
GLmix97.973.6

新窗口打开| 下载CSV


3.6. 模型复杂度和推理时间

表5展示了不同方法在UCSD Ped2数据集上的模型参数量(Np)和每秒帧数(FPS)结果. 本研究中所有实验均在配备单个NVIDIA GeForce RTX 4090 GPU的服务器环境中进行. 所提方法大约有17.8 M的参数,并实现了37帧/s的处理速度,处理过程包括数据预处理和异常得分计算. 将所提模型与其他方法进行比较,所提模型的参数量仅高于MemAE[1],处理速率高于3种对比方法,满足大部分视频的实时推理需求.

表 5   所提方法和部分先进方法的参数量和处理速率对比

Tab.5  Comparison of parameter count and processing speed of proposed method and selected advanced methods

方法Np/MFPS/(帧·s−1)
MemAE[1]6.531
Li等[16]30
Liu等[8]349.025
本研究17.837

新窗口打开| 下载CSV


4. 结 语

提出基于多尺度外观运动融合的视频异常检测方法. 利用Inception模块代替单一卷积层,以提高模型兼容不同尺度特征的能力. 在此基础上设计运动外观语义特征融合模块,用于捕获各层的纹理细节特征,提高模型对输入数据的理解能力并有效融合外观与运动信息. 为了进一步强化特征判别性,引入混合注意力模块GLmix,通过结合Transformer的全局上下文建模能力和CNN的局部细节捕捉能力,有效地融合全局信息和局部信息. 在3个基准数据集上的实验结果证明了所提方法的有效性和优越性. 未来的研究将致力于增强网络对异常区域的特征聚焦能力,同时探索更多应用场景,并通过轻量化模型设计来提高网络的计算效率.

参考文献

GONG D, LIU L, LE V, et al. Memorizing normality to detect anomaly: memory-augmented deep autoencoder for unsupervised anomaly detection [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Seoul: IEEE, 2019: 1705–1714.

[本文引用: 5]

RAMACHANDRA B, JONES M J, VATSAVAI R R

A survey of single-scene video anomaly detection

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 44 (5): 2293- 2312

[本文引用: 1]

YE M, SHEN J, LIN G, et al

Deep learning for person re-identification: a survey and outlook

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 44 (6): 2872- 2893

[本文引用: 1]

SABOKROU M, FATHY M, HOSEINI M, et al. Real-time anomaly detection and localization in crowded scenes [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition Workshops. Boston: IEEE, 2015: 56–62.

[本文引用: 1]

HASAN M, CHOI J, NEUMANN J, et al. Learning temporal regularity in video sequences [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 733–742.

[本文引用: 1]

FENG J, LIANG Y, LI L. Anomaly detection in videos using two-stream autoencoder with post hoc interpretability [J]. Computational Intelligence and Neuroscience, 2021: 7367870.

CHEN D, YUE L, CHANG X, et al

NM-GAN: noise-modulated generative adversarial network for video anomaly detection

[J]. Pattern Recognition, 2021, 116: 107969

DOI:10.1016/j.patcog.2021.107969      [本文引用: 1]

LIU W, LUO W, LIAN D, et al. Future frame prediction for anomaly detection: a new baseline [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE, 2018: 6536–6545.

[本文引用: 5]

PARK H, NOH J, HAM B. Learning memory-guided normality for anomaly detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2020: 14360–14369.

[本文引用: 3]

梁家菲, 李婷, 杨佳琪, 等

融合自注意力和自编码器的视频异常检测

[J]. 中国图象图形学报, 2023, 28 (4): 1029- 1040

DOI:10.11834/jig.211147     

LIANG Jiafei, LI Ting, YANG Jiaqi, et al

Video anomaly detection by fusing self-attention and autoencoder

[J]. Journal of Image and Graphics, 2023, 28 (4): 1029- 1040

DOI:10.11834/jig.211147     

CAI R, ZHANG H, LIU W, et al

Appearance-motion memory consistency network for video anomaly detection

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2021, 35 (2): 938- 946

DOI:10.1609/aaai.v35i2.16177      [本文引用: 1]

LU Y, KUMAR K M, NABAVI S S, et al. Future frame prediction using convolutional VRNN for anomaly detection [C]// Proceedings of the 16th IEEE International Conference on Advanced Video and Signal Based Surveillance. Taipei: IEEE, 2019: 1–8.

[本文引用: 2]

WU P, LIU J, LI M, et al

Fast sparse coding networks for anomaly detection in videos

[J]. Pattern Recognition, 2020, 107: 107515

DOI:10.1016/j.patcog.2020.107515      [本文引用: 1]

LU Y, YU F, REDDY M K K, et al. Few-shot scene-adaptive anomaly detection [C]// European Conference on Computer Vision. [S.l.]: Springer, 2020: 125–141.

[本文引用: 2]

LYU J, ZHAO M, HU J, et al

Bidirectional skip-frame prediction for video anomaly detection with intra-domain disparity-driven attention

[J]. Pattern Recognition, 2026, 170: 112010

DOI:10.1016/j.patcog.2025.112010      [本文引用: 2]

LI D, NIE X, GONG R, et al

Multi-branch GAN-based abnormal events detection via context learning in surveillance videos

[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2023, 34 (5): 3439- 3450

[本文引用: 4]

LUO W, LIU W, GAO S. A revisit of sparse coding based anomaly detection in stacked RNN framework [C]// Proceedings of the IEEE International Conference on Computer Vision. Venice: IEEE, 2017: 341–349.

[本文引用: 2]

SZEGEDY C, IOFFE S, VANHOUCKE V, et al. Inception-v4, inception-ResNet and the impact of residual connections on learning [C]// Proceedings of the 31st AAAI Conference on Artificial Intelligence. San Francisco: AAAI Press, 2017: 4278–4284.

[本文引用: 1]

LV H, CHEN C, CUI Z, et al. Learning normal dynamics in videos with meta prototype network [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2021: 15420–15429.

[本文引用: 2]

LI Z, LI N, JIANG K, et al. Superpixel masking and inpainting for self-supervised anomaly detection [C]// Proceedings of the British Machine Vision Conference. [S.l.]: BMVA Press, 2020.

[本文引用: 1]

GOODFELLOW I, POUGET-ABADIE J, MIRZA M, et al

Generative adversarial networks

[J]. Communications of the ACM, 2020, 63 (11): 139- 144

DOI:10.1145/3422622      [本文引用: 1]

ZAHEER M Z, LEE J H, MAHMOOD A, et al

Stabilizing adversarially learned one-class novelty detection using pseudo anomalies

[J]. IEEE Transactions on Image Processing, 2022, 31: 5963- 5975

DOI:10.1109/TIP.2022.3204217      [本文引用: 1]

CHEN Y, LIU J, PENG L, et al

Auto-encoding variational Bayes

[J]. Cambridge Explorations in Arts and Sciences, 2024, 2 (1): 1

[本文引用: 1]

GRAVES A, GRAVES A. Long short-term memory [M]// Supervised sequence labelling with recurrent neural networks. Berlin, Heidelberg: Springer, 2012: 37–45.

[本文引用: 1]

CHEN D, WANG P, YUE L, et al

Anomaly detection in surveillance video based on bidirectional prediction

[J]. Image and Vision Computing, 2020, 98: 103915

DOI:10.1016/j.imavis.2020.103915      [本文引用: 1]

SUN S, GONG X. Hierarchical semantic contrast for scene-aware video anomaly detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 22846–22856.

[本文引用: 1]

LIU Z, NIE Y, LONG C, et al. A hybrid video anomaly detection framework via memory-augmented flow reconstruction and flow-guided frame prediction [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 13568–13577.

[本文引用: 1]

DOSOVITSKIY A, FISCHER P, ILG E, et al. FlowNet: learning optical flow with convolutional networks [C]// Proceedings of the IEEE International Conference on Computer Vision. Santiago: IEEE, 2015: 2758–2766.

[本文引用: 1]

ZHONG Y, CHEN X, HU Y, et al

Bidirectional spatio-temporal feature learning with multiscale evaluation for video anomaly detection

[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2022, 32 (12): 8285- 8296

DOI:10.1109/TCSVT.2022.3190539      [本文引用: 1]

MAHADEVAN V, LI W, BHALODIA V, et al. Anomaly detection in crowded scenes [C]// Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition. San Francisco: IEEE, 2010: 1975–1981.

[本文引用: 1]

LU C, SHI J, JIA J. Abnormal event detection at 150 FPS in MATLAB [C]// Proceedings of the IEEE International Conference on Computer Vision. Sydney: IEEE, 2013: 2720–2727.

[本文引用: 1]

LOSHCHILOV I, HUTTER F. SGDR: stochastic gradient descent with warm restarts [EB/OL]. (2017–05–03) [2025–04–06]. https://arxiv.org/abs/1608.03983.

[本文引用: 1]

PASZKE A, GROSS S, CHINTALA S, et al. Automatic differentiation in PyTorch [EB/OL]. (2017–10–29) [2025–04–06]. https://openreview.net/forum?id=BJJsrmfCZ.

[本文引用: 1]

ZHANG X, FANG J, YANG B, et al

Hybrid attention and motion constraint for anomaly detection in crowded scenes

[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2023, 33 (5): 2259- 2274

DOI:10.1109/TCSVT.2022.3221622      [本文引用: 1]

FANG Z, ZHOU J T, XIAO Y, et al

Multi-encoder towards effective anomaly detection in videos

[J]. IEEE Transactions on Multimedia, 2020, 23: 4106- 4116

[本文引用: 2]

ASTRID M, ZAHEER M Z, LEE J Y, et al. Learning not to reconstruct anomalies [EB/OL]. (2021–10–24) [2025–04–06]. https://arxiv.org/abs/2110.09742.

[本文引用: 1]

FAN Y, WEN G, LI D, et al

Video anomaly detection and localization via Gaussian mixture fully convolutional variational autoencoder

[J]. Computer Vision and Image Understanding, 2020, 195: 102920

DOI:10.1016/j.cviu.2020.102920      [本文引用: 1]

WANG B, YANG C

Video anomaly detection based on convolutional recurrent AutoEncoder

[J]. Sensors, 2022, 22 (12): 4647

DOI:10.3390/s22124647      [本文引用: 1]

HUANG C, WEN J, LIU C, et al. Long short-term dynamic prototype alignment learning for video anomaly detection [C]// Proceedings of the 33rd International Joint Conference on Artificial Intelligence. Jeju: Curran Associates Inc, 2024: 866–874.

[本文引用: 1]

SUN Z, WANG P, ZHENG W, et al

Dual GroupGAN: an unsupervised four-competitor (2V2) approach for video anomaly detection

[J]. Pattern Recognition, 2024, 153: 110500

DOI:10.1016/j.patcog.2024.110500      [本文引用: 1]

LIU Y, LIU J, LIN J, et al

Appearance-motion united auto-encoder framework for video anomaly detection

[J]. IEEE Transactions on Circuits and Systems II: Express Briefs, 2022, 69 (5): 2498- 2502

[本文引用: 1]

/