[1]
GONG D, LIU L, LE V, et al. Memorizing normality to detect anomaly: memory-augmented deep autoencoder for unsupervised anomaly detection [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision . Seoul: IEEE, 2019: 1705–1714.
[本文引用: 5]
[2]
RAMACHANDRA B, JONES M J, VATSAVAI R R A survey of single-scene video anomaly detection
[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence , 2022 , 44 (5 ): 2293 - 2312
[本文引用: 1]
[3]
YE M, SHEN J, LIN G, et al Deep learning for person re-identification: a survey and outlook
[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence , 2022 , 44 (6 ): 2872 - 2893
[本文引用: 1]
[4]
SABOKROU M, FATHY M, HOSEINI M, et al. Real-time anomaly detection and localization in crowded scenes [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition Workshops . Boston: IEEE, 2015: 56–62.
[本文引用: 1]
[5]
HASAN M, CHOI J, NEUMANN J, et al. Learning temporal regularity in video sequences [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognitio n. Las Vegas: IEEE, 2016: 733–742.
[本文引用: 1]
[6]
FENG J, LIANG Y, LI L. Anomaly detection in videos using two-stream autoencoder with post hoc interpretability [J]. Computational Intelligence and Neuroscience , 2021: 7367870.
[7]
CHEN D, YUE L, CHANG X, et al NM-GAN: noise-modulated generative adversarial network for video anomaly detection
[J]. Pattern Recognition , 2021 , 116 : 107969
DOI:10.1016/j.patcog.2021.107969
[本文引用: 1]
[8]
LIU W, LUO W, LIAN D, et al. Future frame prediction for anomaly detection: a new baseline [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Salt Lake City: IEEE, 2018: 6536–6545.
[本文引用: 5]
[9]
PARK H, NOH J, HAM B. Learning memory-guided normality for anomaly detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Seattle: IEEE, 2020: 14360–14369.
[本文引用: 3]
[10]
梁家菲, 李婷, 杨佳琪, 等 融合自注意力和自编码器的视频异常检测
[J]. 中国图象图形学报 , 2023 , 28 (4 ): 1029 - 1040
DOI:10.11834/jig.211147
LIANG Jiafei, LI Ting, YANG Jiaqi, et al Video anomaly detection by fusing self-attention and autoencoder
[J]. Journal of Image and Graphics , 2023 , 28 (4 ): 1029 - 1040
DOI:10.11834/jig.211147
[11]
CAI R, ZHANG H, LIU W, et al Appearance-motion memory consistency network for video anomaly detection
[J]. Proceedings of the AAAI Conference on Artificial Intelligence , 2021 , 35 (2 ): 938 - 946
DOI:10.1609/aaai.v35i2.16177
[本文引用: 1]
[12]
LU Y, KUMAR K M, NABAVI S S, et al. Future frame prediction using convolutional VRNN for anomaly detection [C]// Proceedings of the 16th IEEE International Conference on Advanced Video and Signal Based Surveillance . Taipei: IEEE, 2019: 1–8.
[本文引用: 2]
[14]
LU Y, YU F, REDDY M K K, et al. Few-shot scene-adaptive anomaly detection [C]// European Conference on Computer Vision . [S.l.]: Springer, 2020: 125–141.
[本文引用: 2]
[15]
LYU J, ZHAO M, HU J, et al Bidirectional skip-frame prediction for video anomaly detection with intra-domain disparity-driven attention
[J]. Pattern Recognition , 2026 , 170 : 112010
DOI:10.1016/j.patcog.2025.112010
[本文引用: 2]
[16]
LI D, NIE X, GONG R, et al Multi-branch GAN-based abnormal events detection via context learning in surveillance videos
[J]. IEEE Transactions on Circuits and Systems for Video Technology , 2023 , 34 (5 ): 3439 - 3450
[本文引用: 4]
[17]
LUO W, LIU W, GAO S. A revisit of sparse coding based anomaly detection in stacked RNN framework [C]// Proceedings of the IEEE International Conference on Computer Vision . Venice: IEEE, 2017: 341–349.
[本文引用: 2]
[18]
SZEGEDY C, IOFFE S, VANHOUCKE V, et al. Inception-v4, inception-ResNet and the impact of residual connections on learning [C]// Proceedings of the 31st AAAI Conference on Artificial Intelligence . San Francisco: AAAI Press, 2017: 4278–4284.
[本文引用: 1]
[19]
LV H, CHEN C, CUI Z, et al. Learning normal dynamics in videos with meta prototype network [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Nashville: IEEE, 2021: 15420–15429.
[本文引用: 2]
[20]
LI Z, LI N, JIANG K, et al. Superpixel masking and inpainting for self-supervised anomaly detection [C]// Proceedings of the British Machine Vision Conference . [S.l.]: BMVA Press, 2020.
[本文引用: 1]
[21]
GOODFELLOW I, POUGET-ABADIE J, MIRZA M, et al Generative adversarial networks
[J]. Communications of the ACM , 2020 , 63 (11 ): 139 - 144
DOI:10.1145/3422622
[本文引用: 1]
[22]
ZAHEER M Z, LEE J H, MAHMOOD A, et al Stabilizing adversarially learned one-class novelty detection using pseudo anomalies
[J]. IEEE Transactions on Image Processing , 2022 , 31 : 5963 - 5975
DOI:10.1109/TIP.2022.3204217
[本文引用: 1]
[23]
CHEN Y, LIU J, PENG L, et al Auto-encoding variational Bayes
[J]. Cambridge Explorations in Arts and Sciences , 2024 , 2 (1 ): 1
[本文引用: 1]
[24]
GRAVES A, GRAVES A. Long short-term memory [M]// Supervised sequence labelling with recurrent neural networks . Berlin, Heidelberg: Springer, 2012: 37–45.
[本文引用: 1]
[25]
CHEN D, WANG P, YUE L, et al Anomaly detection in surveillance video based on bidirectional prediction
[J]. Image and Vision Computing , 2020 , 98 : 103915
DOI:10.1016/j.imavis.2020.103915
[本文引用: 1]
[26]
SUN S, GONG X. Hierarchical semantic contrast for scene-aware video anomaly detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Vancouver: IEEE, 2023: 22846–22856.
[本文引用: 1]
[27]
LIU Z, NIE Y, LONG C, et al. A hybrid video anomaly detection framework via memory-augmented flow reconstruction and flow-guided frame prediction [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision . Montreal: IEEE, 2021: 13568–13577.
[本文引用: 1]
[28]
DOSOVITSKIY A, FISCHER P, ILG E, et al. FlowNet: learning optical flow with convolutional networks [C]// Proceedings of the IEEE International Conference on Computer Vision . Santiago: IEEE, 2015: 2758–2766.
[本文引用: 1]
[29]
ZHONG Y, CHEN X, HU Y, et al Bidirectional spatio-temporal feature learning with multiscale evaluation for video anomaly detection
[J]. IEEE Transactions on Circuits and Systems for Video Technology , 2022 , 32 (12 ): 8285 - 8296
DOI:10.1109/TCSVT.2022.3190539
[本文引用: 1]
[30]
MAHADEVAN V, LI W, BHALODIA V, et al. Anomaly detection in crowded scenes [C]// Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition . San Francisco: IEEE, 2010: 1975–1981.
[本文引用: 1]
[31]
LU C, SHI J, JIA J. Abnormal event detection at 150 FPS in MATLAB [C]// Proceedings of the IEEE International Conference on Computer Vision . Sydney: IEEE, 2013: 2720–2727.
[本文引用: 1]
[32]
LOSHCHILOV I, HUTTER F. SGDR: stochastic gradient descent with warm restarts [EB/OL]. (2017–05–03) [2025–04–06]. https://arxiv.org/abs/1608.03983.
[本文引用: 1]
[33]
PASZKE A, GROSS S, CHINTALA S, et al. Automatic differentiation in PyTorch [EB/OL]. (2017–10–29) [2025–04–06]. https://openreview.net/forum?id=BJJsrmfCZ.
[本文引用: 1]
[34]
ZHANG X, FANG J, YANG B, et al Hybrid attention and motion constraint for anomaly detection in crowded scenes
[J]. IEEE Transactions on Circuits and Systems for Video Technology , 2023 , 33 (5 ): 2259 - 2274
DOI:10.1109/TCSVT.2022.3221622
[本文引用: 1]
[35]
FANG Z, ZHOU J T, XIAO Y, et al Multi-encoder towards effective anomaly detection in videos
[J]. IEEE Transactions on Multimedia , 2020 , 23 : 4106 - 4116
[本文引用: 2]
[36]
ASTRID M, ZAHEER M Z, LEE J Y, et al. Learning not to reconstruct anomalies [EB/OL]. (2021–10–24) [2025–04–06]. https://arxiv.org/abs/2110.09742.
[本文引用: 1]
[37]
FAN Y, WEN G, LI D, et al Video anomaly detection and localization via Gaussian mixture fully convolutional variational autoencoder
[J]. Computer Vision and Image Understanding , 2020 , 195 : 102920
DOI:10.1016/j.cviu.2020.102920
[本文引用: 1]
[38]
WANG B, YANG C Video anomaly detection based on convolutional recurrent AutoEncoder
[J]. Sensors , 2022 , 22 (12 ): 4647
DOI:10.3390/s22124647
[本文引用: 1]
[39]
HUANG C, WEN J, LIU C, et al. Long short-term dynamic prototype alignment learning for video anomaly detection [C]// Proceedings of the 33rd International Joint Conference on Artificial Intelligence . Jeju: Curran Associates Inc, 2024: 866–874.
[本文引用: 1]
[40]
SUN Z, WANG P, ZHENG W, et al Dual GroupGAN: an unsupervised four-competitor (2V2) approach for video anomaly detection
[J]. Pattern Recognition , 2024 , 153 : 110500
DOI:10.1016/j.patcog.2024.110500
[本文引用: 1]
[41]
LIU Y, LIU J, LIN J, et al Appearance-motion united auto-encoder framework for video anomaly detection
[J]. IEEE Transactions on Circuits and Systems II: Express Briefs , 2022 , 69 (5 ): 2498 - 2502
[本文引用: 1]
5
... 视频异常检测(video anomaly detection, VAD)作为智能视频监控系统的核心技术,目标是监测和定位监控视频中偏离预期的异常行为[1 ] ,在公共安全防护、交通管理等领域具有重要的应用价值[2 ] . 由于异常行为的发生频率较低,其视频样本获取难度较大且种类难以统计,难以对其建立统一的形式化定义[3 ] . 因此,现有的基于深度学习的异常行为检测方法大多采用基于重建[1 ,4 -7 ] 或基于预测[8 -14 ] 的无监督方法,即通过训练大量正常视频数据来构建正态性模型,以重建/预测帧与真实帧的偏差作为异常行为检测的判据. ...
... [1 ,4 -7 ]或基于预测[8 -14 ] 的无监督方法,即通过训练大量正常视频数据来构建正态性模型,以重建/预测帧与真实帧的偏差作为异常行为检测的判据. ...
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
... 表5 展示了不同方法在UCSD Ped2数据集上的模型参数量(N p )和每秒帧数(FPS)结果. 本研究中所有实验均在配备单个NVIDIA GeForce RTX 4090 GPU的服务器环境中进行. 所提方法大约有17.8 M的参数,并实现了37帧/s的处理速度,处理过程包括数据预处理和异常得分计算. 将所提模型与其他方法进行比较,所提模型的参数量仅高于MemAE[1 ] ,处理速率高于3种对比方法,满足大部分视频的实时推理需求. ...
... Comparison of parameter count and processing speed of proposed method and selected advanced methods
Tab.5 方法 N p /MFPS/(帧·s−1 ) MemAE[1 ] 6.5 31 Li等[16 ] — 30 Liu等[8 ] 349.0 25 本研究 17.8 37
4. 结 语 提出基于多尺度外观运动融合的视频异常检测方法. 利用Inception模块代替单一卷积层,以提高模型兼容不同尺度特征的能力. 在此基础上设计运动外观语义特征融合模块,用于捕获各层的纹理细节特征,提高模型对输入数据的理解能力并有效融合外观与运动信息. 为了进一步强化特征判别性,引入混合注意力模块GLmix,通过结合Transformer的全局上下文建模能力和CNN的局部细节捕捉能力,有效地融合全局信息和局部信息. 在3个基准数据集上的实验结果证明了所提方法的有效性和优越性. 未来的研究将致力于增强网络对异常区域的特征聚焦能力,同时探索更多应用场景,并通过轻量化模型设计来提高网络的计算效率. ...
A survey of single-scene video anomaly detection
1
2022
... 视频异常检测(video anomaly detection, VAD)作为智能视频监控系统的核心技术,目标是监测和定位监控视频中偏离预期的异常行为[1 ] ,在公共安全防护、交通管理等领域具有重要的应用价值[2 ] . 由于异常行为的发生频率较低,其视频样本获取难度较大且种类难以统计,难以对其建立统一的形式化定义[3 ] . 因此,现有的基于深度学习的异常行为检测方法大多采用基于重建[1 ,4 -7 ] 或基于预测[8 -14 ] 的无监督方法,即通过训练大量正常视频数据来构建正态性模型,以重建/预测帧与真实帧的偏差作为异常行为检测的判据. ...
Deep learning for person re-identification: a survey and outlook
1
2022
... 视频异常检测(video anomaly detection, VAD)作为智能视频监控系统的核心技术,目标是监测和定位监控视频中偏离预期的异常行为[1 ] ,在公共安全防护、交通管理等领域具有重要的应用价值[2 ] . 由于异常行为的发生频率较低,其视频样本获取难度较大且种类难以统计,难以对其建立统一的形式化定义[3 ] . 因此,现有的基于深度学习的异常行为检测方法大多采用基于重建[1 ,4 -7 ] 或基于预测[8 -14 ] 的无监督方法,即通过训练大量正常视频数据来构建正态性模型,以重建/预测帧与真实帧的偏差作为异常行为检测的判据. ...
1
... 视频异常检测(video anomaly detection, VAD)作为智能视频监控系统的核心技术,目标是监测和定位监控视频中偏离预期的异常行为[1 ] ,在公共安全防护、交通管理等领域具有重要的应用价值[2 ] . 由于异常行为的发生频率较低,其视频样本获取难度较大且种类难以统计,难以对其建立统一的形式化定义[3 ] . 因此,现有的基于深度学习的异常行为检测方法大多采用基于重建[1 ,4 -7 ] 或基于预测[8 -14 ] 的无监督方法,即通过训练大量正常视频数据来构建正态性模型,以重建/预测帧与真实帧的偏差作为异常行为检测的判据. ...
1
... 基于重建的方法通过自编码器学习数据的正常分布模式,对下一帧内容进行重构. 由于异常行为与训练数据的分布存在差异,模型对异常帧的重构会产生显著误差. 测试时计算重构误差,并将其作为异常得分;当得分超过预设阈值时,判定为异常事件. Hasan等[5 ] 提出基于卷积自编码器的视频异常检测方法,但是由于神经网络具有强大的泛化能力,有些异常行为可以被模型很好地重建,从而影响了异常检测的准确性. 为了应对过度泛化问题,Li等[20 ] 提出超像素掩码修复(superpixel masking and inpainting, SMAI)方法,在重构时对输入图像的部分区域进行掩码覆盖后再将图像送入网络中进行复原. 许多研究借助生成对抗网络(generative adversarial network, GAN)[21 ] ,以提升对正常事件的重建效果. 为了解决GAN固有的训练波动缺陷,Zaheer等[22 ] 利用同一生成器的当前状态和先前状态创建高质量和低质量的重建示例. 然而,这些基于重建的方法都只考虑到空间特征,忽略了视频帧之间的时序信息. 因此,当处理在时间上具有连续运动变化的正常和异常事件时,其重建能力均表现不佳. ...
NM-GAN: noise-modulated generative adversarial network for video anomaly detection
1
2021
... 视频异常检测(video anomaly detection, VAD)作为智能视频监控系统的核心技术,目标是监测和定位监控视频中偏离预期的异常行为[1 ] ,在公共安全防护、交通管理等领域具有重要的应用价值[2 ] . 由于异常行为的发生频率较低,其视频样本获取难度较大且种类难以统计,难以对其建立统一的形式化定义[3 ] . 因此,现有的基于深度学习的异常行为检测方法大多采用基于重建[1 ,4 -7 ] 或基于预测[8 -14 ] 的无监督方法,即通过训练大量正常视频数据来构建正态性模型,以重建/预测帧与真实帧的偏差作为异常行为检测的判据. ...
5
... 视频异常检测(video anomaly detection, VAD)作为智能视频监控系统的核心技术,目标是监测和定位监控视频中偏离预期的异常行为[1 ] ,在公共安全防护、交通管理等领域具有重要的应用价值[2 ] . 由于异常行为的发生频率较低,其视频样本获取难度较大且种类难以统计,难以对其建立统一的形式化定义[3 ] . 因此,现有的基于深度学习的异常行为检测方法大多采用基于重建[1 ,4 -7 ] 或基于预测[8 -14 ] 的无监督方法,即通过训练大量正常视频数据来构建正态性模型,以重建/预测帧与真实帧的偏差作为异常行为检测的判据. ...
... 基于预测的方法根据输入的视频帧序列来预测下一时刻的视频帧,并通过比较预测帧与真实帧之间的差异来检测异常行为. Liu等[8 ] 提出利用视频帧预测方法来进行异常检测. 为了更好地利用视频的上下文相关信息,Li等[16 ] 基于GAN设计具有上下文学习能力的多分支预测模型,该模型不仅从当前帧预测下一帧,而且利用后续视频帧反向预测先前帧,从而提高视频异常检测的准确性. Lyu等[15 ] 提出双向跳跃帧预测方法,通过2种域内差异注意力机制与不同的输入策略,实现了对复杂场景下异常行为的高效检测. 除了通常使用的强度约束和外观约束外,现有研究还关注运动约束. Lu等[12 ] 提出基于变分自动编码[23 ] 的新型顺序生成模型,利用ConvLSTM模块[24 ] 进行未来帧预测,在未来帧预测任务中保留了时间信息. 为了充分利用运动模式,Chen等[25 ] 提出双向预测框架,在前向传播和后向传播子网络中同步生成目标帧的双向预测结果,根据2个生成帧和目标帧之间的相似性度量结果,综合评估视频帧的异常程度. Sun等[26 ] 提出基于骨架运动增强的分层语义对比学习方法,引入对象级与场景级的对比学习策略,提升了模型的泛化能力. Liu等[27 ] 提出融合光流重建与帧预测的混合框架,基于前景目标聚焦的新思路,利用多级记忆模块学习正常运动模式,并引导异常光流来放大预测误差,从而实现对局部前景异常的精准检测. 尽管这些基于预测的方法能够有效学习视频的上下文信息,但是在正常特征的学习和运动变化特征的提取上表现较弱,缺乏对外观和运动特征更加有效的探索. ...
... 在3个数据集上对所提方法与先进方法进行比较,如表2 所示. 其中,最优值以粗体显示,次优值用下划线标出. 在标准无监督设置下进行评估,结果显示,所提方法在UCSD Ped2、CUHK Avenue和ShanghaiTech这3个数据集上均取得了较好的性能,AUC值分别为99.1%、88.5%和74.5%. 与主流方法的对比分析表明:1)相较于MemAE和文献[9 ]的方法所采用的静态记忆池策略,所提算法通过学习以输入数据为条件的动态正常原型,在提升内存效率的同时得到了更准确的预测结果;2)MPN方法尽管使用了DPU模块来学习正常行为,但是未能充分考虑运动信息,而所提方法使用双流网络提取多尺度的外观、运动信息并进行有效的融合,在检测结果上有较为明显的提升;3)文献[8 ]方法尽管引入了光流损失,但是未能充分考虑正常特征的多样性,因此相比于该方法,所提方法在UCSD Ped2、CUHK Avenue和ShanghaiTech数据集上得到的AUC值分别提高了3.7、3.4和1.7个百分点;4)AMAE方法提取了多尺度的外观、运动信息,但是没有关注全局信息与局部信息之间的关联,而所提方法提出的GLmix混合注意力机制有效增强了模型对复杂场景下异常行为的敏感度,其AUC在3个数据集上均有较为明显的提升,也证明了多模块协同优化在性能提升上的显著作用. 值得注意的是,多数方法在CUHK Avenue数据集上表现不佳,这是因为该数据集中的异常行为与正常行为在外观上难以区分,包含多种非结构化动作,如投掷物体、突然转身等,难以通过模型的预测机制产生具有判别性的误差差异. ...
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
... Comparison of parameter count and processing speed of proposed method and selected advanced methods
Tab.5 方法 N p /MFPS/(帧·s−1 ) MemAE[1 ] 6.5 31 Li等[16 ] — 30 Liu等[8 ] 349.0 25 本研究 17.8 37
4. 结 语 提出基于多尺度外观运动融合的视频异常检测方法. 利用Inception模块代替单一卷积层,以提高模型兼容不同尺度特征的能力. 在此基础上设计运动外观语义特征融合模块,用于捕获各层的纹理细节特征,提高模型对输入数据的理解能力并有效融合外观与运动信息. 为了进一步强化特征判别性,引入混合注意力模块GLmix,通过结合Transformer的全局上下文建模能力和CNN的局部细节捕捉能力,有效地融合全局信息和局部信息. 在3个基准数据集上的实验结果证明了所提方法的有效性和优越性. 未来的研究将致力于增强网络对异常区域的特征聚焦能力,同时探索更多应用场景,并通过轻量化模型设计来提高网络的计算效率. ...
3
... 当异常行为展现出与正常行为相似的空间特征及运动模式时,模型如果仅依赖空间特征进行学习,则很可能产生误判问题. 这会导致异常行为的预测误差值较小,进而造成模型对该异常行为的忽略. 当前大多数算法着重于分析空间内的局部特征,但是这些算法不完全适用于包含时间信息的视频序列处理[9 ,14 -15 ] . 为了更准确地捕捉异常行为,模型应该不仅限于空间局部特征的学习,而应深入研究同一目标随时间演变的动态特征. 此外,在现有的基于双流网络的研究中,多数方法利用单一卷积核提取外观或运动特征,难以捕捉不同尺度的高级特征,导致其对不同行为特征间局部空间纹理及运动轨迹细节不够敏感,进而削弱了模型对细微异常模式的判别能力[16 -17 ] . ...
... 在3个数据集上对所提方法与先进方法进行比较,如表2 所示. 其中,最优值以粗体显示,次优值用下划线标出. 在标准无监督设置下进行评估,结果显示,所提方法在UCSD Ped2、CUHK Avenue和ShanghaiTech这3个数据集上均取得了较好的性能,AUC值分别为99.1%、88.5%和74.5%. 与主流方法的对比分析表明:1)相较于MemAE和文献[9 ]的方法所采用的静态记忆池策略,所提算法通过学习以输入数据为条件的动态正常原型,在提升内存效率的同时得到了更准确的预测结果;2)MPN方法尽管使用了DPU模块来学习正常行为,但是未能充分考虑运动信息,而所提方法使用双流网络提取多尺度的外观、运动信息并进行有效的融合,在检测结果上有较为明显的提升;3)文献[8 ]方法尽管引入了光流损失,但是未能充分考虑正常特征的多样性,因此相比于该方法,所提方法在UCSD Ped2、CUHK Avenue和ShanghaiTech数据集上得到的AUC值分别提高了3.7、3.4和1.7个百分点;4)AMAE方法提取了多尺度的外观、运动信息,但是没有关注全局信息与局部信息之间的关联,而所提方法提出的GLmix混合注意力机制有效增强了模型对复杂场景下异常行为的敏感度,其AUC在3个数据集上均有较为明显的提升,也证明了多模块协同优化在性能提升上的显著作用. 值得注意的是,多数方法在CUHK Avenue数据集上表现不佳,这是因为该数据集中的异常行为与正常行为在外观上难以区分,包含多种非结构化动作,如投掷物体、突然转身等,难以通过模型的预测机制产生具有判别性的误差差异. ...
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
融合自注意力和自编码器的视频异常检测
0
2023
融合自注意力和自编码器的视频异常检测
0
2023
Appearance-motion memory consistency network for video anomaly detection
1
2021
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
2
... 基于预测的方法根据输入的视频帧序列来预测下一时刻的视频帧,并通过比较预测帧与真实帧之间的差异来检测异常行为. Liu等[8 ] 提出利用视频帧预测方法来进行异常检测. 为了更好地利用视频的上下文相关信息,Li等[16 ] 基于GAN设计具有上下文学习能力的多分支预测模型,该模型不仅从当前帧预测下一帧,而且利用后续视频帧反向预测先前帧,从而提高视频异常检测的准确性. Lyu等[15 ] 提出双向跳跃帧预测方法,通过2种域内差异注意力机制与不同的输入策略,实现了对复杂场景下异常行为的高效检测. 除了通常使用的强度约束和外观约束外,现有研究还关注运动约束. Lu等[12 ] 提出基于变分自动编码[23 ] 的新型顺序生成模型,利用ConvLSTM模块[24 ] 进行未来帧预测,在未来帧预测任务中保留了时间信息. 为了充分利用运动模式,Chen等[25 ] 提出双向预测框架,在前向传播和后向传播子网络中同步生成目标帧的双向预测结果,根据2个生成帧和目标帧之间的相似性度量结果,综合评估视频帧的异常程度. Sun等[26 ] 提出基于骨架运动增强的分层语义对比学习方法,引入对象级与场景级的对比学习策略,提升了模型的泛化能力. Liu等[27 ] 提出融合光流重建与帧预测的混合框架,基于前景目标聚焦的新思路,利用多级记忆模块学习正常运动模式,并引导异常光流来放大预测误差,从而实现对局部前景异常的精准检测. 尽管这些基于预测的方法能够有效学习视频的上下文信息,但是在正常特征的学习和运动变化特征的提取上表现较弱,缺乏对外观和运动特征更加有效的探索. ...
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
Fast sparse coding networks for anomaly detection in videos
1
2020
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
2
... 视频异常检测(video anomaly detection, VAD)作为智能视频监控系统的核心技术,目标是监测和定位监控视频中偏离预期的异常行为[1 ] ,在公共安全防护、交通管理等领域具有重要的应用价值[2 ] . 由于异常行为的发生频率较低,其视频样本获取难度较大且种类难以统计,难以对其建立统一的形式化定义[3 ] . 因此,现有的基于深度学习的异常行为检测方法大多采用基于重建[1 ,4 -7 ] 或基于预测[8 -14 ] 的无监督方法,即通过训练大量正常视频数据来构建正态性模型,以重建/预测帧与真实帧的偏差作为异常行为检测的判据. ...
... 当异常行为展现出与正常行为相似的空间特征及运动模式时,模型如果仅依赖空间特征进行学习,则很可能产生误判问题. 这会导致异常行为的预测误差值较小,进而造成模型对该异常行为的忽略. 当前大多数算法着重于分析空间内的局部特征,但是这些算法不完全适用于包含时间信息的视频序列处理[9 ,14 -15 ] . 为了更准确地捕捉异常行为,模型应该不仅限于空间局部特征的学习,而应深入研究同一目标随时间演变的动态特征. 此外,在现有的基于双流网络的研究中,多数方法利用单一卷积核提取外观或运动特征,难以捕捉不同尺度的高级特征,导致其对不同行为特征间局部空间纹理及运动轨迹细节不够敏感,进而削弱了模型对细微异常模式的判别能力[16 -17 ] . ...
Bidirectional skip-frame prediction for video anomaly detection with intra-domain disparity-driven attention
2
2026
... 当异常行为展现出与正常行为相似的空间特征及运动模式时,模型如果仅依赖空间特征进行学习,则很可能产生误判问题. 这会导致异常行为的预测误差值较小,进而造成模型对该异常行为的忽略. 当前大多数算法着重于分析空间内的局部特征,但是这些算法不完全适用于包含时间信息的视频序列处理[9 ,14 -15 ] . 为了更准确地捕捉异常行为,模型应该不仅限于空间局部特征的学习,而应深入研究同一目标随时间演变的动态特征. 此外,在现有的基于双流网络的研究中,多数方法利用单一卷积核提取外观或运动特征,难以捕捉不同尺度的高级特征,导致其对不同行为特征间局部空间纹理及运动轨迹细节不够敏感,进而削弱了模型对细微异常模式的判别能力[16 -17 ] . ...
... 基于预测的方法根据输入的视频帧序列来预测下一时刻的视频帧,并通过比较预测帧与真实帧之间的差异来检测异常行为. Liu等[8 ] 提出利用视频帧预测方法来进行异常检测. 为了更好地利用视频的上下文相关信息,Li等[16 ] 基于GAN设计具有上下文学习能力的多分支预测模型,该模型不仅从当前帧预测下一帧,而且利用后续视频帧反向预测先前帧,从而提高视频异常检测的准确性. Lyu等[15 ] 提出双向跳跃帧预测方法,通过2种域内差异注意力机制与不同的输入策略,实现了对复杂场景下异常行为的高效检测. 除了通常使用的强度约束和外观约束外,现有研究还关注运动约束. Lu等[12 ] 提出基于变分自动编码[23 ] 的新型顺序生成模型,利用ConvLSTM模块[24 ] 进行未来帧预测,在未来帧预测任务中保留了时间信息. 为了充分利用运动模式,Chen等[25 ] 提出双向预测框架,在前向传播和后向传播子网络中同步生成目标帧的双向预测结果,根据2个生成帧和目标帧之间的相似性度量结果,综合评估视频帧的异常程度. Sun等[26 ] 提出基于骨架运动增强的分层语义对比学习方法,引入对象级与场景级的对比学习策略,提升了模型的泛化能力. Liu等[27 ] 提出融合光流重建与帧预测的混合框架,基于前景目标聚焦的新思路,利用多级记忆模块学习正常运动模式,并引导异常光流来放大预测误差,从而实现对局部前景异常的精准检测. 尽管这些基于预测的方法能够有效学习视频的上下文信息,但是在正常特征的学习和运动变化特征的提取上表现较弱,缺乏对外观和运动特征更加有效的探索. ...
Multi-branch GAN-based abnormal events detection via context learning in surveillance videos
4
2023
... 当异常行为展现出与正常行为相似的空间特征及运动模式时,模型如果仅依赖空间特征进行学习,则很可能产生误判问题. 这会导致异常行为的预测误差值较小,进而造成模型对该异常行为的忽略. 当前大多数算法着重于分析空间内的局部特征,但是这些算法不完全适用于包含时间信息的视频序列处理[9 ,14 -15 ] . 为了更准确地捕捉异常行为,模型应该不仅限于空间局部特征的学习,而应深入研究同一目标随时间演变的动态特征. 此外,在现有的基于双流网络的研究中,多数方法利用单一卷积核提取外观或运动特征,难以捕捉不同尺度的高级特征,导致其对不同行为特征间局部空间纹理及运动轨迹细节不够敏感,进而削弱了模型对细微异常模式的判别能力[16 -17 ] . ...
... 基于预测的方法根据输入的视频帧序列来预测下一时刻的视频帧,并通过比较预测帧与真实帧之间的差异来检测异常行为. Liu等[8 ] 提出利用视频帧预测方法来进行异常检测. 为了更好地利用视频的上下文相关信息,Li等[16 ] 基于GAN设计具有上下文学习能力的多分支预测模型,该模型不仅从当前帧预测下一帧,而且利用后续视频帧反向预测先前帧,从而提高视频异常检测的准确性. Lyu等[15 ] 提出双向跳跃帧预测方法,通过2种域内差异注意力机制与不同的输入策略,实现了对复杂场景下异常行为的高效检测. 除了通常使用的强度约束和外观约束外,现有研究还关注运动约束. Lu等[12 ] 提出基于变分自动编码[23 ] 的新型顺序生成模型,利用ConvLSTM模块[24 ] 进行未来帧预测,在未来帧预测任务中保留了时间信息. 为了充分利用运动模式,Chen等[25 ] 提出双向预测框架,在前向传播和后向传播子网络中同步生成目标帧的双向预测结果,根据2个生成帧和目标帧之间的相似性度量结果,综合评估视频帧的异常程度. Sun等[26 ] 提出基于骨架运动增强的分层语义对比学习方法,引入对象级与场景级的对比学习策略,提升了模型的泛化能力. Liu等[27 ] 提出融合光流重建与帧预测的混合框架,基于前景目标聚焦的新思路,利用多级记忆模块学习正常运动模式,并引导异常光流来放大预测误差,从而实现对局部前景异常的精准检测. 尽管这些基于预测的方法能够有效学习视频的上下文信息,但是在正常特征的学习和运动变化特征的提取上表现较弱,缺乏对外观和运动特征更加有效的探索. ...
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
... Comparison of parameter count and processing speed of proposed method and selected advanced methods
Tab.5 方法 N p /MFPS/(帧·s−1 ) MemAE[1 ] 6.5 31 Li等[16 ] — 30 Liu等[8 ] 349.0 25 本研究 17.8 37
4. 结 语 提出基于多尺度外观运动融合的视频异常检测方法. 利用Inception模块代替单一卷积层,以提高模型兼容不同尺度特征的能力. 在此基础上设计运动外观语义特征融合模块,用于捕获各层的纹理细节特征,提高模型对输入数据的理解能力并有效融合外观与运动信息. 为了进一步强化特征判别性,引入混合注意力模块GLmix,通过结合Transformer的全局上下文建模能力和CNN的局部细节捕捉能力,有效地融合全局信息和局部信息. 在3个基准数据集上的实验结果证明了所提方法的有效性和优越性. 未来的研究将致力于增强网络对异常区域的特征聚焦能力,同时探索更多应用场景,并通过轻量化模型设计来提高网络的计算效率. ...
2
... 当异常行为展现出与正常行为相似的空间特征及运动模式时,模型如果仅依赖空间特征进行学习,则很可能产生误判问题. 这会导致异常行为的预测误差值较小,进而造成模型对该异常行为的忽略. 当前大多数算法着重于分析空间内的局部特征,但是这些算法不完全适用于包含时间信息的视频序列处理[9 ,14 -15 ] . 为了更准确地捕捉异常行为,模型应该不仅限于空间局部特征的学习,而应深入研究同一目标随时间演变的动态特征. 此外,在现有的基于双流网络的研究中,多数方法利用单一卷积核提取外观或运动特征,难以捕捉不同尺度的高级特征,导致其对不同行为特征间局部空间纹理及运动轨迹细节不够敏感,进而削弱了模型对细微异常模式的判别能力[16 -17 ] . ...
... 为了验证所提方法的有效性,分别在UCSD Ped2[30 ] 、CUHK Avenue[31 ] 和ShanghaiTech[17 ] 这3个基准VAD数据集上进行实验,其中正常和异常样本示例如图3 所示. ...
1
... 针对上述问题,提出基于多尺度外观运动融合的视频异常检测方法. 在编码阶段,首先使用基于Inception模块[18 ] 的双流编码器对外观和运动图像进行特征提取. 随后,为了有效融合不同粒度的特征,将不同尺度的特征输入运动外观语义特征融合模块. 将融合特征送入动态原型单元(dynamic prototype unit, DPU)模块[19 ] 中,生成原型动态池,并根据原型重建常态编码,从而扩大正常样本和异常样本之间的预测误差. 通过跳跃连接过程中的混合注意力机制,融合全局上下文信息与局部细节信息,以进一步增强模型对视频内容的分析能力. 最终在解码阶段,通过基于Inception模块的解码器预测未来帧,从而实现对异常行为的高性能检测. ...
2
... 针对上述问题,提出基于多尺度外观运动融合的视频异常检测方法. 在编码阶段,首先使用基于Inception模块[18 ] 的双流编码器对外观和运动图像进行特征提取. 随后,为了有效融合不同粒度的特征,将不同尺度的特征输入运动外观语义特征融合模块. 将融合特征送入动态原型单元(dynamic prototype unit, DPU)模块[19 ] 中,生成原型动态池,并根据原型重建常态编码,从而扩大正常样本和异常样本之间的预测误差. 通过跳跃连接过程中的混合注意力机制,融合全局上下文信息与局部细节信息,以进一步增强模型对视频内容的分析能力. 最终在解码阶段,通过基于Inception模块的解码器预测未来帧,从而实现对异常行为的高性能检测. ...
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
1
... 基于重建的方法通过自编码器学习数据的正常分布模式,对下一帧内容进行重构. 由于异常行为与训练数据的分布存在差异,模型对异常帧的重构会产生显著误差. 测试时计算重构误差,并将其作为异常得分;当得分超过预设阈值时,判定为异常事件. Hasan等[5 ] 提出基于卷积自编码器的视频异常检测方法,但是由于神经网络具有强大的泛化能力,有些异常行为可以被模型很好地重建,从而影响了异常检测的准确性. 为了应对过度泛化问题,Li等[20 ] 提出超像素掩码修复(superpixel masking and inpainting, SMAI)方法,在重构时对输入图像的部分区域进行掩码覆盖后再将图像送入网络中进行复原. 许多研究借助生成对抗网络(generative adversarial network, GAN)[21 ] ,以提升对正常事件的重建效果. 为了解决GAN固有的训练波动缺陷,Zaheer等[22 ] 利用同一生成器的当前状态和先前状态创建高质量和低质量的重建示例. 然而,这些基于重建的方法都只考虑到空间特征,忽略了视频帧之间的时序信息. 因此,当处理在时间上具有连续运动变化的正常和异常事件时,其重建能力均表现不佳. ...
Generative adversarial networks
1
2020
... 基于重建的方法通过自编码器学习数据的正常分布模式,对下一帧内容进行重构. 由于异常行为与训练数据的分布存在差异,模型对异常帧的重构会产生显著误差. 测试时计算重构误差,并将其作为异常得分;当得分超过预设阈值时,判定为异常事件. Hasan等[5 ] 提出基于卷积自编码器的视频异常检测方法,但是由于神经网络具有强大的泛化能力,有些异常行为可以被模型很好地重建,从而影响了异常检测的准确性. 为了应对过度泛化问题,Li等[20 ] 提出超像素掩码修复(superpixel masking and inpainting, SMAI)方法,在重构时对输入图像的部分区域进行掩码覆盖后再将图像送入网络中进行复原. 许多研究借助生成对抗网络(generative adversarial network, GAN)[21 ] ,以提升对正常事件的重建效果. 为了解决GAN固有的训练波动缺陷,Zaheer等[22 ] 利用同一生成器的当前状态和先前状态创建高质量和低质量的重建示例. 然而,这些基于重建的方法都只考虑到空间特征,忽略了视频帧之间的时序信息. 因此,当处理在时间上具有连续运动变化的正常和异常事件时,其重建能力均表现不佳. ...
Stabilizing adversarially learned one-class novelty detection using pseudo anomalies
1
2022
... 基于重建的方法通过自编码器学习数据的正常分布模式,对下一帧内容进行重构. 由于异常行为与训练数据的分布存在差异,模型对异常帧的重构会产生显著误差. 测试时计算重构误差,并将其作为异常得分;当得分超过预设阈值时,判定为异常事件. Hasan等[5 ] 提出基于卷积自编码器的视频异常检测方法,但是由于神经网络具有强大的泛化能力,有些异常行为可以被模型很好地重建,从而影响了异常检测的准确性. 为了应对过度泛化问题,Li等[20 ] 提出超像素掩码修复(superpixel masking and inpainting, SMAI)方法,在重构时对输入图像的部分区域进行掩码覆盖后再将图像送入网络中进行复原. 许多研究借助生成对抗网络(generative adversarial network, GAN)[21 ] ,以提升对正常事件的重建效果. 为了解决GAN固有的训练波动缺陷,Zaheer等[22 ] 利用同一生成器的当前状态和先前状态创建高质量和低质量的重建示例. 然而,这些基于重建的方法都只考虑到空间特征,忽略了视频帧之间的时序信息. 因此,当处理在时间上具有连续运动变化的正常和异常事件时,其重建能力均表现不佳. ...
Auto-encoding variational Bayes
1
2024
... 基于预测的方法根据输入的视频帧序列来预测下一时刻的视频帧,并通过比较预测帧与真实帧之间的差异来检测异常行为. Liu等[8 ] 提出利用视频帧预测方法来进行异常检测. 为了更好地利用视频的上下文相关信息,Li等[16 ] 基于GAN设计具有上下文学习能力的多分支预测模型,该模型不仅从当前帧预测下一帧,而且利用后续视频帧反向预测先前帧,从而提高视频异常检测的准确性. Lyu等[15 ] 提出双向跳跃帧预测方法,通过2种域内差异注意力机制与不同的输入策略,实现了对复杂场景下异常行为的高效检测. 除了通常使用的强度约束和外观约束外,现有研究还关注运动约束. Lu等[12 ] 提出基于变分自动编码[23 ] 的新型顺序生成模型,利用ConvLSTM模块[24 ] 进行未来帧预测,在未来帧预测任务中保留了时间信息. 为了充分利用运动模式,Chen等[25 ] 提出双向预测框架,在前向传播和后向传播子网络中同步生成目标帧的双向预测结果,根据2个生成帧和目标帧之间的相似性度量结果,综合评估视频帧的异常程度. Sun等[26 ] 提出基于骨架运动增强的分层语义对比学习方法,引入对象级与场景级的对比学习策略,提升了模型的泛化能力. Liu等[27 ] 提出融合光流重建与帧预测的混合框架,基于前景目标聚焦的新思路,利用多级记忆模块学习正常运动模式,并引导异常光流来放大预测误差,从而实现对局部前景异常的精准检测. 尽管这些基于预测的方法能够有效学习视频的上下文信息,但是在正常特征的学习和运动变化特征的提取上表现较弱,缺乏对外观和运动特征更加有效的探索. ...
1
... 基于预测的方法根据输入的视频帧序列来预测下一时刻的视频帧,并通过比较预测帧与真实帧之间的差异来检测异常行为. Liu等[8 ] 提出利用视频帧预测方法来进行异常检测. 为了更好地利用视频的上下文相关信息,Li等[16 ] 基于GAN设计具有上下文学习能力的多分支预测模型,该模型不仅从当前帧预测下一帧,而且利用后续视频帧反向预测先前帧,从而提高视频异常检测的准确性. Lyu等[15 ] 提出双向跳跃帧预测方法,通过2种域内差异注意力机制与不同的输入策略,实现了对复杂场景下异常行为的高效检测. 除了通常使用的强度约束和外观约束外,现有研究还关注运动约束. Lu等[12 ] 提出基于变分自动编码[23 ] 的新型顺序生成模型,利用ConvLSTM模块[24 ] 进行未来帧预测,在未来帧预测任务中保留了时间信息. 为了充分利用运动模式,Chen等[25 ] 提出双向预测框架,在前向传播和后向传播子网络中同步生成目标帧的双向预测结果,根据2个生成帧和目标帧之间的相似性度量结果,综合评估视频帧的异常程度. Sun等[26 ] 提出基于骨架运动增强的分层语义对比学习方法,引入对象级与场景级的对比学习策略,提升了模型的泛化能力. Liu等[27 ] 提出融合光流重建与帧预测的混合框架,基于前景目标聚焦的新思路,利用多级记忆模块学习正常运动模式,并引导异常光流来放大预测误差,从而实现对局部前景异常的精准检测. 尽管这些基于预测的方法能够有效学习视频的上下文信息,但是在正常特征的学习和运动变化特征的提取上表现较弱,缺乏对外观和运动特征更加有效的探索. ...
Anomaly detection in surveillance video based on bidirectional prediction
1
2020
... 基于预测的方法根据输入的视频帧序列来预测下一时刻的视频帧,并通过比较预测帧与真实帧之间的差异来检测异常行为. Liu等[8 ] 提出利用视频帧预测方法来进行异常检测. 为了更好地利用视频的上下文相关信息,Li等[16 ] 基于GAN设计具有上下文学习能力的多分支预测模型,该模型不仅从当前帧预测下一帧,而且利用后续视频帧反向预测先前帧,从而提高视频异常检测的准确性. Lyu等[15 ] 提出双向跳跃帧预测方法,通过2种域内差异注意力机制与不同的输入策略,实现了对复杂场景下异常行为的高效检测. 除了通常使用的强度约束和外观约束外,现有研究还关注运动约束. Lu等[12 ] 提出基于变分自动编码[23 ] 的新型顺序生成模型,利用ConvLSTM模块[24 ] 进行未来帧预测,在未来帧预测任务中保留了时间信息. 为了充分利用运动模式,Chen等[25 ] 提出双向预测框架,在前向传播和后向传播子网络中同步生成目标帧的双向预测结果,根据2个生成帧和目标帧之间的相似性度量结果,综合评估视频帧的异常程度. Sun等[26 ] 提出基于骨架运动增强的分层语义对比学习方法,引入对象级与场景级的对比学习策略,提升了模型的泛化能力. Liu等[27 ] 提出融合光流重建与帧预测的混合框架,基于前景目标聚焦的新思路,利用多级记忆模块学习正常运动模式,并引导异常光流来放大预测误差,从而实现对局部前景异常的精准检测. 尽管这些基于预测的方法能够有效学习视频的上下文信息,但是在正常特征的学习和运动变化特征的提取上表现较弱,缺乏对外观和运动特征更加有效的探索. ...
1
... 基于预测的方法根据输入的视频帧序列来预测下一时刻的视频帧,并通过比较预测帧与真实帧之间的差异来检测异常行为. Liu等[8 ] 提出利用视频帧预测方法来进行异常检测. 为了更好地利用视频的上下文相关信息,Li等[16 ] 基于GAN设计具有上下文学习能力的多分支预测模型,该模型不仅从当前帧预测下一帧,而且利用后续视频帧反向预测先前帧,从而提高视频异常检测的准确性. Lyu等[15 ] 提出双向跳跃帧预测方法,通过2种域内差异注意力机制与不同的输入策略,实现了对复杂场景下异常行为的高效检测. 除了通常使用的强度约束和外观约束外,现有研究还关注运动约束. Lu等[12 ] 提出基于变分自动编码[23 ] 的新型顺序生成模型,利用ConvLSTM模块[24 ] 进行未来帧预测,在未来帧预测任务中保留了时间信息. 为了充分利用运动模式,Chen等[25 ] 提出双向预测框架,在前向传播和后向传播子网络中同步生成目标帧的双向预测结果,根据2个生成帧和目标帧之间的相似性度量结果,综合评估视频帧的异常程度. Sun等[26 ] 提出基于骨架运动增强的分层语义对比学习方法,引入对象级与场景级的对比学习策略,提升了模型的泛化能力. Liu等[27 ] 提出融合光流重建与帧预测的混合框架,基于前景目标聚焦的新思路,利用多级记忆模块学习正常运动模式,并引导异常光流来放大预测误差,从而实现对局部前景异常的精准检测. 尽管这些基于预测的方法能够有效学习视频的上下文信息,但是在正常特征的学习和运动变化特征的提取上表现较弱,缺乏对外观和运动特征更加有效的探索. ...
1
... 基于预测的方法根据输入的视频帧序列来预测下一时刻的视频帧,并通过比较预测帧与真实帧之间的差异来检测异常行为. Liu等[8 ] 提出利用视频帧预测方法来进行异常检测. 为了更好地利用视频的上下文相关信息,Li等[16 ] 基于GAN设计具有上下文学习能力的多分支预测模型,该模型不仅从当前帧预测下一帧,而且利用后续视频帧反向预测先前帧,从而提高视频异常检测的准确性. Lyu等[15 ] 提出双向跳跃帧预测方法,通过2种域内差异注意力机制与不同的输入策略,实现了对复杂场景下异常行为的高效检测. 除了通常使用的强度约束和外观约束外,现有研究还关注运动约束. Lu等[12 ] 提出基于变分自动编码[23 ] 的新型顺序生成模型,利用ConvLSTM模块[24 ] 进行未来帧预测,在未来帧预测任务中保留了时间信息. 为了充分利用运动模式,Chen等[25 ] 提出双向预测框架,在前向传播和后向传播子网络中同步生成目标帧的双向预测结果,根据2个生成帧和目标帧之间的相似性度量结果,综合评估视频帧的异常程度. Sun等[26 ] 提出基于骨架运动增强的分层语义对比学习方法,引入对象级与场景级的对比学习策略,提升了模型的泛化能力. Liu等[27 ] 提出融合光流重建与帧预测的混合框架,基于前景目标聚焦的新思路,利用多级记忆模块学习正常运动模式,并引导异常光流来放大预测误差,从而实现对局部前景异常的精准检测. 尽管这些基于预测的方法能够有效学习视频的上下文信息,但是在正常特征的学习和运动变化特征的提取上表现较弱,缺乏对外观和运动特征更加有效的探索. ...
1
... 提出基于多尺度外观运动融合的视频异常检测方法,其框架如图1 所示. 首先,在训练阶段,以正常视频片段作为输入,通过FlowNet2光流估计网络[28 ] 提取对应的T −1幅光流图像,并将视频帧与光流分别输入外观编码器$ ({E_{\mathrm{a}}}) $ 与运动编码器$( {E_{\mathrm{m}}}) $ 网络中,以提取多尺度的外观与运动特征. 其次,将得到的2类特征送入运动外观语义特征融合(motion and appearance semantic feature fusion, MASFF)模块. 将融合特征送入DPU中,通过注意力生成、原型检索和编码聚合过程增强融合特征的表征,从而更有效地学习正常行为. 最后,在$ {E_{\mathrm{a}}} $ 和解码器$(D)$ 之间通过跳跃连接实现全局-局部混合自注意力(global-local mixed attention, GLmix)机制,融合全局上下文信息与局部细节信息,进而预测出下一时刻的未来帧. ...
Bidirectional spatio-temporal feature learning with multiscale evaluation for video anomaly detection
1
2022
... 在测试阶段,使用文献[29 ]中的异常评估法来计算真实帧I t 和预测帧$\hat {\boldsymbol{I}_t}$ 之间的误差值,并使用信噪峰值比(PSNR)计算预测帧在t 时刻的异常分数S (t ),计算公式为 ...
1
... 为了验证所提方法的有效性,分别在UCSD Ped2[30 ] 、CUHK Avenue[31 ] 和ShanghaiTech[17 ] 这3个基准VAD数据集上进行实验,其中正常和异常样本示例如图3 所示. ...
1
... 为了验证所提方法的有效性,分别在UCSD Ped2[30 ] 、CUHK Avenue[31 ] 和ShanghaiTech[17 ] 这3个基准VAD数据集上进行实验,其中正常和异常样本示例如图3 所示. ...
1
... 在预处理阶段,将每个视频帧的大小调整为256像素×256像素,并对每帧像素值进行归一化处理,使其分布在[−1, 1]内. 在模型的训练阶段,从训练集中获取5个连续的视频帧序列,以前4帧作为输入来预测第5帧. 在UCSD Ped2、CUHK Avenue和ShanghaiTech这3个数据集上都使用$\beta = 0.9$ 的Adam优化器,批量大小为2,分别进行60、60和10次迭代. 初始学习率设置为2×10−4 ,并使用余弦退火方法进行衰减[32 ] . 所有模型均使用PyTorch[33 ] 进行端到端训练. ...
1
... 在预处理阶段,将每个视频帧的大小调整为256像素×256像素,并对每帧像素值进行归一化处理,使其分布在[−1, 1]内. 在模型的训练阶段,从训练集中获取5个连续的视频帧序列,以前4帧作为输入来预测第5帧. 在UCSD Ped2、CUHK Avenue和ShanghaiTech这3个数据集上都使用$\beta = 0.9$ 的Adam优化器,批量大小为2,分别进行60、60和10次迭代. 初始学习率设置为2×10−4 ,并使用余弦退火方法进行衰减[32 ] . 所有模型均使用PyTorch[33 ] 进行端到端训练. ...
Hybrid attention and motion constraint for anomaly detection in crowded scenes
1
2023
... 与先前的研究[34 -35 ] 一致,使用帧级别的曲线下面积(area under curve, AUC)作为主要评价指标. 通过计算不同的异常分数阈值下受试者工作特征(receiver operating characteristic, ROC)曲线下面积来量化模型性能;AUC值越高,表明模型的异常检测性能越优. ...
Multi-encoder towards effective anomaly detection in videos
2
2020
... 与先前的研究[34 -35 ] 一致,使用帧级别的曲线下面积(area under curve, AUC)作为主要评价指标. 通过计算不同的异常分数阈值下受试者工作特征(receiver operating characteristic, ROC)曲线下面积来量化模型性能;AUC值越高,表明模型的异常检测性能越优. ...
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
1
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
Video anomaly detection and localization via Gaussian mixture fully convolutional variational autoencoder
1
2020
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
Video anomaly detection based on convolutional recurrent AutoEncoder
1
2022
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
1
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
Dual GroupGAN: an unsupervised four-competitor (2V2) approach for video anomaly detection
1
2024
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...
Appearance-motion united auto-encoder framework for video anomaly detection
1
2022
... Comparison of proposed method and advanced methods in terms of AUC metric
Tab.2 类型 方法 AUC/% Ped2 Avenue SHT 重建 MemAE[1 ] 94.1 83.3 71.2 Astrid等[36 ] 94.8 84.9 72.5 GMFC-VAE[37 ] 92.2 83.4 — CR-AE[38 ] 95.6 — 73.1 MESDnet[35 ] 95.6 86.3 73.2 预测 Park等[9 ] 97.0 88.5 70.5 Liu等[8 ] 95.4 85.1 72.8 MPN[19 ] 96.9 89.5 73.8 Conv-VRNN[12 ] 96.1 85.8 — FSCN[13 ] 92.8 85.5 — AMMC-Net[11 ] 96.6 86.6 73.7 Li等[16 ] 96.5 87.1 73.6 PDM-Net[39 ] 97.7 88.1 74.2 GroupGAN[40 ] 96.6 88.1 74.2 AMAE[41 ] 97.4 88.2 73.6 本研究 99.1 88.5 74.5
3.4. 可视化分析 3.4.1. 误差可视化 对3个数据集上的误差进行可视化,如图4 所示. 其中,异常事件所在区域以矩形框标出,误差图中较亮的颜色表示较大的误差. 如图4 (a)所示,UCSD Ped2数据集中视频帧的异常行为主要表现为局部运动偏离(如自行车误闯入人行道),异常区域在空间上占比较小. 实验结果表明,模型能够精准捕捉微小异常,对细节特征具有敏锐的捕捉能力. 如图4 (b)所示,对于CUHK Avenue数据集中不同大小的异常区域,模型均能够准确地检测并定位,证明了所提方法对多尺度异常的检测能力. 如图4 (c)所示,ShanghaiTech数据集包含多个不同场景,且异常行为的类型多样,但是模型依然表现出优异的异常检测性能,证明所提方法具有良好的泛化能力与场景鲁棒性. 总体而言,所提方法能够准确学习正常事件的外观和运动特征,从而对正常区域进行准确的预测,保持较低的预测误差;相比之下,对异常区域的预测误差相对较大. 通过分析预测结果并进行误差可视化,验证了所提方法能够准确定位异常事件的时空分布. ...