融合日志语义与图对抗学习的APT检测框架
Graph-adversarial learning framework integrating log semantics for APT detection
通讯作者:
收稿日期: 2025-07-21
| 基金资助: |
|
Received: 2025-07-21
| Fund supported: | 山东省泛在智能计算重点实验室开放基金资助. |
作者简介 About authors
刘慧雪(2000—),女,硕士生,从事物联网安全研究.orcid.org/0009-0006-8860-8927.E-mail:
高级持续性威胁(APT)给大规模多主机系统的安全检测带来严峻挑战,为此提出名为GE-APT的新型检测框架. 提取关键日志信息与特征,利用Sentence-BERT模型获取语义特征,通过自监督自编码器降维压缩. 基于系统实体及其交互构建系统溯源图,引入语义边特征以增强图结构表达能力. 为了在节点级别建模正常实体行为特征分布,引入改进的生成对抗网络进行对抗学习,以图注意力机制构建判别器以识别异常行为. GE-APT在数据集DARPA TC和OpTC上的精确率分别为90.91%和86.86%,在准确率、召回率和F1值等评估指标上亦优于现有典型检测方法. 实验结果验证了所提框架在APT攻击异常行为检测方面的有效性.
关键词:
Advanced persistent threats (APTs) pose significant challenges to the security detection of large-scale multi-host systems. To address these challenges, a novel detection framework named GE-APT was proposed. First, critical log information and features were extracted, and semantic representations were obtained using the Sentence-BERT model. A self-supervised autoencoder was then employed to compress and refine these high-dimensional semantic features. Subsequently, a system provenance graph was constructed based on system entities and their interactions, with semantic edge features introduced to enhance the expressive power of the graph structure. To model the distribution of normal behavioral patterns at the node level, an improved generative adversarial network was adopted for adversarial learning, while the discriminator was designed using a graph attention mechanism to effectively identify anomalous activities. Finally, GE-APT achieved precision rates of 90.91% and 86.86% on datasets DARPA TC and OpTC, respectively, and outperformed existing typical detection methods in accuracy, recall, F1-score, and other metrics. These results validate the effectiveness of the proposed framework in detecting anomalous behaviors associated with APT attacks.
Keywords:
本文引用格式
刘慧雪, 刘新倩, 王帅, 赵川, 丁建国.
LIU Huixue, LIU Xinqian, WANG Shuai, ZHAO Chuan, DING Jianguo.
本研究提出面向大规模多主机场景的APT攻击检测方法GE-APT,通过 Sentence-BERT [10](SBERT)方法对日志信息进行语义嵌入[11-14],作为溯源图的边特征,以增强图的语义表达能力;引入改进的对抗学习机制,生成器GAN[15]随机插入伪造边的特征和类型,判别器EGAT(edge-featured graph attention network)[16]通过图注意力机制识别真伪,在极端不平衡数据集上有效提升异常检测能力. 本研究1) 提出融合日志语义的溯源图构建方法,通过将命令、参数、路径等上下文编码为边特征,显著增强图的表达能力,提升对隐蔽异常的感知;2) 设计有向 EGAT 模型,应用于系统入侵检测,准确建模事件间的因果依赖,实现语义与结构特征的协同传播;3) 引入基于 GAN 的伪造交互机制,在缺乏异常样本的情况下,通过生成“似真”正常行为增强判别器对细微异常的敏感度,提高检测鲁棒性.
1. 相关工作
基于异常的APT检测通过建模正常行为来识别偏离行为,不依赖预定义规则. 早期方法基于系统调用序列,例如,Forrest等[31]使用滑动窗口建模正常进程行为,但这种方法易被规避. 为了解决传统的基于序列的方法的弱点,研究转向溯源图分析:Manzoor等[32]提出StreamSpot检测系统,基于图流在线检测动态图中的异常行为. Han等[33]提出APT检测系统Unicorn,进一步提出基于WL图核的方法来提取整个图的特征,学习进化模型来检测异常图. 图核方法虽可度量图相似性,但难以发现隐蔽威胁. 随着图神经网络的发展,研究转向节点级异常检测,以识别图中的异常节点. Wang等[8]提出THREATRACE检测系统,通过建立多层图神经网络模型并使用子模型来提取隐式节点标签. Jia等[34]提出的MAGIC检测系统采用新颖的图掩蔽自编码器学习图数据的内在结构和模式. 这些方法虽然能够在节点级别进行异常检测,但忽视了日志语义特征在系统事件特征总结任务中的重要性. 本研究提出增加日志语义特征的溯源图对抗学习APT检测模型,更好学习到实体间调用关系.
2. 动机实例
图 1
3. 系统模型
如图2所示为GE-APT的完整结构,总体框架包括5个阶段. 1)数据预处理:重点关注系统日志信息本身,提取日志关键信息,并将数据集分割为训练集与测试集. 2)日志语义信息提取:在日志关键信息中提取日志的语义信息,使用自编码器进一步压缩日志的语义特征. 3)构建溯源图:根据系统日志构建溯源图,将系统日志语义特征设置为边特征. 4)对抗学习:使用改进的GAN模型对抗学习图中良性节点的特征. 5)检测:训练得到的神经网络模型用于最终的网络入侵检测.
图 2
图 2 融合日志语义与图对抗学习的APT检测框架结构
Fig.2 Architecture of graph-adversarial learning framework integrating log semantics for APT detection
3.1. 数据预处理
先前经验表明,文本处理技术是提升学习效果的关键技术,因此数据预处理对最终检测的效果至关重要. 系统日志通常包含大量冗余特征,例如,在OpTC数据集中,共有约 58 个关键字段,但单条日志记录中通常仅包含其中的 16 个左右,不会覆盖全部字段. 数据预处理包括以下步骤.
1)删除不必要的特征. 在ecar文件的58个关键字中,只保留约28个关键字. 如表1所示为本研究保留的关键字.
表 1 本研究的保留关键字
Tab.1
| 序号 | 关键字 | 序号 | 关键字 | |
| 1 | Action | 15 | Parent_image_path | |
| 2 | Commend_line | 16 | Path | |
| 3 | Dest_ip | 17 | Principal | |
| 4 | Dest_port | 18 | Requesting_domain | |
| 5 | Direction | 19 | Requesting_logon_id | |
| 6 | File_path | 20 | Requesting_user | |
| 7 | Image_path | 21 | Sid | |
| 8 | Info_class | 22 | Task_name | |
| 9 | Key | 23 | Type | |
| 10 | 14protocol | 24 | User | |
| 11 | Logon_id | 25 | User_name | |
| 12 | Module_path | 26 | Value | |
| 13 | New_path | 27 | Start_time | |
| 14 | Object | 28 | End_time |
2)增加功能前缀. 某些术语可能具有特定含义,具体取决于与之相关的功能. 对于具有特殊意义的端口号,本研究使用其功能代替其端口号. 如443端口为HTTPS协议,因此使用HTTPS代替443端口. 若端口号无特殊含义,则使用PORT_端口号来代表.
3)路径文件名提取. 在共同项中,文件路径和注册表键值可能会因包含特定机器的目录集而出现不同的路径. 例如不同机器的相同可执行文件“a.exe”产生的不同目录. 为了纠正这种情况,这类路径将简化为只有文件名,同样,在接续命令行输入时,只保留执行程序的名称,去掉完整路径的任何参数.
4)临时端口处理. 在网络中,用于外发网络流量的端口通常是从有效端口范围的高端随意选择的,这些端口号没有任何实际意义,因此使用通用字段EPHEMERAL_PORT代替.
5)数据对齐. 考虑到部分字段可能存在缺失或为空的情况,为了保证特征矩阵结构的完整性,日志特征中的空字段将统一使用占位符NULL进行替换.
3.2. 日志语义信息提取与分析
3.2.1. 日志语义信息提取
在异常检测任务中,日志数据通常以半结构化的JSON格式记录,包含多个字段,每个字段描述一次系统操作的不同方面. 与传统的自然语言日志不同,JSON格式日志没有连续的文本描述,而是由一系列键值对组成,描述一次系统操作的详细信息. 键(如“action”,“objext”)本身并不携带可学习的语义信息,为此采用直接拼接键值对的值作为输入,以最大程度保留日志的语义信息,同时规避不必要的额外处理步骤. 对于每条日志,先按照固定字段顺序进行数据对齐,确保不同日志样本的字段顺序一致,再凭借所有字段的值形成输入序列,表达式为
其中vj为第j个字段的值. 在日志结构化与字段预处理完成后,为了获取每条日志的语义信息,将Si视为自然语言句子,采用SBERT模型提取高质量的句子级语义向量,输出结果为单条日志的语义信息,表达式为
其中fi为第i条日志经过SBERT模型得到的维度为d的语义特征,作为边的特征,
3.2.2. 日志语义特征降维
SBERT 输出的语义向量维度过高,会在后续的对抗学习任务中增加计算开销,因此引入自编码器,在保证关键信息完整的前提下,对这些向量进行高效压缩. 如图3所示为自编码器模型结构. 自编码器采用编码器-解码器架构,其中编码器将高维输入映射到低维潜在空间,解码器对输入进行重构,以最小化重构误差. 编码器结构由3层全连接神经网络组成,且在每一层隐藏层后都使用ReLU激活函数进行非线性变化,最终得到降维后的嵌入向量H,供后续溯源图构建和异常检测模块使用. 解码器结构采用与编码器对称的3层全连接神经网络,将潜在表示H还原为原始输入. 解码器的输出为原始输入的重构版本,训练目标是尽可能减小重构误差. 为了均衡降维与重构过程的有效性,训练过程中采用均方误差损失函数作为优化目标,使得重构向量与原始输入尽可能接近. 该损失函数定义式为
图 3
式中:
3.3. 构建溯源图
在构建溯源图的过程中,采取边阈值的策略,即当边数累积达到预设的阈值SS时,结束该周期溯源图的绘制. 构建图结构
3.3.1. 节点特征
网络实体之间的交互往往解释了特定的行为模式,通过分析这些交互的类型和频率,可以为区分正常行为和异常行为提供关键信息[8]. 例如,用户突然与大量外部IP地址建立连接,这很可能是恶意活动的迹象. 实体交互类型数量的分布可以提供相对丰富的特征集,不同的交互类型(如HTTP请求、HTTP连接、文件传输等)可反应网络活动的不同方面. 为了刻画不同交互类型的分布特征对节点的影响,将统计每个节点在入度和出度边上的交互类型信息,记为节点特征L(v). 先计算不同交互类型的数量M,并将边的类型映射函数设为Me:
式中:In(v)为节点v的入边,Out(v)为节点v的出边.
3.3.2. 边特征
传统方法往往只考虑节点的属性或日志的序列关系,很少使用将日志文本直接嵌入到边上的方法. 将日志文本直接嵌入到边上的方法可以直接充分保留日志中的上下文和语义信息. 这使得图结构不仅能够反映实体之间的连接关系,还能刻画日志事件的具体内容,有助于捕捉细微的异常. 在GE-APT中,每条日志条目通过SBERT编码为密集向量表示,并使用自编码器嵌入向量进行进一步的压缩,得到最终的边特征. 经过编码器降维后的32维潜在表示作为溯源图的边特征输入,与节点度信息共同构成溯源图的原始特征集合.
3.4. 改进的生成对抗网络模型
由于APT攻击的特性和实际发生频率较低,APT攻击检测的数据集中通常存在显著的类别不平衡问题. 具体而言,正常行为的数据量往往远超异常(攻击)行为的数据量. 例如,根据文献[35],在实际收集到的日志数据中,仅有约0.001 6%的数据属于潜在的APT攻击事件,这种不平衡性对基于深度学习模型的攻击检测方法构成挑战,因为大多数机器学习算法在处理不平衡数据时偏向多数类样本,可能导致对少数类(APT攻击事件)的漏检率增加. 本研究引入生成对抗网络对抗生成攻击操作,并使用判别器检测异常操作. 生成对抗网络内涵盖2个相互对抗的网络:生成器和判别器. 生成器将在真实样本中学习到系统各个实体间交互的特点及单个系统操作的特征,并根据观测到的系统操作特征产生伪造的实体间的交互及操作. 判别器的输出为概率值,数值越高证明系统操作为真的概率越大. 在2个网络相互博弈竞争的同时,为了保证算法的有效性,引入注意力机制和损失函数持续优化自身特征,达到预期的重建水平. 在训练阶段,单一模型在测试过程中存在较高的误报率,为此采用多模型集成策略. 当某节点在多个模型中均被识别为异常时,判定该节点为异常节点,降低模型的误报率. 详细的神经网络结构如图4所示.
图 4
图 4 改进的对抗学习模型训练过程
Fig.4 Training process of improved adversarial learning model
3.4.1. 生成器设计
本研究设计用于图数据生成的生成器模型,旨在在对抗学习框架下,学习生成伪造边特征与边类型,以模拟真实图中可能存在的边连接属性. 该模型接受2组不同维度的随机输入向量,分别对应于边特征生成和边类型生成,输出一组连续型的边特征以及一组离散的边类型预测. 具体而言,所设计生成器包含2个子网络,分别用于生成边特征和边类型分布. 其中边特征生成模块用于生成连续型边特征向量,采用2层全连接神经网络加非线性激活函数实现;边类型生成模块用于输出边的类型分布,同样采用2层全连接网络,使用argmax函数实现离散化.
生成器的目标是学习并模拟真实边特征与类型的分布,生成具有高度伪装性的伪造系统行为,使得判别器难以区分其与真实数据的差异. 在生成边特征与边类型后,系统基于这些伪造边信息对图结构进行重构,得到包含伪造交互行为的溯源图. 训练过程中,生成器通过二元交叉熵损失作为生成器的损失函数,以提升伪造样本对判别器的欺骗能力,进而提升整体模型在结构扰动下的异常检测性能. 二元交叉熵损失函数定义式为
式中:
3.4.2. 判别器设计
为了在对抗学习框架中实现高效、稳定的异常节点判别,将所设计判别器在原始EGAT模型的基础上进行结构优化,提出轻量级的2层EGAT判别器. 该判别器完全基于EGAT结构,采用2层堆叠的图注意力传播模块,旨在保持判别性能的前提下降低模型的复杂度、提升训练稳定性,并减少对超参数敏感性的依赖. 与原始的EGAT模型不同,为了完成分类,后者在2层EGAT后引入合并层Merge Layer(融合多个语义层的边融合节点特征),最后为全连接层. 简化结构在2层EGAT网络后不再进行融合以提高模型在更多的数据中训练的速度,最后加入一层全连接层,令每个节点在传播完成后输出标量,作为器异常打分的回归值. 具体而言,给定节点特征矩阵X和边特征矩阵E,简化模型的判别流程为
其中EGATConv1与EGATConv2分别表示2层EGAT图注意力传播模块,输出
式中:
在判别器的训练阶段,目标是通过最小化交叉熵损失来区分真实样本和生成样本. 判别器的总损失为
式中:N为一次训练中样本的数量,D(x)为判别器对真实样本x的威胁评分,D(G(zi))为判别器对生成样本的威胁评分.
3.5. 检测阶段
在检测阶段,模型利用EGAT获取节点威胁评分,对APT攻击行为进行判别,引入多模型并行验证机制以降低误报率. 具体而言,为了充分挖掘良性系统实体的多维行为特征,训练阶段从数据集中抽取部分样本,训练多个GAN模型. 在实际检测过程中,若某节点在全部GAN模型中均被判定为异常,则视其为高风险目标,并直接触发告警. 该机制在提高检测准确性的同时,能够有效缓解因单一模型偏差带来的误判问题.
4. 实验与评估
4.1. 实验指标
异常检测模型在评估建议方法的表现时使用以下指标[8]. 准确率Acc:正确预测在预测总数中所占的比例,
精确率P:衡量模型在所有预测的阳性中正确预测阳性的精确度,
召回率R:衡量模型在所有实际的阳性中预测出多少真正的阳性,
F1分数:用于平衡准确率和召回率的函数,
误报率FPR:衡量模型假阳性占所有实际负例比例的指标,
式中: TP为异常节点被检测为异常节点, FP为正常节点被检测为异常节点, TN为正常节点被检测为正常节点, FN为异常节点被检测为正常节点.
4.2. 数据集
4.2.1. OpTC数据集
美国国防部高级研究计划局(DARPA)于 2021 年发布的 OpTC(operationally transparent cyber)数据集[36]是先进的APT检测数据集,包含10天内超过170亿条主机与网络事件,前7天为正常日志,后3天包含红队多阶段攻击,具有规模大、类型丰富、覆盖面广等优点[37]. 本研究选取其中201~204号共4台主机的日志进行实验:以前7天的正常日志作为训练数据,后3天含攻击的日志用于测试. 201和203主机在攻击期间被入侵,202和204保持正常. 根据红队提供的攻击标注,若某节点为恶意,则其所有可达节点均视为异常. 训练集用于学习正常行为模式,测试集用于验证模型对APT攻击异常行为的检测能力,数据集划分情况如表2所示. 选择这4台主机的原因:1)它们在攻击链中扮演关键角色,日志覆盖攻击准备、初始入侵到横向移动等完整阶段,具有代表性;2)日志记录完整,便于追踪攻击路径;3)全量数据计算开销大,选取子集可在保证实验完整性的同时提升可行性.
表 2 OpTC 数据子集划分情况
Tab.2
| 数据子集 | 日志数 | 边数 | 节点数 |
| 训练集 | 113 750 000 | 113 750 000 | 8 620 780 |
| 测试集 | 8 999 694 | 8 999 694 | 1 334 377 |
4.2.2. DARPA TC数据集
DARPA TC数据集由DARPA透明计算项目在第三次红蓝交战中生成,持续2周,系统溯源数据全程完整采集. 各团队负责收集多平台的良性与恶意行为数据. 本研究选用其中2个典型子集:CADETS与TRACE. CADETS来自桌面主机,用户行为规律,适合验证模型在日常环境中的检测性能;TRACE来自服务器环境,交互复杂,更贴近高并发实际场景. 如表3所示,2个子集在运行环境、数据规模和攻击复杂度方面存在明显差异,能够从不同角度验证所提方法对APT攻击异常行为的检测能力. 在这2个子集中开展实验,可全面评估模型的准确性、鲁棒性与泛化能力.
表 3 DARPA TC数据子集的基本信息
Tab.3
| 数据子集 | 运行系统 | 异常节点数 | 边数量 |
| CADETS | FreeBSD | 12 852 | 8 663 569 |
| TRACE | Ubuntu | 67 383 | 22 161 538 |
4.3. 实验结果
实验使用Windows11操作系统,CPU为 Intel i9-13900H,内存16 GB,执行环境是Python3.11.
4.3.1. 模型检测结果
为了更贴近实际应用场景,将OpTC数据集按时间顺序划分为多个溯源图,每个图反映系统在特定时间段内的行为活动. 在划分过程中,根据时间窗口切分日志,并基于事件之间的因果关系构建相应的溯源图. 如表4所示,不同时段系统活动频率存在差异,划分得到的数据集在规模上有所不同,表格中每一行均对应一个按时间构建的溯源图. GE-APT在OpTC测试集上的性能评估实验结果如表5所示. 可以看出,在多个实验数据集中,GE-APT依然保持较好的检测性能. 结果表明,所提方法在不同时间段的溯源图中均能维持较低的漏报率,展现出优异的攻击节点检测能力以及跨时间段的鲁棒性. 然而,在分集4的异常节点检测中,检测效果相较于其他数据集略有下降. 经过分析发现,该部分数据集中异常节点的比例约为7%,显著高于其他部分数据集. 因此推测,该数据集中异常节点与正常节点之间的类别分布失衡,是导致其检测性能略低的主要原因.
表 4 OpTC测试集信息
Tab.4
| 测试集 | 日志数 | 边数 | 节点数 | 良性节点个数 | 异常节点个数 |
| 全集 | |||||
| 分集1 | |||||
| 分集2 | |||||
| 分集3 | 556 | ||||
| 分集4 | |||||
| 分集5 | |||||
| 分集6 | |||||
| 分集7 | 799 |
表 5 所提框架在OpTC不同测试集上的评估结果
Tab.5
| 测试集 | P | R | F1 | FPR |
| 全集 | 86.86 | 93.25 | 89.94 | 0.28 |
| 分集1 | 92.57 | 87.97 | 90.21 | 0.09 |
| 分集2 | 93.88 | 92.00 | 92.93 | 0.10 |
| 分集3 | 94.89 | 96.94 | 95.91 | 0.21 |
| 分集4 | 82.24 | 96.61 | 88.91 | 1.50 |
| 分集5 | 93.68 | 87.66 | 90.57 | 0.06 |
| 分集6 | 96.95 | 89.75 | 93.21 | 0.01 |
| 分集7 | 81.72 | 93.99 | 87.43 | 0.10 |
GE-APT在DARPA TC数据集的检测结果如表6所示. 可以看出,所提方法在2个场景下均表现出优异的检测性能. 在CADETS场景中, F1 =94.52%,P=90.91%;在TRACE场景中, F1=91.56%,P= 85.26%,但两者的误报率均未超过 0.20%. 分析GE-APT在2个场景中出现性能差异的主要原因:TRACE场景的正常行为模式更为复杂,部分良性操作在语义与结构特征上与攻击行为高度相似,导致判别器产生更多误报.
表 6 所提框架在DARPA TC数据集上的评估结果
Tab.6
| 数据集 | Acc | P | R | F1 | FPR |
| CADETS | 99.806 | 90.91 | 98.42 | 94.52 | 0.18 |
| TRACE | 99.800 | 85.26 | 98.87 | 91.56 | 0.15 |
4.3.2. 消融实验
由于 DARPA TC 数据集存在日志稀疏性和语义完整性不足问题,消融实验主要在数据更丰富、结构更完整的OpTC 数据集上进行,以确保分析的可靠性. GE-APT主要由日志语义特征、系统实体交互频率以及对抗学习机制构成,设计模块消融实验分别移除构成模块,以此评估各模块对模型整体性能的贡献. 具体设置如下:模型1去除实体交互特征;模型2去除日志语义特征;模型3不引入对抗学习机制,即仅采用EGAT模型;模型4为完整的模型,消融实验结果如表7所示. 由于数据中异常样本比例约为0.1%,在这种高度不平衡场景下,即便召回率保持在较高水平,只要FPR略有上升,就会因负类数量占据主导而显著拉低精确率. 实验结果表明,系统中任一模块的缺失都会在不同程度上削弱检测性能. 当缺少实体交互频率特征或对抗学习机制时,漏报率显著上升,说明恶意行为在实体交互模式上与正常行为存在明显差异. 对抗学习机制持续建模良性节点的行为特征,能够更有效地识别潜在的恶意行为,显著提升系统的检测能力. 在去除日志语义特征的情况下,召回率明显下降,意味着系统预测为恶意的节点中,真实恶意节点的比例减少,导致误报率上升. 当不使用对抗学习机制、仅依赖EGAT模型进行异常检测时,也出现误报率上升的现象. 综上所述,GE-APT的3个构成模块在系统中均发挥了重要作用.
表 7 模块消融实验结果
Tab.7
| 模型 | Acc | P | F1 | R | FPR |
| 1 | 82.04 | 8.09 | 14.69 | 80.22 | 1.19 |
| 2 | 80.94 | 6.52 | 11.87 | 66.59 | 18.78 |
| 3 | 80.64 | 7.26 | 13.27 | 76.87 | 19.29 |
| 4 | 99.60 | 86.86 | 89.94 | 93.25 | 0.28 |
4.3.3. 判别器对照实验
为了评估不同图神经网络判别器在GE-APT中的表现差异,设计判别器对照实验,选取 GCN、GAT 以及 EGAT(神经网络层=1)模型进行对比,实验结果如表8所示. 这3种模型在结构建模能力上由浅入深. GCN 通过邻居特征的均值聚合实现基本的图表征,对所有邻居节点赋予相同权重,无法区分不同邻居对目标节点的重要性. GAT 引入注意力机制,能够根据邻居节点的特征动态调整聚合权重,增强对邻居节点影响力的区分能力,较 GCN 更加灵活. EGAT 在结构上进一步扩展,引入边感知注意力机制,通过边感知注意力机制建模更丰富的图语义关系,将边特征作为注意力权重计算的重要组成部分. 该对照实验全面比较了不同图神经网络结构在GE-APT的异常检测性能,突出了所提异常检测方法在检测精度与建模能力方面的优势.
表 8 判别器对照实验结果
Tab.8
| 模型 | Acc | P | F1 | R | FPR |
| GCN | 90.0 | 15 | 24.7 | 82.7 | 9.57 |
| GAT | 96.9 | 35 | 47.0 | 71.9 | 2.63 |
| EGAT(K=1) | 99.4 | 86 | 85.9 | 86.5 | 0.30 |
| EGAT(K=2) | 99.6 | 90 | 89.9 | 93.0 | 0.28 |
4.3.4. 主流的APT检测方法
MEGR-APT[38]是可扩展的APT入侵检测系统,核心思路是通过匹配网络威胁情报报告中发布的攻击场景对应的可疑子图来实现威胁检测. LogShield[39]是基于日志语义特征的APT入侵检测方法,主要在日志级别进行异常识别. OC-DHetGNN[40]是无监督检测方法,它在节点与边级别构建异构溯源图,实现APT入侵检测. 罗汉新等 [41]提出基于 K-means 的异常检测方法,该方法基于图结构为节点构建特征表示,利用 K-means 算法对节点进行聚类分析. THREATRACE[8] 是基于溯源图的主机级 APT 检测方法,通过 GraphSAGE 学习节点角色并在实体级别识别异常,能够在无监督场景下实现早期入侵检测. 不同方法在2个数据集中的评估指标对比结果分别如表9和表10所示.
表 9 不同检测方法在DARPA TC数据集上的性能对比
Tab.9
| 方法 | CADETS子集 | TRACE子集 | |||||||
| P | R | F1 | FPR | P | R | F1 | FPR | ||
| GE-APT | 90.91 | 98.42 | 94.52 | 0.18 | 85.26 | 98.87 | 91.56 | 0.15 | |
| 文献[41] | 88.00 | 99.00 | 93.50 | — | 67.00 | 99.00 | 80.00 | — | |
| THREATRACE | 90.00 | 99.00 | 83.00 | 0.20 | 72.00 | 99.00 | 83.00 | 0.20 | |
表 10 不同检测方法在OpTC数据集上的性能对比
Tab.10
MEGR-APT以图级别方式计算准确性指标,难以以细粒度全面反映检测系统在面对复杂攻击时的真实效能表现. LogShield仅依赖日志语义特征进行异常检测,存在上下文缺失、行为链无法还原、泛化能力弱以及易受对抗样本干扰等缺点. GE-APT在大规模、具有真实系统复杂性的日志数据上进行训练与验证,在高噪声、多样化的海量日志环境中,仍能保持稳健的检测能力,体现了更强的可扩展性与实际部署潜力. 更重要的是,GE-APT能够聚焦攻击检测的细粒度环节,通过精准捕捉关键特征和局部行为模式,为安全分析人员提供详尽的攻击上下文信息,有效支持攻击源定位与攻击路径推演,为实施精准防御策略提供有力支撑. 本研究使用的数据集包含复杂的攻击场景,实验结果表明,面对复杂攻击时,GE-APT表现出更强的灵活性与适应性,能够根据不同攻击类型特性进行动态调整与优化,在保证一定检测准确性的同时,有效提升系统对多样化攻击的覆盖能力,为构建全面、可靠的网络安全防护体系提供了新的思路.
5. 结 语
本研究提出融合日志语义信息与图对抗学习的APT攻击检测模型 GE-APT. 该模型整体基于自监督对抗学习框架,通过深入挖掘系统中良性实体的行为模式,将 APT 攻击检测任务转化为恶意节点识别问题,实现对攻击行为的节点级精准检测. 在日志语义信息提取阶段,对溯源图中的边信息进行补充和完善,增强了图结构的表达能力,为后续图神经网络的学习提供了更丰富的语义支持. 针对 APT 数据集中常见的类别不平衡问题,引入对抗学习策略,在生成器与判别器的博弈过程中有效提升了模型对少数类样本(潜在攻击行为)的识别能力. 在图学习阶段,采用改进的 EGAT模型,进一步优化图注意力机制,使得模型能够更高效地捕捉系统实体之间的复杂交互关系,提升整体检测性能. 性能对比实验结果表明,GE-APT 显著优于现有主流方法的检测效果. 该模型不仅能够准确识别与恶意活动相关的关键系统实体,在保持高检测率的同时显著降低了误报率,具备良好的实用性与推广潜力,为真实企业环境下的 APT 检测提供了有效的技术手段. GE-APT仍存在一定局限性:1)模型主要基于离线溯源图进行训练与检测,尚未充分考虑大规模动态系统环境下的实时检测需求;2)对抗学习过程会增加模型训练开销,在超大规模溯源图场景中的计算效率仍有优化空间. 当前模型主要利用日志语义信息和图结构信息进行异常检测,对多源安全数据的融合利用仍有待深入研究. 未来将围绕在线APT检测、多源异构数据融合以及轻量化模型设计等方向开展进一步研究,以提升模型在真实复杂网络环境中的适用性与泛化能力.
参考文献
RT-APT: a real-time APT anomaly detection method for large-scale provenance graph
[J].DOI:10.1016/j.jnca.2024.104036 [本文引用: 1]
Provenance-based intrusion detection systems: a survey
[J].
HitAnomaly: hierarchical transformers for anomaly detection in system log
[J].
AJSAGE: a intrusion detection scheme based on jump-knowledge connection to GraphSAGE
[J].DOI:10.1016/j.cose.2024.104263 [本文引用: 1]
ProcSAGE: an efficient host threat detection method based on graph representation learning
[J].DOI:10.1186/s42400-024-00240-w
THREATRACE: detecting and tracing host-based threats in node level through provenance graph learning
[J].DOI:10.1109/TIFS.2022.3208815 [本文引用: 4]
基于溯源图和注意力机制的APT攻击检测模型构建
[J].
Construction of advanced persistent threat attack detection model based on provenance graph and attention mechanism
[J].
Optimizing SBERT for long text clustering: two novel approaches with empirical insights
[J].DOI:10.1007/s11227-025-07414-4 [本文引用: 1]
LLM-based embeddings for clustering and predicting integrated reporting quality levels of companies
[J].DOI:10.1007/s10791-025-09590-6
Automated essay scoring with SBERT embeddings and LSTM-Attention networks
[J].DOI:10.7717/peerj-cs.2634 [本文引用: 1]
GSRDR-GAN: global search result diversification ranking approach based on multi-head self-attention and GAN
[J].DOI:10.1016/j.neucom.2025.130723 [本文引用: 1]
EGRET: edge aggregated graph attention networks and transfer learning improve protein–protein interaction site prediction
[J].DOI:10.1093/bib/bbab578 [本文引用: 1]
ML-based intrusion detection system for precise APT cyber-clustering
[J].DOI:10.1016/j.cose.2024.104209
A hierarchical approach for advanced persistent threat detection with attention-based graph neural networks
[J].
PDCleaner: a multi-view collaborative data compression method for provenance graph-based APT detection systems
[J].DOI:10.1016/j.cose.2025.104359 [本文引用: 1]
基于APT活动全生命周期的攻击与检测综述
[J].
Survey of attack and detection based on the full life cycle of APT
[J].
PARGMF: a provenance-enabled automated rule generation and matching framework with multi-level attack description model
[J].DOI:10.1016/j.jisa.2023.103682 [本文引用: 1]
MEGR-APT: a memory-efficient APT hunting system based on attack representation learning
[J].DOI:10.1109/TIFS.2024.3396390 [本文引用: 2]
/
| 〈 |
|
〉 |

