浙江大学学报(工学版), 2026, 60(8): 1809-1818 doi: 10.3785/j.issn.1008-973X.2026.08.020

计算机技术

基于核心实体与局部子图的知识图谱增量更新方法

彭商濂,, 娄颖, 冯丽

1. 成都信息工程大学 计算机学院,四川 成都 610225

2. 浙江外国语学院 国际商学院,浙江 杭州 310012

Incremental update method for knowledge graphs based on core entities and local subgraphs

PENG Shanglian,, LOU Ying, FENG Li

1. School of Computer Science, Chengdu University of Information Technology, Chengdu 610225, China

2. School of International Business, Zhejiang International Studies University, Hangzhou 310012, China

收稿日期: 2025-07-28  

基金资助: 国家社科基金资助项目(24XTQ005);四川省科技厅重点研发项目(2023YFG0144);成都信息工程大学创新创业训练计划项目(202410621153,X202510621154).

Received: 2025-07-28  

Fund supported: 国家社科基金资助项目(24XTQ005);四川省科技厅重点研发项目(2023YFG0144);成都信息工程大学创新创业训练计划项目(202410621153,X202510621154).

作者简介 About authors

彭商濂(1980—),男,讲师,博士,从事人工智能、数据管理、知识图谱及物联网技术研究.orcid.org/0000-0003-0696-5682.E-mail:psl@cuit.edu.cn , E-mail:psl@cuit.edu.cn

摘要

现有知识图谱更新方法存在计算开销大、更新延迟高以及一致性难以保障等问题,限制了该方法在大规模动态场景下的应用,为此提出基于核心实体加局部子图概念的增量更新方法. 以实体的度中心性与业务访问频次加权融合设计加权中心指标,选取得分最高的前K个实体作为核心实体,使更新过程聚焦于对下游任务最具价值的节点. 通过k跳邻域扩展与边权阈值筛选,从原图谱中抽取与核心实体相关的局部子图,将更新范围限定于语义相关结构以降低冗余计算. 在模型优化阶段,构建结合预训练嵌入微调的局部优化损失函数,引入邻域稳定性正则项以有效抑制增量更新引起的嵌入漂移,结合 Schema 约束与多源置信度融合策略,确保更新结果的一致性与可靠性. 在大规模知识图谱数据集上的实验结果表明,与全图重构和常规模型微调方法相比,所提方法在更新延迟方面降低约60%,三元组插入精度提高约8个百分点,一致性冲突率降低约12个百分点,能够在保持知识图谱结构和语义质量的同时有效提升更新效率.

关键词: 知识图谱更新 ; 核心实体识别 ; 局部子图抽取 ; 加权中心指标 ; 嵌入微调 ; 一致性校验

Abstract

Existing knowledge graph update approaches often suffer from high computational cost, long update latency, and difficulties in maintaining consistency, which limit their applicability in large-scale dynamic environments. To address these issues, an incremental update method based on core entities and local subgraphs was proposed. A weighted centrality metric was constructed by integrating entity degree centrality with business access frequency, and the top-K entities with the highest scores were selected as core entities. In this way, the update process was focused on the entities that were most influential to downstream applications. Local subgraphs associated with the identified core entities were extracted through k-hop neighborhood expansion and edge-weight filtering, so that the update scope was restricted to semantically relevant structures and redundant computation was reduced. During model optimization, a local objective function was established for fine-tuning pre-trained knowledge graph embeddings. A neighborhood stability regularization term was introduced to suppress embedding drift caused by incremental updates. In addition, Schema constraints and multi-source confidence fusion were incorporated to ensure the consistency and reliability of the updated graph. Experiments were conducted on large-scale knowledge graph datasets. The results showed that, compared with full graph reconstruction and conventional fine-tuning methods, the proposed method reduced update latency by approximately 60%, improved triple insertion accuracy by approximately 8 percentage points, and decreased the consistency conflict rate by approximately 12 percentage points. These results indicate that the proposed method can effectively improve update efficiency while maintaining the structural and semantic quality of the knowledge graph.

Keywords: knowledge graph update ; core entity recognition ; local subgraph extraction ; weighted centrality metric ; embedding fine-tuning ; consistency validation

PDF (1141KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

彭商濂, 娄颖, 冯丽. 基于核心实体与局部子图的知识图谱增量更新方法. 浙江大学学报(工学版)[J], 2026, 60(8): 1809-1818 doi:10.3785/j.issn.1008-973X.2026.08.020

PENG Shanglian, LOU Ying, FENG Li. Incremental update method for knowledge graphs based on core entities and local subgraphs. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(8): 1809-1818 doi:10.3785/j.issn.1008-973X.2026.08.020

随着大数据与人工智能的发展,知识图谱在智能问答、推荐、检索等领域广泛应用,但外部信息不断变化使得如何高效、准确、实时更新知识图谱成为保障下游系统可靠性与用户体验的关键挑战[1-2].

传统知识图谱全图更新难以满足大规模知识图谱的实时维护需求. 为了应对更新开销与一致性挑战,研究者提出多种持续嵌入方法. FastKGE(fast and continual knowledge graph embedding)[3] 通过增量低秩适配器减少训练时间34%~68%并提升链路预测约1.5%;IncDE(incremental distillation embedding)[4]采用分层蒸馏保持旧知识连续性,平均倒数排名(mean reciprocal rank, MRR) 提升0.2%~6.5%;SAGE(scale-aware gradual evolution)[5]基于规模感知渐进演化框架动态扩展维度并蒸馏平衡新旧知识,显著提升 MRR、Hits@1与Hits@10;BAKE(Bayesian adaptive knowledge embedding)[6]以贝叶斯后验更新结合持续聚类抑制知识漂移,有效缓解灾难性遗忘. 规则驱动的增量更新方法依赖预定义逻辑规则实现局部更新,成本低且具可解释性. Premachandra等[7]提出松耦合规则规范,增强 SPARQL表达能力并兼容优化机制;Cheng等[8]提出Rule-KE框架,用自动发现规则保证知识编辑一致性并提升问答性能;Hofer等[9]将链式规则扩展为树形规则,提升语义表达与链路预测效果;Xu等[10]提出ZodiacEdge,引入支持递归、负逻辑和聚合的Datalog引擎,增强规则维护的灵活性与效率. 嵌入微调方法基于现有预训练知识图谱嵌入模型(如 TransE[11]、DistMult[12]),对受增量影响的子图或三元组进行局部梯度更新. 代表性工作包括IDEA(incremental deep update)[13]和饶官军等[14]提出的方法. 嵌入微调方法能够显著降低更新延迟并支持在线微调,但在局部更新过程中往往因缺乏全局约束而引发嵌入漂移与语义冲突,须补充额外一致性校验机制. 时态嵌入模型通过引入时间信息建模知识演化. T-GAE[15] 利用图注意力显式编码时间跨度,提升时间敏感嵌入;RoAN[16]聚焦关系维度,增强复杂时间关联建模;BiQCap[17]结合双四元数与胶囊网络提升时序推理能力;TSA-Net[18]通过多模块捕获复杂时间依赖,改善链路预测性能. 尽管时态嵌入模型能捕捉时序动态,仍存在训练推断成本高,对非时序性更新支持不足,缺乏针对局部增量优化,更新仍依赖大规模处理等问题. 动态图神经网络(dynamic graph neural network)在动态知识图谱更新与推理中表现突出. DyREP(dynamic representations over dynamic graphs)[19]通过双时序点过程建模全局与局部演化;InkStream[20]采用事件驱动,仅在受影响邻域触发增量推断;Ripple[21]扩展至分布式环境,实现高吞吐低延迟推理;这些方法仍存在模型与推断开销大,未针对核心实体裁剪更新范围,对非时态事实修正支持不足的问题. 针对多源数据融合与语义更新易致一致性问题,研究者引入Dempster–Shafer 证据理论[22]或 ProbLog进行冲突修复;Wang等[23]提出扩展 Datalog 的 Praline 框架,利用统计相关性构建概率区间并基于$ \delta $ exact inference优化推理,在强相关数据下提升一致性推理能力;但此类方法依赖置信度估计且计算复杂度高,难以适应资源受限与实时更新场景.

综上所述,现有方法尚难兼顾实时性、准确性和一致性. 本研究提出“核心实体+局部子图”增量更新方法,通过自定义加权中心性指标精准定位关键节点,在小规模局部子图内进行高效嵌入微调,结合 Schema[24] 约束与多源置信度融合,实现低开销、高实时性与强一致性的有机统一.

1. 问题模型

图1所示,本研究所提知识图谱增量更新方法的总体框架划分为3个阶段. 1)基于增量数据识别核心实体,结合加权中心性与跳数阈值提取局部子图;2)在子图内进行嵌入微调,引入邻域稳定性正则抑制漂移;3)利用 Schema 约束进行一致性检查,以 Dempster–Shafer 证据理论融合多源数据. 3个阶段协同,实现图谱更新,兼顾结构完整性与语义一致性.

图 1

图 1   基于核心实体与局部子图的知识图谱增量更新方法总体框架

Fig.1   Overall framework of incremental update method for knowledge graphs based on core entities and local subgraphs


1.1. 知识图谱更新

令原始知识图谱$ G=\left(E,R,T\right) $,其中$ E $为实体集合,$ R $为关系集合,$ T\subseteq E\times R\times E $为已知三元组;新增或修改的三元组集合记作$ \Delta T=\left\{\left({h}_{{i}},{r}_{i},{t}_{i}\right)\right\}_{{i=1}}^{{N}} $. 每个三元组包括以下元素. 1)头实体$ h $:三元组中的第一个实体,表示关系的起始点. 2)关系$ r $:表示头实体和尾实体之间的关系. 3)尾实体$ t $:三元组中的第二个实体,表示关系的终结点. 4)操作类型:可选参数,表示对三元组的操作类型,包括新增(insert)、修改(update)、删除(delete)等. 知识图谱更新的目标是在保证图谱全局一致性的前提下,仅针对与任务最相关的“核心实体”及其局部邻域进行小范围更新,以最小化计算开销与延迟.

1.2. 加权中心性指标与核心实体集

为了精准识别对下游应用最有价值的实体,引入将图结构特征与业务特征结合的加权中心性指标. 对每个实体$ e\in E $,加权中心性指标计算式为

$ C\left(e\right)=\alpha \cdot \deg \left({e}\right)+\beta \cdot \text{freq}\left({e}\right),\quad \alpha +\beta =1. $

式中:$ \text{deg}(e) $为实体在图中度数,$ \text{freq}(e) $为实体的业务访问频次(如查询次数),$ \alpha 、\beta $均为经验权重. 对$ C\left(e\right) $从大到小排序,选取前K个实体构成核心实体集$ {E}_{\text{c}}=\left\{{e}_{1},\cdots ,{e}_{K}\right\} $.

1.3. 局部子图抽取

对每一核心实体$ e_{\text{c}}\in {E}_{\text{c}} $,定义其k跳邻域子图:

$\begin{split} & G_{\mathrm{sub}}\left(e_{\mathrm{c}}, k\right)=\left(E_{\mathrm{sub}}, R_{\mathrm{sub}}, T_{\mathrm{sub}}\right) ; \\& E_{\mathrm{sub}}=\left\{e \in E \mid \operatorname{dist}\left(e_{\mathrm{c}}, e\right) \leqslant k\right\}, \\& T_{\mathrm{sub}}=\left\{(h, r, t) \in T \mid h, t \in E_{\mathrm{sub}}, W(h, r, t) \geqslant \tau\right\} .\end{split}$

式中:$ \text{dist}\left({e}_{\text{c}},e\right) $为核心实体$ {e}_{\text{c}} $与实体$ e $之间的最短路径跳数,$ W\left(h,r,t\right) $为三元组$ \left(h,r,t\right) $的边权,$ \tau $为边权过滤阈值. 邻域约束用于确定核心实体的局部语义范围,边权约束用于过滤低重要度关系,二者共同作用构建与核心实体高度相关的局部子图,减少无关结构对增量更新过程的影响.

1.4. 局部嵌入优化

针对每个子图$ {G}_{\text{sub}} $,定义其中的增量三元组集:

$ \Delta {T}_{\text{sub}}=\left\{\left(h,r,t\right)\in \Delta T|h\in {E}_{\text{sub}}\vee {t}\in {E}_{\text{sub}}\right\}. $

令原预训练嵌入为{$ \boldsymbol{e}_{\text{e}}^{\left(0\right)} $|$ e\in {E}_{\text{sub}} $},更新后嵌入为{$ \boldsymbol{e}_{\text{e}}^{} $}. 局部优化目标可表示为

$ \underset{\left\{{\boldsymbol{e}}_{\text{e}}\right\}}{\min }\sum \limits_{\left(h,r,t\right)\in \Delta {T}_{\text{sub}}}{\left[f\left({\boldsymbol{e}}_{\text{h}},\boldsymbol{r},{\boldsymbol{e}}_{\text{t}}\right)-\gamma \right]}_++\lambda \sum \limits_{{e}\in {E}_{\text{sub}}}^{}{\left\|{\boldsymbol{e}}_{\text{e}}-\boldsymbol{e}_{\text{e}}^{\left(0\right)}\right\|}^{2}. $

式中:$ f\left({\boldsymbol{e}}_{\text{h}},\boldsymbol{r},{\boldsymbol{e}}_{\text{t}}\right) $为三元组打分函数(如TransE 的$ {\left\|{\boldsymbol{e}}_{\text{h}}+\boldsymbol{r}-{\boldsymbol{e}}_{\text{t}}\right\|}^{2} $),$ {\left[\cdot \right]}_{+} $表示$ \text{max}\left\{0,\cdot \right\} $γ为正负样本间隔,$ \lambda $为邻域稳定性正则项权重. 记

$ {L}_{\text{inc}} = \sum \limits_{\left(h,r,t\right)\in \Delta {T}_{\text{sub}}}{\left[f\left({\boldsymbol{e}}_{\text{h}},\boldsymbol{r},{\boldsymbol{e}}_{\text{t}}\right)-\gamma \right]}_+ . $

在局部更新中,新增或修改三元组会通过梯度传播影响邻近实体,导致嵌入偏离原有语义环境并破坏一致性. 为此,在优化目标中引入邻域稳定性正则项,约束更新前后嵌入差异,限制非目标实体的过度漂移,形式为

$ {L}_{\text{stab}}=\lambda {\sum }_{{e}\in {{E}_{\text{sub}}}}{\left\|{\boldsymbol{e}}_{\text{e}}-\boldsymbol{e}_{\text{e}}^{\left(0\right)}\right\|}^{2}. $

局部嵌入优化模型在保证增量三元组有效学习$ {L}_{\text{inc}} $的同时,通过$ {L}_{\text{stab}} $控制子图内其他实体向量的漂移.

1.5. 一致性约束集成

为了防止局部更新引入结构或语义冲突,引入以下一致性约束.1) Schema 约束:用于检查新增/修改三元组的类型匹配和功能唯一性,避免结构冲突(类型与关系不符)和语义冲突,否则将破坏逻辑一致性并降低推理准确性. 2) 多源置信度融合:利用 Dempster–Shafer 理论合并多源置信度,冲突时保留高信源,并在更新后进行校验与重评估提升一致性. 同时通过 domain 与 range 约束检测新增三元组合法性,如“出生地”主语须为人物、宾语须为地点,以保证类型与语义合理性.

1.6. 全局更新目标

将所有局部更新映射结果合并,并执行 Schema与多源置信度约束校验,最终获得更新后图谱$ G' $. 整体优化可近似表示为

$ \begin{split} & \underset{G'}{\min }\sum \limits_{{e}_{\text{c}}\in {E}_{\text{c}}}\left\{{L}_{\text{inc}}\left({G}_{\text{sub}}\left({e}_{\text{c}}\right),\Delta {T}_{\text{sub}}\right)+\lambda {L}_{\text{stab}}\right\}. \\& {\mathrm{s.t.}}\;\text{Sch}\left({G}^{\prime}\right)={\mathrm{True}},\;\text{CF}\left({G}^{\prime}\right)\geqslant \delta .\end{split} $

式中:$ \text{Sch}\left(\cdot\right) $为对图进行Schema 约束检查,$ \text{CF}\left(\cdot\right) $为对图进行多源融合检查.

2. 增量更新算法设计与分析

2.1. 增量更新算法流程

增量更新算法1)将增量三元组映射到已抽取的子图范围;2)对该子图进行局部嵌入微调,引入邻域稳定性正则项以限制实体向量的过度漂移;3)通过 Schema 校验排除不合法的更新;4)利用Dempster–Shafer置信度融合整合多源数据. 增量更新算法伪代码如算法1所示.

算法1 知识图谱增量更新算法

输入:原图谱$ G=\left(E,R,T\right) $;增量三元组$ \Delta T $;参数:核心实体数量K,跳数 k,边权阈值 τ

输出:更新后知识图谱 G';

1: for each e in E do

2:  C($ e $) = $ \alpha $·deg ($ e $) +$ \beta $·freq ($ e $) # 计算加权中心性

3: end for

4: $ {E}_{\text{c}} $ = top-K entities by C ($ e $)#降序选取得分最高的前 (K) 个实体

5: for each $ {e}_{\text{c}} $ in $ {E}_{\text{c}} $do

6:  $ {E}_{\text{sub}} $($ {e}_{\text{c}} $)={$ e\in E $| dist ($ {e}_{\text{c}} $, $ e $)k }

7:  $ {T}_{\text{sub}} $($ {e}_{\text{c}} $)={ $ \left(h,r,t\right)\in T $| $ h,t $$ {E}_{\text{sub}} $($ {e}_{\text{c}} $) and $ W(h,r, t) $$ \tau $}

8:  $ \Delta {T}_{\text{sub}} $($ {e}_{\text{c}} $)={$ \left({\mathrm{op}},h,r,t\right) $$ \in \Delta T $| $ h $$ \in {E}_{\text{sub}} $($ {e}_{\text{c}} $) or t$ \in {E}_{\text{sub}} $($ {e}_{\text{c}} $) }

9: end for

10: for each $ {e}_{\text{c}} $ in $ {E}_{\text{c}} $ do

11:  初始化子图嵌入{$ {\boldsymbol{e}}^{\left(0\right)} $| e$ \in {E}_{\text{sub}} $($ {e}_{\text{c}} $)}

12:  while 未收敛且未达到最大迭代次数 do

13:  从$ \Delta {T}_{\text{sub}} $($ {e}_{\text{c}} $)采样正负样本

14:  计算增量损失$ {L}_{\text{inc}} $

15:  计算稳定性正则$ {L}_{\text{stab}} $

16:  最小化联合损失 ($ L $=$ {L}_{\text{inc}} $+$ \lambda {L}_{\text{stab}} $),更新子图内嵌入

17:  end while

18: end for

19: for each ($ \left({\mathrm{op}},h,r,t\right) $ in $ \Delta T $) do

20:  if violates Schema 约束 or confidence < $\delta $ then

21:   回滚或修正该三元组

22:  else

23:  end if

24:   if (op=” delete”) then

25:    $ {T}_{\text{remove}} $$ {T}_{\text{remove}} $$ \left\{\left(h,r,t\right)\right\} $

26:   else if (op=”insert”) then $ \left\{\left(h,r,t\right)\right\} $

27:    $ {T}_{\text{add}} $$ {T}_{\text{add}} $$ \left\{\left(h,r,t\right)\right\} $

28:   else if (op=”update”) then

29:    $ {T}_{\text{remove}} $$ {T}_{\text{remove}} $$ \left\{{\left(h,r,t\right)}_{\text{old}}\right\} $

30:    $ {T}_{\text{add}} $$ {T}_{\text{add}} $$ \left\{{\left(h,r,t\right)}_{\text{new}}\right\} $

31:   end if

32:  end if

33: end for

34: $ {T}^{\prime} $= ($ (T\backslash {T}_{\text{remove}})\cup {T}_{\text{add}} $)

35: $ {E}^{\prime}=E\cup \{h,t|(h,t,r)\in {T}_{\text{add}}\} $

36: $ {R}^{\prime}=R\cup \{r|(h,t,r)\in {T}_{\text{add}}\} $

37: $ {G}^{\prime}=({E}^{\prime},{R}^{\prime},{T}^{\prime}) $

38: return $ {G}^{\prime} $

算法1首先从原始三元组集合 $ T $中删除失效三元组$ {T}_{\text{remove}} $,并加入新增或更新后的三元组$ {T}_{\text{add}} $,得到新的三元组集合$ {T}^{\prime} $. 随后,将新增三元组中出现的新实体和新关系分别合并到实体集合$ E $和关系集合$ R $中,形成更新后的实体集合$ {E}^{\prime} $与关系集合$ {R}^{\prime} $. 最终构建更新后的知识图谱$ {G}^{\prime}=({E}^{\prime},{R}^{\prime},{T}^{\prime}) $,完成一次增量更新过程. 该过程能够统一处理新增、删除和修改三类增量事件,实现知识图谱结构与语义表示的同步演化.

2.2. 核心实体识别

2.2.1. 数据准备与预处理

在图结构加载时,将图谱中所有边列表以邻接表形式存储:Adj:$ E $→{邻接实体列表},便于快速计算度中心性. 为了将业务层面的实体重要性融入核心实体识别当中,从业务系统采集历史访问日志,统计每个实体的访问次数;构建映射表$ {\mathrm{BizFreqMap}} $: $ E\rightarrow N $,记录实体$ e $的原始访问频次$ f\left(e\right) $.

2.2.2. 中心性指标计算与归一化

在采集并预处理度中心性与访问频次后,对两者归一化并加权组合,得到综合中心性得分. 度中心性计算式为

$ \text{deg}\left({e}\right)=\mid \text{Adj}\left(e\right)\mid ,\; e\in E. $

为了消除实体访问次数量级差异,将原始频次$ f\left(e\right) $ 归一化为

$ {\mathrm{freq}}\left(e\right)=\frac{f\left(e\right)-\underset{x\in E}{\min }f\left(x\right)}{\underset{x\in E}{\max }f\left(x\right)-\underset{x\in E}{\min }f\left(x\right)}. $

最终按经验权重$ \alpha 、\beta $计算综合评分$ C\left(e\right) $.

2.2.3. 核心实体筛选

核心实体筛选基于Top (K)思想. 对所有$ C\left(e\right) $进行部分排序,使用最小堆维护大小为$ K $的候选集. 将筛选出的核心实体列表$ {E}_{c} $={$ {e}_{1} $,···,$ {e}_{K} $}传递至下一模块.

2.3. 局部子图抽取

局部子图抽取模块的任务是针对每个核心实体$ {e}_{\text{c}} $,提取其 k跳邻域内且满足边权阈值$ \tau $的子图结构,将后续更新范围限定于图中最相关的部分. 为了衡量不同边在子图扩展中的重要性,定义权重函数$ W\left(h,r,t\right) $,用于刻画三元组$ \left(h,r,t\right) $在结构和语义上的显著性:

$ W\left(h,r,t\right)=\alpha \cdot \text{deg}\left(h,r,t\right)+\left(1-\alpha \right)\cdot \text{conf}\left(h,r,t\right) . $

式中:$ \text{deg}\left(h,r,t\right) $为该三元组在图中的局部连接度,$ \text{conf}\left(h,r,t\right) $为融合得到的置信度,$ \alpha \in \left[0,1\right] $为调节参数.

2.3.1. 局部子图抽取算法流程

局部子图抽取算法从核心实体出发,执行$ k $跳的广度优先扩展;在扩展过程中利用权重公式$ W\left(h,r,t\right) $对候选边进行重要性衡量,并通过阈值$ \tau $滤除低权重边,保留语义相关性最强的局部结构. 局部子图抽取算法伪代码如算法2所示.

算法 2 局部子图抽取算法

输入:原始图谱邻接表Adj, 边权映射W, 核心实体集$ {E}_{\text{c}} $, 跳数$ k $, 边权阈值$ \tau $

输出:子图实体集合与三元组集合{($ {E}_{\text{sub}}\left({e}_{\text{c}}\right) $, $ {T}_{\text{sub}}\left({e}_{\text{c}}\right) $)}

1: for each $ {e}_{\text{c}} $ in $ {E}_{\text{c}} $ do

2:  $ {E}_{\text{sub}} $ = {$ {e}_{\text{c}} $}

3:  frontier = {$ {e}_{\text{c}} $}

4:  for depth = 1 to $ k $ do

5:   next_frontier = ∅

6:   for each u in frontier do

7:    for each v in Adj[u] do

8:     if v$ {E}_{\text{sub}} $ then

9:      $ {E}_{\text{sub}} $ = $ {E}_{\text{sub}} $ ∪ {v}

10:      next_frontier = next_frontier ∪ {v}

11:     end if

12:    end for

13:   end for

14:   frontier = next_frontier

15: end for

16:  $ {T}_{\text{sub}} $ = ∅

17:  for each h in $ {E}_{\text{sub}} $ do

18:   for each (h,r,t) in AdjTriples[h] do

19:    if t$ {E}_{\text{sub}} $ and $ W\left(h,r,t\right) $τ then

20:     $ {E}_{\text{sub}} $ = $ {E}_{\text{sub}} $$ \{\left(h,r,t\right)\} $

21:    end if

22:   end for

23:  end for

24: 输出 ($ {E}_{\text{sub}}\left({e}_{\text{c}}\right) $=$ {E}_{\text{sub}} $,$ {T}_{\text{sub}} $ ($ {e}_{\text{c}} $) =$ {T}_{\text{sub}} $)

2.3.2. 数据结构与索引优化

算法2中,Adj用于存储实体到邻居实体列表的映射,AdjTriples为实体到出边三元组列表的映射,预存所有 (h,r,t) 以便快速遍历. 图谱的邻接列表Adj采用压缩稀疏行(compressed sparse row, CSR). CSR 结构通过三段数组分别存储节点索引、邻居实体列表和边权信息,能够在内存中紧凑地表示稀疏图,并通过节点偏移量直接定位到其邻居区间,实现 O(1)时间的邻居访问. 三元组索引AdjTriples采用每个实体到其所有出边三元组列表的映射结构进行存储. 具体而言,AdjTriples 通过哈希表方式实现:以实体标识$ e $为键,值为包含所有形式为$ \left(e,r,t\right) $及对应边权$ W\left(e,r,t\right) $的三元组记录集合. 边权函数$ W\left(h,r,t\right) $的存储采用与三元组索引并行的数组或哈希映射结构. 每条$ \left(h,r,t\right) $三元组在存储其关系数据的同时,将对应的权重值存储在与之同索引位置的权重数组中. 当通过AdjTriples定位到某实体$ h $的出边列表后,即可通过数组下标或结构体属性在O(1)时间内读取该条边的权重$ W\left(h,r,t\right) $,实现对局部子图中各三元组的快速阈值过滤和优先级判断.

2.4. 局部嵌入微调

在局部子图抽取完成后,对每个核心实体对应的子图$ {G}_{\text{sub}} $=($ {E}_{\text{sub}} $, $ {T}_{\text{sub}} $) 及其增量三元组集Δ$ {T}_{\text{sub}} $进行嵌入微调,以使新增或修改的三元组得到准确表达,同时抑制其他实体嵌入过大漂移.

2.4.1. 嵌入初始化

从全局预训练模型中加载子图中所有实体$ e $$ {E}_{\text{sub}} $和关系$ r $$ {R}_{\text{sub}} $的向量表示$ \boldsymbol{e}_{{{\mathrm{e}}}}^{\left(0\right)} $$ {\boldsymbol{r}}^{\left(0\right)} $,并将其复制为可更新的变量{$ \boldsymbol{e}_{{\mathrm{e}}} $}和{$ \boldsymbol{r} $}.

2.4.2. 正负样本采样

正样本直接来源于子图增量三元组集$ \Delta T_{\text{sub}}^{+} $={$ \left(h,r,t\right) $ | op∈{add, update}},确保每条新增或修改的三元组均被用作训练信号. 负样本通过实体替换策略生成:针对每个正样本$ \left(h,r,t\right) $,以一定概率随机替换头实体或尾实体,得到$ \left(h',r,t\right) $$ \left(h,r,t'\right) $且保证替换后三元组不在原图谱中.

2.4.3. 损失函数与优化

为了同时满足增量三元组的正确学习与子图嵌入的稳定保留,采用如下联合损失函数:

$ L={L}_{\text{inc}} + L{ }_{\text{stab}} . $

其中$ {L}_{\text{inc}} $对每条正样本 $ \left(h',r,t\right) $$ \Delta T_{{\mathrm{sub}}}^{+} $与其对应的负样本$ \left(h',r,t'\right) $ 采用 hinge 损失,确保正样本得分较负样本高出至少边际$ {\gamma } $$ {L}_{\text{stab}} $通过二范数惩罚项约束所有子图实体的嵌入偏离其初始预训练值$ \boldsymbol{e}_{{\mathrm{e}}}^{\left(0\right)} $,从而抑制微调过程中对邻域以外语义结构的破坏. 优化时,算法对每个局部子图采用小批量随机梯度下降优化器:在每次迭代中,先从$ \Delta T_{\text{sub}}^{+} $及其负样本集中按设定比例$ \rho $构造批次,再计算总损失$ L $的梯度并更新子图内所有可训练的实体与关系向量,直至损失收敛或达到最大迭代次数$ {I}_{\text{max}} $.

2.5. 一致性校验与融合

为了防止增量操作引入结构或语义冲突,先对所有待更新三元组进行 Schema 约束检查,再对多源数据进行置信度融合,以决定保留、修正或回滚.

Schema 约束检查依次验证以下预定义规则. 1)类型一致性:检查实体$ h $$ t $的类别是否符合关系$ r $在本体中定义的domain与range类型. 2)功能属性唯一性:若$ r $为功能(functional)或逆功能(inverse-functional)属性,确保图中不存在第二条也违反该唯一性限制的三元组. 3)约束组合:对符合自定义业务规则的复合约束(如码值范围、标识唯一性)进行校验. 任何违反上述规则的三元组均被标记为“冲突”,并触发后续的融合或人工干预流程.

在多数据源环境下,同一三元组$ \tau $可能来自不同渠道且置信度不一,设其来自$ n $个源的置信度分别为$ \left\{{p}_{i}\right\}_{i=1}^{n} $. 采用Dempster–Shafer理论进行融合(与嵌入式融合相比, Dempster–Shafer证据理论可直观反映源间一致性,计算轻量适合低延迟更新,并与 Schema 校验契合,可量化支持规则冲突检测,更适用于在线更新). 1)构造质量函数:为每个来源赋予基本信任质量 $ {m}_{i}\left(\left\{\tau \right\}\right) $=$ {p}_{i} $,余量$ {m}_{i}\left({\varTheta }\right) $=1−$ {p}_{i} $,其中$ \varTheta $为全集. 2)进行递归融合,公式为

$ {m}_{12}\left(A\right)=\frac{1}{1-K}\sum \limits_{B\cap C=A}{m}_{1}\left(B\right){m}_{2}\left(C\right) , $

$ K=\sum \limits_{B\cap C=\varnothing }{m}_{1}\left(B\right){m}_{2}\left(C\right). $

依次将各源质量函数合并为最终$ {m}_{\text{DS}}\left(\left\{\tau \right\}\right) $. 3)置信度判定:若$ {m}_{\text{DS}}\left(\left\{\tau \right\}\right) $$ \delta $(事先设定的置信阈值),则接受该三元组;否则视为低可信条目,视情况回滚或标记人工审校.

3. 实验设计与结果分析

3.1. 实验方案

为了全面评估所提方法的性能,设计详细的实验方案. 实验选用2个数据集:Wikidata-EN 子集[25]约 100 万实体、300 万三元组,涵盖人物、地点、事件、组织等多领域,用于测试方法在大规模跨领域场景下的性能与扩展性; YAGO2 地理与事件子集[26]约 50 万实体、150 万三元组,聚焦地理与历史事件,关系稠密,适合评估算法在高连通子图中的更新效率与准确性. 采用2种对比方案:1)增量更新策略对比包括全量重构(full-recon)、全局嵌入微调(global-fine)、规则驱动增量更新(rule-update)和本研究提出的“核心实体+局部子图”更新方法;2)将所提方法与TransE[11]、DistMult[12]、ComplEx[27]、RotatE[28]和R-GCN[29]等主流嵌入模型进行对比,验证不同嵌入建模方法的效果.

消融实验验证所提方法中各关键模块的有效性,设计3种对比配置. 1)完整流程(所提方法):采用完整的“核心实体+局部子图”增量更新流程,包括加权中心性识别、k 跳子图抽取、局部嵌入微调(含邻域稳定性正则项)、Schema 约束校验以及 Dempster–Shafer 多源置信度融合,作为所提方法的完整实现. 2)Ablation-Reg:在局部嵌入微调阶段,将正则项权重 λ 置零,仅依赖增量损失 $ {L}_{\text{inc}} $,完全去除邻域稳定性正则项 $ {{L}}_{\text{stab}}=\displaystyle\sum \left\|{\boldsymbol{e}}_{\text{e}}-\boldsymbol{e}_{\text{e}}^{\left(0\right)}{}\right\|^{2} $. 该设置用于检验邻域稳定性正则在控制子图外实体向量漂移和减少一致性冲突中的作用. 3)Ablation-Conf:在保留嵌入微调和 Schema 校验机制的前提下,禁用 Dempster–Shafer 多源置信度融合模块;对增量三元组仅执行本体级 Schema 规则校验,不再整合不同数据源的信任度信息. Ablation-Conf 配置用于评估多源融合在过滤低可信或冲突三元组、提升整体一致性方面的作用.

3.2. 实验环境

实验在高性能服务器上进行,硬件环境包括双路 Intel Xeon Gold 6248 处理器(共 40 核,主频 2.5 GHz)、256 GB DDR4 内存和Atlas 300 AI 加速卡(搭载昇腾 910 处理器);存储采用 NVMe SSD. 以 Ubuntu 20.04 为操作系统,核心依赖为 Python 3.8、PyTorch 1.10 深度学习框架、NetworkX 2.6 图处理库以及 Neo4j 4.3 图数据库;所有实验在同一平台、同一版本条件下重复运行3次取平均,以确保结果的可比性与稳定性.

3.3. 性能评价指标

由以下指标验证方法有效性. 1)更新延迟L:指一批增量三元组完成写入及结构/嵌入更新的平均耗时,用于衡量系统在不同规模增量下的实时响应能力. 2)插入精度P:衡量通过一致性校验后被接纳三元组的正确率,即P=正确接纳三元组数/接纳三元组总数. 该指标反映增量更新结果的准确性. 当部分三元组因Schema约束或多源置信度校验被拒绝时,不计入P的统计范围. 3)一致性冲突率C:增量三元组在 Schema 约束或多源置信度校验阶段被拒绝或回滚的比例,越低说明一致性保持越好. 4)嵌入漂移D:量化局部微调对未更新实体嵌入的影响,计算更新前后差异,越小表示更新更具局部性且保持整体稳定. 5)一致性保持率(consistency retention,CR):衡量在增量更新过程中,新增或修改的三元组在 Schema 约束与多源置信度融合校验后仍被保留的比例,反映方法在维护知识图谱逻辑一致性和语义合理性方面的能力. 6)Hits@10:衡量链路预测任务中正确实体排名的前 10 命中率,即预测缺失三元组时,若正确答案出现在模型输出的前10个候选实体中,则视为命中;该指标能够反映模型在候选排序任务中的检索能力. 7)平均倒数排名MRR:衡量正确答案在预测排序中的整体靠前程度,定义为所有预测中正确答案排名倒数的平均值.

3.4. 对比方法

在更新策略上,选取3种基线:Full-Recon(全图重训,语义完整但代价高)、Global-Fine(全图微调,避免重构但仍存漂移与冲突)、Rule-Update(基于 SPARQL/OWL 的结构更新,规则正确但无嵌入优化). 本研究所提方法仅在核心实体局部子图内微调,引入正则约束抑制漂移、提升一致性. 比较多种主流知识表示模型:TransE(经典翻译模型)、DistMult(适合对称关系)、ComplEx(复数空间,支持反对称关系)、RotatE(复数旋转,链路预测性能优异)和 R-GCN(图卷积聚合邻居信息). 所提方法可适配上述模型,并在局部更新与一致性增强方面展现优势.

3.5. 实验参数设置

为了保证公平性,所有方法均在相同环境与数据划分下训练测试,参数分为更新策略与嵌入模型2个类别. 更新策略方面:所提方法核心实体数取 {50,100,200},子图跳数取 {1,2,3},边权阈值取 {0.1,0.3,0.5},正则权重取 {0.01,0.1,1.0},学习率为1.0×10−3,批次大小为256,迭代轮次为50;Full-Recon 基于 TransE 重构,全图训练50轮,学习率为1.0×10−3;Global-Fine 全图微调 20 轮,学习率为5.0×10−4,批次大小为512;Rule-Update 直接执行 SPARQL 插入/删除,不涉及嵌入参数.

嵌入建模参数设置:TransE 维度100,margin=1.0,学习率1.0×10−3,训练50轮,批次大小为512;DistMult 与 ComplEx 维度200,学习率1.0×10−3,训练50轮,批次大小为512,其中 DistMult 正则系数0.01,ComplEx 采用复数表示并加正则;RotatE 维度200,margin=6.0,学习率5.0×10−4,训练50轮,批次大小为512,采用自对抗负采样;R-GCN 两层卷积,隐藏单元200,采样32,ReLU 激活,学习率1.0×10−3,批次大小为256. 所有参数参考原始论文并结合验证集调优以保证公平性.

3.6. 实验结果及分析

3.6.1. 更新延迟对比

为了评估各方法在不同规模增量下的响应能力,在Wikidata-EN和YAGO2数据集上分别构造不同大小的增量批次n(其中 n = |ΔT|,n ∈ {1 000, 5 000, 10 000}). 每种方法在n下均重复运行5次,记录从提交到更新完成的总时间,并取平均与标准差,结果如表1所示. 可以看出,全量重构延迟最高且随 n 线性增长,不适合在线场景. 全局微调虽快于重构,但在YAGO2和Wikidata-EN数据集上的更新延迟仍分别达到72~710 s和95~925 s,难以满足低延迟需求. 规则驱动(Rule-Update)的更新延迟最低,在2个数据集上的范围为30~405 s,但仅支持结构层面的增量修改,无法优化知识表示嵌入. 所提方法结合“核心实体+局部子图”策略,较 Rule-Update平均降低约34%,并兼顾嵌入优化与一致性校验,更适合实时知识图谱维护.

表 1   不同增量更新方法在2个数据集上的更新延迟比较

Tab.1  Update latency comparison of different incremental update methods on two datasets

方法L/s, Wikidata-ENL/s, YAGO2
n=1 000n =5 000n =10 000n=1 000n=5 000n=10 000
Full-Recon420.3 ± 12.52100.8 ± 45.24205.6 ± 60.4310.9 ± 9.31555.4 ± 35.73110.2 ± 58.8
Global-Fine95.2 ± 5.1460.7 ± 12.8925.3 ± 20.672.4 ± 4.5354.1 ± 10.2709.8 ± 18.4
Rule-Update40.8 ± 3.7205.4 ± 7.9405.2 ± 10.130.2 ± 2.9151.7 ± 8.0300.5 ± 9.6
本研究28.5 ± 2.4140.2 ± 6.3280.6 ± 11.718.9 ± 1.895.4 ± 5.7190.8 ± 10.3

新窗口打开| 下载CSV


3.6.2. 插入精度与冲突率

表2所示,各方法在插入精度和一致性冲突率方面存在较大差异. Full-Recon 在2个数据集上均保持插入精度为100%和冲突率为0,这是由于其每次均对全图进行重构并严格执行 Schema 约束. Global-Fine 缺乏局部一致性约束和多源可信度校验机制,容易产生冲突事实. Rule-Update 的插入精度最低,一致性冲突率最高,表明单纯依赖规则匹配难以处理复杂语义关系和多源异构数据. 相比之下,所提方法在2个数据集上均保持插入精度为100%,同时将一致性冲突率控制在3.8%~4.1%,显著优于其他增量更新策略. 这表明“核心实体+局部子图”更新机制结合Schema 约束与 Dempster–Shafer 证据融合,能够在保证知识接纳能力的同时有效过滤冲突信息,提升知识图谱更新质量.

表 2   不同增量更新方法在2个数据集上的插入精度与一致性冲突率比较

Tab.2  Comparison of insertion accuracy and consistency conflict rate of different incremental update methods on two datasets %

方法Wikidata-ENYAGO2
PCPC
Full-Recon100.0 ± 0.00.0 ± 0.0100.0 ± 0.00.0 ± 0.0
Global-Fine92.5 ± 0.48.7 ± 0.393.1 ± 0.57.9 ± 0.4
Rule-Update85.3 ± 0.615.2 ± 0.587.0 ± 0.714.5 ± 0.6
本研究100.0 ± 0.03.8 ± 0.2100.0 ± 0.04.1 ± 0.3

新窗口打开| 下载CSV


3.6.3. 嵌入漂移测量

在嵌入漂移实验中,在每次5 000条增量更新后,随机抽取1 000个未受更新影响的实体,比较更新前后嵌入向量的欧氏距离,并取平均与标准差. 各方法在2个数据集上均重复3次,结果如表3所示. 可以看出,Full-Recon 由于重训练了全图嵌入,导致所有实体(包括未更新区域)嵌入均发生较大漂移,平均距离约为1.10~1.20;Global-Fine 在全图范围内微调,未更新区域也被梯度误伤,漂移较高(0.75~0.85);Rule-Update 不涉及向量更新,因此未更新实体嵌入保持不变,漂移为0;所提方法仅在核心实体子图内进行微调,通过稳定性正则项限制邻域以外的嵌入漂移,使得未更新区域的平均漂移极低(0.10~0.12),兼顾了局部更新能力与全局嵌入稳定性.

表 3   不同增量更新方法在2个数据集上的嵌入漂移结果

Tab.3  Embedding drift results of different incremental update methods on two datasets

方法D
Wikidata-ENYAGO2
Full-Recon1.20 ± 0.051.10 ± 0.04
Global-Fine0.85 ± 0.030.75 ± 0.02
Rule-Update0.00 ± 0.000.00 ± 0.00
本研究0.12 ± 0.020.10 ± 0.01

新窗口打开| 下载CSV


3.7. 消融与敏感性分析

为了深入理解各模块及参数对整体性能的影响,设计2组实验:1)消融实验分别去除稳定性正则项或置信度融合模块;2)参数敏感性实验考察核心实体数K、跳数 k 与正则权重λ对更新延迟、插入精度和嵌入漂移的影响.

3.7.1. 消融实验

消融实验验证关键模块的作用,对比3种方法. 1)完整流程包括核心实体选择、子图抽取、局部微调(含稳定性正则)、Schema 校验和 Dempster–Shafer 融合. 2)Ablation-Reg去除邻域稳定性正则,仅依赖增量损失,检验其对漂移控制和一致性冲突的影响. 3)Ablation-Conf去除 Dempster–Shafer 融合,仅保留 Schema 校验,评估其在过滤低可信或冲突三元组方面的效果. 将3种方法在 Wikidata-EN(批次规模 5 000)上进行对比,评价插入精度、冲突率与嵌入漂移,结果如表4所示. 可以看出,Ablation-Reg 虽保持插入精度为100%,但冲突率升至12.4%,嵌入漂移增至0.45,说明正则对控制邻域外实体扰动至关重要. 去除置信度融合(Ablation-Conf)使精度降至96.8%,冲突率升至8.7%,漂移略增,表明 Dempster–Shafer 融合在提升一致性与过滤冲突方面不可或缺. 结果验证了关键模板对整体性能的作用.

表 4   不同模块配置对知识图谱增量更新性能的影响

Tab.4  Impact of different module configurations on incremental knowledge graph update performance

方法P/%C/%D
完整流程100.0 ± 0.03.8 ± 0.20.12 ± 0.02
Ablation-Reg100.0 ± 0.012.4 ± 0.50.45 ± 0.03
Ablation-Conf96.8 ± 0.48.7 ± 0.40.15 ± 0.02

新窗口打开| 下载CSV


3.7.2. 参数敏感性实验

在参数敏感性实验中,以 Wikidata-EN 数据集(增量批次 5 000 条)为平台,固定默认参数(K=100, k=2, τ=0.3, λ=0.1). 每次仅调整1个参数,其余保持不变,并重复 3 次实验取均值与标准差,结果分别如表5~表7所示. 表5中,随着K增大,算法须处理的子图总量线性增长,导致延迟显著上升;由于子图覆盖范围更广,插入精度均能保持 100%,漂移略有增加但仍在可控范围. 表6中,当 k较小时,子图范围小,延迟与漂移均下降;但跳数过小可能遗漏部分影响节点,导致精度略降(从100%降至98.2%). k=2、3可兼顾精度与性能,其中 k=2为较优折中. 表7中,随着$ {\lambda } $增大,稳定性正则对漂移的抑制效果更强,漂移显著下降;但过大正则会限制对新知识的适应,使插入精度轻微下降(99.5%). 延迟也随着正则强度略升,因为优化问题更“保守”,收敛速度稍慢.

表 5   核心实体数量对更新性能的影响

Tab.5  Impact of core entity count on update performance

KL/sP/%D
50125.3 ± 3.1100.0 ± 0.00.10 ± 0.01
100140.2 ± 6.3100.0 ± 0.00.12 ± 0.02
200165.8 ± 5.5100.0 ± 0.00.15 ± 0.02

新窗口打开| 下载CSV


表 6   邻域跳数对更新性能的影响

Tab.6  Impact of neighborhood hop count on update performance

kL/sP/%D
190.7 ± 4.298.2 ± 0.30.08 ± 0.01
2140.2 ± 6.3100.0 ± 0.00.12 ± 0.02
3210.5 ± 7.1100.0 ± 0.00.18 ± 0.03

新窗口打开| 下载CSV


表 7   正则权重对更新性能的影响

Tab.7  Impact of regularization weight on update performance

$ \boldsymbol{\lambda } $L/sP/%D
0.01138.9 ± 5.8100.0 ± 0.00.22 ± 0.02
0.1140.2 ± 6.3100.0 ± 0.00.12 ± 0.02
1145.7 ± 7.499.5 ± 0.20.05 ± 0.01

新窗口打开| 下载CSV


3.8. 不同嵌入建模方法的对比实验

在 Wikidata-EN 数据集(增量批次 5 000 条)上对比 TransE、DistMult、ComplEx、RotatE 和 R-GCN 的性能. 实验固定参数 K=100、k=2、τ=0.3、λ=0.1,仅改变模型类型,每组实验重复 3 次,记录更新延迟、插入精度和嵌入漂移的均值与标准差. 如图2所示为不同嵌入模型在 Hits@10、MRR、一致性保持率和插入精度上的表现. 可以看出,所提方法在 Hits@10(0.552)和 MRR(0.412)上均优于 TransE、ComplEx 和 RotatE,并在一致性保持率(0.88%)和插入精度(80.5%)方面显著领先于 R-GCN 和 TransE,说明该方法在链路预测和增量学习准确性上更具优势. 如图3所示为嵌入漂移和更新延迟结果. 可以看出,所提方法的嵌入漂移(0.58)明显低于 R-GCN(0.91)和 TransE(1.20),表明局部子图更新能有效抑制漂移;所提方法的平均更新延迟为 0.64 s,低于 Full-Recon(1.02 s)、Global-Fine(1.18 s)及其他模型,展现了高效性.

图 2

图 2   不同嵌入模型对链路预测性能与增量更新质量的影响

Fig.2   Impact of different embedding models on link prediction performance and incremental update quality


图 3

图 3   不同嵌入模型对嵌入稳定性与更新效率的影响

Fig.3   Impact of different embedding models on embedding stability and update efficiency


4. 结 语

针对知识图谱在线更新中“传统全图重构计算开销大、全局微调易漂移、规则更新缺乏向量支持”的痛点,本研究提出基于“核心实体+局部子图”的增量更新方法. 设计结合度中心性与业务访问频次的加权中心性指标,实现对下游应用最关键实体的精准聚焦;提出基于 k跳邻域与边权阈值的子图抽取算子,在子图范围内执行预训练嵌入微调;通过邻域稳定性正则项与 Dempster–Shafer 多源置信度融合,确保新增/修改三元组的准确插入与全局嵌入的稳定不漂移;全面实验验证所提方法在更新延迟、插入精度、冲突率与嵌入漂移等多维指标上的综合优势. 本研究在多源数据融合环节采用信度函数理论,主要基于其直观性、可解释性与低计算开销等优势. 基于嵌入的融合方法在表达复杂语义依赖关系方面具有潜力,未来研究计划探索将嵌入式相似度建模与 DS 理论的可解释决策机制相结合,实现兼顾效率、表达能力与可解释性的混合式融合框架.

参考文献

官赛萍, 靳小龙, 贾岩涛, 等

面向知识图谱的知识推理研究进展

[J]. 软件学报, 2018, 29 (10): 2966- 2994

DOI:10.13328/j.cnki.jos.005551      [本文引用: 1]

GUAN Saiping, JIN Xiaolong, JIA Yantao, et al

Knowledge reasoning over knowledge graph: a survey

[J]. Journal of Software, 2018, 29 (10): 2966- 2994

DOI:10.13328/j.cnki.jos.005551      [本文引用: 1]

ZHONG L, WU J, LI Q, et al

A comprehensive survey on automatic knowledge graph construction

[J]. ACM Computing Surveys, 2024, 56 (4): 1- 62

DOI:10.1145/3618295      [本文引用: 1]

LIU J, KE W, WANG P, et al. Fast and continual knowledge graph embedding via incremental LoRA [C]// Proceedings of the International Joint Conference on Artificial Intelligence. Jeju: [s.n.], 2024: 2198–2206.

[本文引用: 1]

LIU J, KE W, WANG P, et al

Towards continual knowledge graph embedding via incremental distillation

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2024, 38 (8): 8759- 8768

DOI:10.1609/aaai.v38i8.28722      [本文引用: 1]

LI Y, ZHANG L, YAN H, et al. SAGE: scale-aware gradual evolution for continual knowledge graph embedding [C]// Proceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining V. 2. Toronto: ACM, 2025: 1600–1611.

[本文引用: 1]

LI L, JIN Z, HE Y, et al. Learning to evolve: Bayesian-guided continual knowledge graph embedding [EB/OL]. (2025–08–04)[2025–09–02]. https://arxiv.org/pdf/2508.02426.

[本文引用: 1]

PREMACHANDRA A M, TAYLOR K, RODRÍGUEZ-MÉNDEZ S. SPARQL-based relaxed rules for learning over knowledge graphs [C]// Joint Proceedings of the 1st Software Lifecycle Management for Knowledge Graphs Workshop and the 3rd International Workshop on Semantic Industrial Information Modelling. Baltimore: [s.n.], 2024: 1–13.

[本文引用: 1]

CHENG K, ALI M A, YANG S, et al. Leveraging logical rules in knowledge editing: a cherry on the top [EB/OL]. (2024–05–27)[2025–07–02]. https://arxiv.org/pdf/2405.15452.

[本文引用: 1]

HOFER M, OBRACZKA D, SAEEDI A, et al

Construction of knowledge graphs: current state and challenges

[J]. Information, 2024, 15 (8): 509

DOI:10.3390/info15080509      [本文引用: 1]

XU W, CURÉ O. ZodiacEdge: a datalog engine with incremental rule set maintenance [EB/OL]. (2023–12–22)[2025–07–02]. https://arxiv.org/pdf/2312.14530.

[本文引用: 1]

WANG Z, ZHANG J, FENG J, et al. Knowledge graph embedding by translating on hyperplanes [C]// Proceedings of the AAAI Conference on Artificial Intelligence. [S.l.]: AAAI Press, 2014: 1112–1119.

[本文引用: 2]

YANG B, YIH W T, HE X, et al. Embedding entities and relations for learning and inference in knowledge bases [EB/OL]. (2015–08–29)[2025–07–02]. https://arxiv.org/pdf/1412.6575.

[本文引用: 2]

DE SA C, RATNER A, RÉ C, et al

Incremental knowledge base construction using DeepDive

[J]. The VLDB Journal, 2017, 26 (1): 81- 105

DOI:10.1007/s00778-016-0437-2      [本文引用: 1]

饶官军, 古天龙, 常亮, 等

基于相似性负采样的知识图谱嵌入

[J]. 智能系统学报, 2020, 15 (2): 218- 226

DOI:10.11992/tis.201811022      [本文引用: 1]

RAO Guanjun, GU Tianlong, CHANG Liang, et al

Knowledge graph embedding based on similarity negative sampling

[J]. CAAI Transactions on Intelligent Systems, 2020, 15 (2): 218- 226

DOI:10.11992/tis.201811022      [本文引用: 1]

HOU X, MA R, YAN L, et al

T-GAE: a timespan-aware graph attention-based embedding model for temporal knowledge graph completion

[J]. Information Sciences, 2023, 642: 119225

DOI:10.1016/j.ins.2023.119225      [本文引用: 1]

BAI L, MA X, MENG X, et al

RoAN: a relation-oriented attention network for temporal knowledge graph completion

[J]. Engineering Applications of Artificial Intelligence, 2023, 123: 106308

DOI:10.1016/j.engappai.2023.106308      [本文引用: 1]

ZHANG S, LIANG X, LI Z, et al. BiQCap: a biquaternion and Capsule network-based embedding model for Temporal knowledge graph completion [C]// Database Systems for Advanced Applications. [S.l.]: Springer, 2023: 673–688.

[本文引用: 1]

XIE R, RUAN K, HUANG B, et al

TSA-Net: a temporal knowledge graph completion method with temporal-structural adaptation

[J]. Applied Intelligence, 2024, 54 (21): 10320- 10332

DOI:10.1007/s10489-024-05734-1      [本文引用: 1]

TRIVEDI R, FARAJTABAR M, BISWAL P, et al. DyRep: learning representations over dynamic graphs [C]// International Conference on Learning Representations. New Orleans: [s.n.], 2019: 1–25.

[本文引用: 1]

WU D, LI Z, MITRA T. InkStream: real-time GNN inference on streaming graphs via incremental update [C]// 2025 IEEE International Parallel and Distributed Processing Symposium (IPDPS). Milan: IEEE, 2025: 1273–1285.

[本文引用: 1]

NAMAN P, SIMMHAN Y. Ripple: scalable incremental GNN inferencing on large streaming graphs [EB/OL]. (2025–05–17)[2025–07–02]. https://arxiv.org/pdf/2505.12112.

[本文引用: 1]

SHAFER G

Dempster-shafer theory

[J]. Encyclopedia of Artificial Intelligence, 1992, 1: 330- 331

[本文引用: 1]

WANG J, HALALINGAIAH S, CHEN W, et al. Probabilistic inference for datalog with correlated inputs [EB/OL]. (2025–08–21)[2026–02–02]. https://arxiv.org/pdf/2508.15166.

[本文引用: 1]

ZHOU D, ZHOU B, ZHENG Z, et al. ScheRe: schema reshaping for enhancing knowledge graph construction [C]// Proceedings of the 31st ACM International Conference on Information and Knowledge Management. Atlanta: ACM, 2022: 5074–5078.

[本文引用: 1]

WIKIMEDIA FOUNDATION. Wikidata database dump (English subset) [EB/OL]. (2025–05–19)[2026–02–02]. https://dumps.wikimedia.org/wikidatawiki/entities/20250519/all-truthy-en.ttl.bz2.

[本文引用: 1]

HOFFART J, SUCHANEK F M, BERBERICH K, et al

YAGO2: a spatially and temporally enhanced knowledge base from Wikipedia

[J]. Artificial Intelligence, 2013, 194: 28- 61

DOI:10.1016/j.artint.2012.06.001      [本文引用: 1]

TROUILLON T, WELBL J, RIEDEL S, et al. Complex embeddings for simple link prediction [EB/OL]. (2016–06–20)[2025–07–02]. https://arxiv.org/pdf/1606.06357.

[本文引用: 1]

SUN Z, DENG Z H, NIE J Y, et al. RotatE: knowledge graph embedding by relational rotation in complex space [EB/OL]. (2019–02–26)[2025–07–02]. https://arxiv.org/pdf/1902.10197.

[本文引用: 1]

SCHLICHTKRULL M, KIPF T N, BLOEM P, et al. Modeling relational data with graph convolutional networks [C]// The Semantic Web. [S.l.]: Springer, 2018: 593–607.

[本文引用: 1]

/