本期将分享近期全球知识图谱相关
行业动态、近期会议、论文推荐
法律+知识图谱
5月13日,欧洲法律AI公司Noxtua发布Noxtua 5版本,新增知识图谱功能。该版本基于欧洲最大的法律数据库,包含超过1亿份可检索文档、750万份法院判决,覆盖250余年的欧洲法律历史。
Noxtua 5能够为不同司法管辖区构建数字孪生系统,将法律知识可视化呈现为知识图谱。用户可以快速生成针对具体法律问题的知识图谱,突出显示法律文档之间的关联网络,模仿律师的推理过程。这一功能帮助法律专业人士更快理解法律问题与文档之间的关系,使整个研究过程更加透明。
未来,该功能还将支持跨司法管辖区的法律概念比较,而不仅仅是术语对照,帮助律师在不同法律体系之间进行比较分析。
https://t.hk.uy/cdKW
知识图谱记忆层
Neo4j实验室推出neo4j-agent-memory项目,为AI智能体提供基于知识图谱的记忆层。该方案在一个图谱中整合了三种记忆类型:短期记忆存储完整对话链,长期记忆记录实体和用户偏好,推理记忆保存智能体解决过的问题及执行步骤。
与传统向量记忆相比,图谱记忆擅长处理多跳关联查询,如“李医生二月份看过哪些病人,这些病人三月份也看过朴医生,并且他们的保险在网络内”。这类查询在向量数据库加SQL的组合中成本较高,但在图查询语言Cypher中实现简单。
该方案已集成到Microsoft Agent Framework、LangChain、Pydantic AI等主流智能体框架中。在医疗、房地产、IT服务等需要复杂实体关联的行业,该记忆层帮助智能体理解用户、机构、服务之间的深层关系,提升回答的准确性和上下文连贯性。
https://t.hk.uy/cdKX

2026
第35届ACM信息与知识管理国际会议(CIKM 2026)将于2026年11月7-11日在意大利罗马举行。
作为信息检索、知识管理、数据挖掘和数据库系统领域的顶级国际会议(CCF B类),CIKM 2026目前正处于征稿冲刺阶段。论文摘要提交截止日期为2026年5月22日,全文提交截止日期为5月29日(AoE时间)。
本届会议将聚焦大语言模型、生成式AI、可信AI及智能体AI等前沿议题,探讨人工智能如何重塑信息访问与知识管理的方式。会议设主会、专题研讨会(Workshops)及产业论坛等多个环节,现面向全球学术界与工业界征集高质量原创研究成果。

详情访问:
https://cikm2026.diag.uniroma1.it/
ThunderAgent
本周推荐的是arxiv 2026.02上的论文:ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System

由大型语言模型(LLM)驱动的自主智能体的出现,改变了推理系统的要求。历史上,LLM用于单轮或简单的聊天机器人交互,其中单个提示会生成单个完成。然而,现代智能体工作流涉及复杂的、多步骤的过程,模型在其中进行推理、调用外部工具、观察结果并迭代,直到任务完成。这些工作流具有高度交互性,并涉及必须长时间保留的冗长交互历史(上下文)。
传统的推理引擎,如vLLM或SGLang,是“以请求为中心”的。它们将智能体推理的每一步都视为一个独立的请求。当智能体调用工具(例如代码编译器、网页浏览器或数据库)时,推理引擎通常会将模型视为空闲,并可能将其内存逐出以服务其他用户。当工具完成且智能体需要再次推理时,引擎必须重新加载整个历史记录,导致显著的延迟和计算浪费。
ThunderAgent通过引入“程序感知”推理系统来解决这些低效问题。它不管理单个请求,而是将智能体工作流的整个生命周期视为一个名为智能体程序的一等公民。通过统一管理GPU内存(用于模型)和外部环境(用于工具),ThunderAgent在吞吐量和资源利用率方面取得了显著提升。

图1:ThunderAgent的架构,显示了全局程序感知等待队列以及推理阶段(在GPU上)和行动阶段(外部工具环境)之间的交互。
传统智能体推理的瓶颈
服务智能体工作流的主要挑战在于模型的推理阶段与智能体的工具执行阶段之间存在不匹配。作者们指出了当前以请求为中心的系统未能解决的三个关键瓶颈:
1. KV缓存颠簸:键值(KV)缓存存储对话历史的中间数学状态。在智能体工作流中,此历史记录随着智能体的迭代而增长。在“行动”阶段(当工具运行时),模型不生成标记,但其KV缓存占用宝贵的GPU内存。请求感知系统通常会逐出此缓存以服务新请求。当工具调用返回时,系统必须执行“重新预填充”——从头开始再次处理整个历史记录。这种颠簸可将平均延迟增加7倍以上。
2. 跨节点内存不平衡:在分布式设置中,调度器通常会贪婪地将智能体的所有步骤分配给同一个GPU节点,以保持局部性。然而,由于智能体具有不可预测的生命周期和上下文长度,一些GPU会过载,而另一些则处于空闲状态。作者们观察到,节点间的峰值内存使用量差异高达51%,导致容量浪费。
3. 工具生命周期无感知:智能体需要沙盒环境(如Docker容器)来安全执行代码或访问API。现有系统通常将模型引擎与工具协调器解耦。这种缺乏同步导致“资源泄漏”,即智能体完成任务后,沙盒仍继续占用磁盘空间和网络端口。此外,智能体在等待这些环境初始化时,常常面临显著的启动延迟。

图2:使用标准请求感知调度时,不同GPU节点之间随时间变化的内存不平衡。
程序感知抽象
ThunderAgent的核心创新是**智能体程序(Agentic Program)**抽象。程序PPP被定义为一个元组,它捕获了整个工作流的状态和需求:
在这个定义中,IDIDID是一个唯一标识符,ccc是当前上下文长度(token数量),TTT代表所需的工具环境,LLL是分配的后端节点,τ\tauτ表示当前阶段('推理'或'行动'),sss是调度状态(活动、暂停或终止)。
通过使工作流状态对运行时可见,ThunderAgent可以做出明智的决策,例如何时保持模型的内存活跃,何时将程序移动到不同的节点,以及何时启动或关闭工具环境。这种抽象将高级调度逻辑与特定的LLM引擎或容器编排器解耦。
成本建模和调度策略
为了优化资源分配,ThunderAgent采用基于时空积(Space-Time Product, STP)的成本模型。STP衡量程序在特定时间段内占用了多少内存:
系统将总成本分解为生产性工作(解码和初始预填充)和开销。ThunderAgent调度器的目标是最小化三种类型的开销:
Costrecompute\text{Cost}_{\text{recompute}}Costrecompute(来自被逐出的缓存),
Costunused\text{Cost}_{\text{unused}}Costunused(来自节点不平衡)以及
Costcaching\text{Cost}_{\text{caching}}Costcaching(来自为空闲智能体持有内存)。
程序感知等待队列
ThunderAgent管理一个全局等待队列,允许它动态地暂停和恢复程序。它使用两个专门的评分来优先处理这些操作:
• 恢复评分:用于决定将哪个暂停的程序重新调回GPU。
Srestore(P)=1cP+I(τ=’Reasoning’)S_{\text{restore}}(P) = \frac{1}{c_P} + \mathbb{I}(\tau = \text{'Reasoning'})Srestore(P)=cP1+I(τ=’Reasoning’)
• 暂停评分:用于在内存已满时决定逐出哪个活动程序。
Spause(P)=1cP+I(τ=’Acting’)S_{\text{pause}}(P) = \frac{1}{c_P} + \mathbb{I}(\tau = \text{'Acting'})Spause(P)=cP1+I(τ=’Acting’)
这些评分优先处理上下文长度(cPc_PcP)较小的程序,因为如果它们被逐出,重新计算的成本较低。作者证明重新计算成本与上下文长度呈二次关系:
因此,首先逐出最短的程序可以最大限度地减少整个系统浪费的计算。
行动中程序的时效衰减
最困难的权衡之一是决定为当前正在等待工具完成的智能体持有KV缓存多长时间。如果工具快速完成,保留缓存可以节省时间。如果工具需要很长时间,缓存只是浪费GPU内存。ThunderAgent通过一个时效衰减函数f(tq)f(t_q)f(tq)解决了这个问题,它随着“行动中”程序的等待时间逐渐降低其优先级。这种衰减可以遵循指数形式f(tq)=e−λtf(t_q) = e^{-\lambda t}f(tq)=e−λt或几何形式f(tq)=x−kf(t_q) = x^{-k}f(tq)=x−k。这使得系统能够自动逐出长时间运行的工具调用,以释放内存用于活跃的推理。
论文、讨论和资源链接:https://www.alphaxiv.org/abs/2602.13692,感兴趣的读者可以关注。
更多链接
内容:袁知秋、程湘婷、王图图

诚邀您加入我们的gStore社区,我们将在群内解决使用问题,分享最新成果~
请在微信公众号图谱学苑发送“社区”入群~

微信社区群:请回复“社区”获取




