暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

图谱动态|学苑周刊 NO.235

图谱学苑 2025-09-09
157

本期将分享近期全球知识图谱相关

行业动态、近期会议、论文推荐




行业动态


 Neo4j发布Infinigraph架构 


Neo4j发布了Infinigraph,称其为分布式图技术的重大进步。这一架构允许用户在单一图数据库平台上同时运行操作和分析工作负载,处理规模超过100TB,且无需分割图结构、复制基础设施或影响性能。新架构使用分片将图的属性数据分布在集群的不同成员中。图在逻辑上保持完整,查询按预期运行,应用程序无需代码即可扩展更改或手动解决方法。https://short-link.me/18-H-




建筑知识图谱+大模型



依托国内领先的“晓图”数据智能平台,推动建筑全周期数据要素化闭环。研发的建筑知识图谱搭载LLM大模型,能实现数据标准化治理与智能洞察,还构建了建筑领域高质量数据集,完成了建筑领域首例数据资产加工入表, 深度赋能城市更新、具身机器人孪生空间仿真训练、超级工程数智低碳转型,并通过高精度传感器,可实现数智控制智慧低碳场景应用。

https://short-link.me/18-L7



近期会议

 

CCKS 2025



CCKS 2025 大会由中国中文信息学会语言与知识计算专业委员会主办,由福州大学承办,于 2025 年 9 月 19-21 日在福州举行。

全国知识图谱与语义计算大会已经成为国内知识图谱、语义技术等领域的核心学术会议,聚集了知识表示与推理、自然语言理解与知识获取、图数据管理与图计算、智能问答等相关技术领域的学者和研发人员。

详情访问:

https://sigkg.cn/ccks2025/



CCF BigData 2025



CCF大数据学术会议由中国计算机学会(CCF)主办,是我国大数据领域最具影响力、规模最大的高水平学术会议之一,自创办以来已成功举办12届。大会致力于打造集学术交流、产业合作与政策研讨于一体的高端平台,推动大数据技术的前沿研究与应用落地。第十三届CCF大数据学术会议(CCF BigData 2025)将于2025年9月12日至14日在天津市举办,由CCF大数据专家委员会与天津大学联合承办。大会将持续发挥国家级智库作用,汇聚国内外顶尖专家学者与产业力量,助力国家大数据战略实施与数字中国建设。

详情访问:
https://ccf.org.cn/BigData2025



论文推荐

Sirius

本周推荐的是arxiv 2025.8上的论文:Rethinking Analytical Processing in the GPU Era

背景与动机

图形处理单元(GPU)在分析型数据库工作负载中的广泛应用长期以来一直受到几个根本性限制的阻碍。传统障碍包括有限的GPU内存容量、通过PCIe互连的数据传输瓶颈、高昂的硬件成本,以及构建生产级GPU优化SQL引擎所需的大量工程投入。然而,近期硬件和软件的进步从根本上改变了这一格局,开创了作者们所称的数据分析“GPU时代

这一转变体现在GPU硬件能力的显著提升上。内存容量已从2016年的16 GB增加到最新一代的288 GB,同时互连带宽也大幅增长——NVLink带宽在2016年至2024年间从80 GB/s增至900 GB/s,而PCIe带宽到2024年将达到256 GB/s。此外,GPUDirect Storage等技术使GPU能够直接访问存储系统,绕过CPU的参与,消除了传统的数据传输瓶颈。


图:GPU内存容量演进,显示从201616 GB (P100) 2025288 GB (B300) 的显著增长,虚线表示预计增长。

在软件方面,可组合数据系统和开源GPU库的成熟显著降低了工程障碍。Substrait等标准为查询计划提供了统一的中间表示,而libudfRMM (RAPIDS Memory Manager) NCCL等库则分别为关系操作、内存管理和分布式通信提供了高度优化的GPU原语。

系统架构与设计

Sirius围绕两个核心设计原则构建,这使其区别于现有方法。

第一个是GPU原生执行,其中GPU作为主要执行引擎,而非仅仅是加速器。与将GPU加速附加到现有CPU优化引擎的混合CPU-GPU系统不同,Sirius将整个查询计划在GPU上执行视为默认路径,CPU主要作为不受支持操作的备用方案。

第二个原则是即插即用加速,通过标准接口实现与现有数据库系统的无缝集成。Sirius消费以Substrait格式表示的查询计划,使其能够作为任何Substrait兼容主机系统的加速器,而无需对现有代码库进行重大修改。

系统架构由几个关键组件组成:

查询执行引擎:采用流水线执行模型,其中查询计划被划分为由CPU线程协调GPU任务执行的流水线。在每个流水线内部,它使用类似于DuckDB的推式执行模型。该引擎大量利用libudf实现大多数物理运算符,提供了在libudf实现和自定义CUDA内核之间切换的灵活性。

缓冲区管理器:管理GPU内存,该内存分为数据缓存(预分配用于缓存数据)和数据处理(由RMM管理用于中间结果)。管理器处理列式格式转换,尽可能采用零拷贝优化,尤其是在Arrow派生格式之间。

交换服务层:通过使用NCCL原语进行节点间数据交换,实现高速GPUGPU通信,从而编排分布式查询执行。它将交换建模为专用的物理运算符,支持广播、混洗、合并和多播操作。

论文、讨论链接:https://www.alphaxiv.org/overview/2508.04701v2,感兴趣的读者可以关注。



更多链接


公开课程 | 大规模图数据管理与分析 开讲啦!
图解李白的“朋友圈”
图解《狂飙》人物关系
用知识图谱打开梁山好汉一百单八将
公开课程 | 玩转gStore 更新啦!
公开课程 | 图数据管理与挖掘 最终讲-第九讲:面向知识图谱的自然语言问答
图说《人民的名义》
导师访谈 | 邹磊:对数据科学以及本科生科研的思考

内容:袁知秋、程湘婷、卢小柯、王图图





诚邀您加入我们的gStore社区,我们将在群内解决使用问题,分享最新成果~


请在微信公众号图谱学苑发送“社区”入群~



免责声明本文全部内容均来源于网络开放信息整理,如有侵权,请联系删除
欢迎关注北京大学王选计算机研究所数据管理实验室微信公众号“图谱学苑“
实验室官网:https://mod.wict.pku.edu.cn/

微信社区群:请回复“社区”获取

实验室开源产品图数据库gStore
gStore官网:https://www.gstore.cn/
GitHub:https://github.com/pkumod/gStore
Gitee:https://gitee.com/PKUMOD/gStore

文章转载自图谱学苑,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论