6月29日下午,我坐在电脑前看了一场直播。
6月25日下午,我去天津参加了一场线下数据库技术交流。
短短几天,一个线上,一个线下。
在国产数据库这个圈子里,能看到不同玩家基于自己的基因和积累,在同一条时间线上回答同一个问题——这本身就是行业走向成熟的标志。
放在五年前,我们讨论的还是“能不能用”。今天,讨论的已经是“怎么重构”。
OceanBase Hours,OB新开的一个线上活动品牌。首期阵容挺全:CEO杨冰、CTO杨传辉、产品总经理韩富晟、蚂蚁集团平台技术事业群总架构师黄挺。四个人从四个角度讲同一个问题:AI时代的数据库,到底应该长什么样?
直播结束的时候,屏幕显示57.2万人看过。这个数字本身说明了一件事——关心这个问题的人,真的比我想象的多得多。

一、AI落地,瓶颈在数据
过去三年,大模型的故事讲得惊天动地。GPT-4、Claude、通义千问,能力几乎以周为单位在迭代,未来迭代的速度会更快。企业在算力上的投入也是真金白银——据Gartner预测,到2028年,全球生成式AI相关支出将超过1万亿美元。
但尴尬的是,投入和产出完全不成正比。Gartner的另一份报告指出,到2026年,60%缺乏AI就绪数据支持的AI项目将被企业放弃。兰德公司的调查更显示,超过80%的AI项目最终以失败告终。
模型买了,算力部署了,价值为什么没有兑现?
杨冰在直播里说了一句话:“模型再聪明,聊天聊得再好,如果无法理解业务、参与决策、跑通流程,它就没法为企业创造价值。”
这句话戳到了核心。通用大模型什么都懂一点,但就是不懂“你这家企业”到底在做什么。让它从“什么都懂”变成“真正懂你”,差的不是模型参数,是高质量的数据和上下文。

AI落地的终点是模型,起点是数据。中间隔着一条叫“质量”的河,过不去,就是死。
这道题之所以变得紧迫,是因为两股力量同时涌来。
第一股:数据的使用者变了。 Gartner预测,到2028年,三分之一的企业级软件应用将集成AI智能体。2024年这个比例还不到1%。数据库第一次迎来了“非人类”的使用者。以前是人写SQL查数据库,几百个并发就到顶了。未来是大量AI Agent并发访问,可能是百万级别。而且它们是7×24小时不间断运行的。
第二股:数据的形态变了。 IDC预测,到2025年,全球数据总量中80%以上是非结构化数据——文本、图像、音频、视频。过去这些数据主要用于归档、备份,妥妥的成本中心。但AI第一次让它们变得“可计算”——从企业的边角料变成了核心资产。
这两股力量叠加,传统数据库的架构开始承压。
二、湖库一体:不是拼接,是重写
传统做法是什么?多套系统拼装。
OLTP一个库,OLAP一个仓,向量一个库,文件一个湖,搜索引擎单独来一套。然后用ETL把数据搬来搬去。数据被切割、被搬运、被反复复制,Agent拿到的上下文永远是割裂的、延迟的。
OceanBase今天给出的答案是四个字:湖库一体。

CTO杨传辉在直播里说了一段话:“湖库一体不是数据库和数据湖的简单拼接,而是在同一套引擎中统一管理多模态数据,打通在线与离线处理。”
这不是加功能,是换架构。
库擅长什么?一致性、实时性、可靠性。湖擅长什么?规模、开放、多模态。AI时代的要求是两者合而为一。
具体怎么做的?OB在底层做了一个抽象叫“多模表”——让结构化字段、文本、图片、音视频、向量进入同一张表的语义之下。用户看到的还是一张表,但表背后承载的是更丰富的数据资产。
在多模表之上,还有“AI列”,可以把模型的理解能力直接引入数据处理链路——基于原始数据生成摘要、标签、特征、向量,让非结构化数据不再是“存下来的文件”,而变成可搜索、可计算、可被Agent调用的资产。

这套逻辑从技术上看是通的。但我更在意的是另一件事——谁验证过这套东西?
三、3000万个闪应用,不只是数字
OB做AI数据库的底气,来自一个别家没有的条件:蚂蚁和阿里自己的场景。
杨冰在直播里回顾了OB的成长路径:15年前的双十一高并发冲击,倒逼出了原生分布式架构。今天,支付宝AI付、蚂蚁阿福、灵光——这些最前沿的AI场景正在倒逼下一代数据库。
最让我在意的数据是灵光。

灵光是蚂蚁的一个产品,用户可以用一句话生成一个AI应用。短短几个月,它承载了3000多万个闪应用。
3000万个应用,什么概念?每个应用只有几百行数据,99%在休眠,但被唤醒时必须秒级响应。而且每个应用都需要独立的数据空间、完整的SQL计算能力,Schema还是动态变化的。
这就是AI时代的“规模”——不是单张表有多大,而是库的数量有多少。
传统做法根本扛不住。一应用一物理表,元数据就能把系统撑爆。OB的做法是“逻辑表”——每个Agent看到的是自己独立的表,底层映射到同一套物理表上,既隔离又共享。
这个案例不是实验室数据,是跑在生产环境里的。3000万个应用同时在跑,验证了湖库一体架构在千万级Agent场景下的可行性。
四、三款产品,打通从数据到智能
围绕湖库一体,OB这次发布了三款产品:
Lakebase是底层引擎。结构化、非结构化、向量数据在统一架构中被管理、加工、检索和调用。解决的是AI时代的数据底座问题。

DataStudio跑在Lakebase之上。覆盖数据接入、加工、编排、语义建模到Agent协作。把分散的数据资产转化为可调用的数据服务。解决的是数据治理与服务化问题。

DataPilot是统一的企业业务智能入口。业务人员用自然语言就能完成分析报告、数据看板和可信答案生成。解决的是业务人员怎么用数据的问题。

三层结构清晰:底层存算、中层治理、上层入口。逻辑自洽。
五、湖库一体,构建 AI 数据底座
整场直播看下来,有一个判断让我印象最深。
杨冰说,AI数据库的规则还没有固化,国产厂商有机会从“跟随者”走向“共同定义者”。
这句话的分量在于——过去几十年,数据库的标准基本是别人定的。关系模型、SQL语法、事务ACID,都是先行者划定的边界。后来者只能在这个边界里做事。
但AI数据库是一条新赛道。技术路径还没收敛。有的从数据湖往上走,有的从搜索切入,有的从数据库内核出发重构整个体系。全球几乎站在同一条起跑线上。
OB选择的路是从数据库内核出发,把在金融核心系统中验证了15年的事务一致性、高可用、弹性能力,延伸到湖和多模态数据体系之上。
这条路能不能走通,还需要时间验证。但有一点是确定的:真正需要被重写的是架构,必须被坚守的是底线。
什么底线?一致性、扩展性、可靠性、实时性。数据不出错、系统不中断、故障能恢复——这些在金融场景里锤炼了15年的基本功,在AI时代不是可以被牺牲的,而是变得更重要了。
因为当Agent从“辅助工具”走向“替人决策”的时候,背后的数据就有了和核心交易系统一样的属性:错一条、慢一拍,就是真实的业务事故。
目前OceanBase已服务超过4000家客户,其中超过60%已将OceanBase部署于其核心业务系统中。在金融领域,已覆盖全部政策性银行、多数国有大行。在非银领域,75%的头部保险机构、80%的头部券商及60%的头部基金机构选择OceanBase搭载核心业务系统。据IDC数据,OceanBase已连续三年在中国金融行业分布式数据库本地部署市场中份额排名第一。同时,它也是迄今唯一同时在TPC-C、TPC-H两项国际权威基准测试中登顶的数据库。
这些数字背后,是15年真实场景的锤炼。不是PPT上的概念,是生产环境里跑出来的能力。
六、写在最后
直播结束后,我关掉电脑沉思了一会儿。
数据库这个行业其实很有意思——它既古老,又总有新东西层出不穷。从层次到关系,从关系到NoSQL,从NoSQL到NewSQL,每一次计算范式的跃迁,都会倒逼底层基础设施重新演进。
如今,这一次,终于轮到AI了。
OB用一场发布会给出了自己的答案:湖库一体,重写架构。能不能成,现在下结论还太早。但有一点我可以确定——当一家公司说“再造一个自己”的时候,至少说明它想清楚了要往哪走。
下一个十年,OB,走着瞧。
本文基于OceanBase Hours 2026直播内容及公开资料整理




