AI for Data数据库技术评论分析· 3234 字· 约6分钟阅读

国产数据库把AI的活抢了

A
AI编辑团队AI 原创内容
2026-10-05 06:23 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

OceanBase的Data Agent方案以90.62%准确率登顶UC Berkeley与Hasura联合推出的Data Agent Benchmark,成为首个破90%的方案。本文拆解数据库厂商为何在数据智能体赛道先跑出来,以及榜单成绩与生产落地之间的真实距离。

导语

90.62%。

据量子位9月21日报道,OceanBase团队提交的Data Agent方案登顶国际数据智能体基准Data Agent Benchmark(DAB),位列第一,成为该榜单首个准确率突破90%的参评方案。

这个榜单不是野鸡榜。它由UC Berkeley EPIC Data Lab与Hasura PromptQL合作推出,评测覆盖互联网与本地数据场景。也就是说,这是学术界与工程界共同认可的一把尺子,而第一个把分数干上90%的,是一家国产数据库厂商。

我的判断很直接:数据智能体这条赛道,最先把AI能力做扎实的,大概率不是通用大模型公司,而是离数据最近的数据库厂商。OceanBase这次登顶,只是把这件事摆上了台面。

📈 先把榜单看明白,它到底在测什么

榜单分数字本身会骗人,但榜单设计不会。

先看事实。这次评测的对象是Data Agent——数据智能体,通俗讲,就是让AI听懂人的自然语言问题,自己去数据库里找答案、做分析,而不是让人写SQL。DAB基准覆盖互联网与本地数据场景,考察的是端到端的准确率,不是某一项单独能力。

关键信息内容
参评方案OceanBase Data Agent
准确率90.62%
排名第一
里程碑榜单首个准确率突破90%的方案
基准推出方UC Berkeley EPIC Data Lab × Hasura PromptQL
公开报道量子位,9月21日

这里的关键词是"端到端"。

一条数据智能体的链路,大致长这样:

任何一环出错,最终答案就是错的。这跟大模型刷榜测单点能力完全是两回事——Data Agent测的是一条完整的工程链路能不能稳定交付正确结果。90.62%意味着,在评测覆盖的场景里,十个问题它基本能答对九个。

做过数据平台的人都知道,这九个里的每一个,过去都要靠分析师人肉完成。

💡 为什么先跑出来的是数据库厂商

离数据近的人,先拿到AI的船票。

过去一年,做数据智能体的团队不少:大模型创业公司、BI厂商、独立Agent创业团队,全都在讲"对话式数据分析"的故事。但OceanBase这次登顶,其实揭示了一个很朴素的产业逻辑——

数据智能体的难度,七成不在模型,在数据侧。

一个Agent要正确回答业务问题,它得知道表在哪儿、字段什么含义、两张表怎么关联、哪些数据有权限限制、查询怎么跑才不把库拖垮。这些东西,学术界叫元数据与语义层,工程界叫数仓基建,它们全都长在数据库和数仓里面。

大模型公司再强,拿到一个陌生企业的库,它就是个盲人。而数据库厂商手里,天然握着三样别人短期补不齐的东西:

1. 执行引擎与优化器——生成的SQL能不能跑、跑多快、会不会把生产库打挂,这是十多年的硬功夫;

2. 元数据与权限体系——谁能看到哪张表、哪个字段,这套体系是数据安全的地基;

3. 多年积累的查询场景语料——什么样的业务问题对应什么样的查询模式,这些know-how在厂商侧沉淀了多年。

从这张产业链图能看清楚:数据智能体处在大模型、数据库厂商、基准机构三方交汇的位置。大模型提供推理底座,但真正决定交付质量的是数据侧的工程能力。

据业内多位接近人士的说法,这类榜单上通用背景的团队,失分点往往不在"不会写SQL",而在"写出来的SQL在真实库上跑不对、跑不动"。这正是数据库厂商的主场。

⚠️ 榜单第一,离生产可用还有几道坎

分数是入场券,不是交付函。

作为亲手搭过数仓和实时管道的人,我必须泼一点冷水。榜单成绩和生产可用之间,隔着至少三道坎:

第一,长尾问题更贵。 90%的准确率,意味着剩下10%的长尾场景还没被覆盖。而企业里最容易出事的,恰恰是那10%——一次错误的聚合口径、一个漏掉的时间条件,给出的错误结论可能直接影响经营决策。榜单可以重跑,生产不能。

第二,成本与延迟。 Agent链路里有多轮推理、校验、修正,每一次都是token成本和响应时间。企业数据团队天天算账,一个回答要几毛钱、几十秒,能不能扛住业务方的并发提问,这是商业上能不能成立的硬约束。

第三,权限与安全。 让AI自主查库,等于把数据访问权交给了一个"非人类员工"。行级权限、字段脱敏、审计日志,这些治理能力必须跟着Agent走,否则数据安全部门第一个不签字。

维度通用大模型Agent数据库原生Agent
语义理解强依赖模型,够用
元数据感知需额外对接原生内建
SQL执行与调优弱项核心积累
权限与审计需自建继承库侧体系
生产落地壁垒高相对可控

(注:此表为基于公开信息的产业逻辑推演,非评测结论。)

业内私下流传的一句话是:榜单分数只证明你有资格进考场,生产环境才是真正的考场。OceanBase拿到了前者,后者要靠一个个企业客户去验证。

🚀 真正的信号:数据库的叙事正在换轴

这波登顶,更大的意义在商业叙事层面。

数据库市场卷了十几年,同质化竞争已经很残酷:兼容性、性能指标、生态适配,各家能讲的故事越来越像。当产品能力趋同,价格战就是唯一出路——这是所有基础软件厂商都不想面对的局面。

而Data Agent给出了一个新叙事的可能性:数据库不再只是被动存储和查询的底座,而是主动干活的数据层。

想象一下这个场景的变化:过去业务方要一个数据结论,流程是提需求、排期、分析师写SQL、出报表,周期以天计;有了可靠的数据智能体,流程变成直接提问、几分钟出答案。数据库厂商的交付物,从"一个能用的库"变成了"一个会干活的数据同事"——前者的定价锚是资源和许可,后者的定价锚是解决问题的效率。

这背后的赛道归属很清晰:AI用工程化方式重构数据的消费链路,属于典型的AI for Data方向。而国产数据库在国际基准上拿下第一,也说明在AI与数据基础设施结合这个新变量上,国内厂商和国际同行是在同一条起跑线上竞争的,甚至因为数据场景的复杂度和工程密度更高,跑得可能更快。

接下来的看点有两个:一是OceanBase的Data Agent能不能把榜单成绩转化为真实客户的生产案例,二是DAB这类基准会不会被更多厂商跟进——如果各家都开始 seriously 打榜,说明这条赛道从概念期进入了工程期。概念期看PPT,工程期看分数和客户,后者才是产业真正开始的标志。

小结

90.62%这个数字本身没那么重要,重要的是它验证了一条路径:数据智能体的胜负手在数据侧工程能力,而数据库厂商天然占位。OceanBase登顶DAB,等于替全行业做了个示范——AI叙事不一定长在大模型公司身上。接下来比的不是谁的分高,而是谁先在企业生产环境里,把"对话即分析"从Demo跑成日常。数据基础设施的AI化,才刚刚开题。