🏢 公司C档 · NaN分

自然语言抢不动SQL的饭碗

··约1分钟阅读

📋 总体概括

Databricks BI产品营销负责人Richard Tomlinson抛出话题:用自然语言还是SQL做数据可视化?本文从工程落地、语义层、厂商攻防三个角度拆解:NL2SQL降低了门槛,但确定性、治理与语义建模仍是SQL和分析师的护城河,二者是分层共存而非替代关系。

📄 正文

自然语言和SQL的这场对垒,与其说是技术之争,不如说是BI行业二十年权力结构的重新谈判。

Databricks 商业智能产品线的产品营销负责人 Richard Tomlinson 近期抛出了一个看似简单的问题:构建数据可视化,到底该用自然语言,还是继续写SQL?问题简单,答案不简单——它戳中了整个分析行业的痛点:过去二十年,想在BI工具里做出一张可靠的报表,你先得会SQL;现在大模型说你不用了,直接说人话就行。

真有这么好的事?作为一个亲手搭过数仓和实时管道的人,我的判断先放在这里:自然语言会吃掉BI的入口,但吃不掉BI的底座。

📊 一个问题,两种用户,两条路线

想象一个典型的业务现场:市场负责人想知道「上季度华东区高客单价客户的复购率变化」。传统路径是提需求给数据分析师,分析师写SQL、跑数、做图、来回改三版。自然语言路径是负责人直接在BI界面里打一句话,几秒后图表出来。

这是所有AI BI产品都在讲的场景,也是Tomlinson们的卖点是显而易见的:把「问数」的权力从数据团队手里交还给业务方。

但如果把用户拆开看,两条路线对应的其实是两类完全不同的人:

维度自然语言问数SQL/代码路径
典型用户业务负责人、运营、高管数据分析师、BI工程师
使用频率低频、临时性、探索性高频、系统性、可复用
产出物一次性答案、快照式图表看板、指标体系、数据资产
对确定性的要求「大致对」可容忍「必须对」,差一位小数都可能上董事会的材料
迭代方式换个问法再试版本管理、代码评审、血缘追踪

看清楚了吗?自然语言吃掉的是长尾的、临时的、探索性的分析需求——这部分需求过去因为排不上分析师的日程而被大量放弃。而SQL承载的是资产化的、被反复复用、被治理体系覆盖的那部分。

两者不是替代关系,是分层关系。行业里私下传的一句话很到位:「NL2SQL抢的不是分析师的活,是分析师永远干不完的活。」

⚙️ 自然语言问数,卡壳在哪三步

很多人对NL2SQL的想象停留在「大模型很聪明,翻译一下就行」。真实工程里,一条自然语言问题要变成一张可信的图表,链路远比想象长:

卡壳的环节不在生成查询那一步,而在它前后:

第一步,业务术语映射。「高客单价客户」是多少?5000块还是50000块?「华东区」包不含福建?这些定义只存在于企业自己的语义层和指标体系里。大模型的通用知识在这里一文不值,喂给它一张没有指标定义的宽表,出来的答案就是一本正经的错误。

第二步,权限校验。业务方随口一句「对比各事业部的毛利」,背后的数据可能涉及他无权查看的成本口径。SQL时代权限卡在网关上,自然语言时代权限必须卡在语义解析之后——这是Databricks这类把治理能力(如Unity Catalog)和AI能力放在同一个平台里的厂商,讲得最理直气壮的故事。

第三步,确定性。同样一个问题,今天生成的SQL和明天生成的SQL可能走不同的口径。探索性分析里这无所谓,但一旦这张图被截图放进月度汇报,误差就是事故。据多位接近头部数据平台的从业者透露,企业客户对AI问数的采购决策里,「答案可复现、口径可解释」的权重已经高于「准确率又提升了几个点」。

所以业界的共识越来越清晰:NL2SQL的上限不取决于模型,取决于企业的语义层和数据治理。垃圾进,垃圾出,只是现在垃圾出得更快、看起来更体面。

📈 BI三国杀:平台厂商的合围

把镜头拉远看厂商格局,这场对垒的背景是BI市场正在被云数据平台厂商从底层合围。

传统BI三强——Tableau、Power BI、Looker——的商业模式建立在「可视化层」上:数据在数据仓库里,BI工具负责建模、计算、展示。但云数仓厂商不满足于只做存储和计算,它们要往上层长,直接触达分析者。自然语言问数,正好是那条最短的路径。

Databricks 在2024年推出AI/BI产品线,其中的Genie面向的就是自然语言对话式问数;Snowflake 也把Cortex系列的分析能力作为平台叙事的核心一环。传统BI厂商则被迫在自家产品里嵌入AI助手进行防守。

把这条产品演进的时间线摆出来,节奏一目了然:

  • 2022年底 : ChatGPT引爆,自然语言交互成为全行业叙事
  • 2023年 : 各BI厂商密集发布AI助手功能,多数停留在「帮写SQL」阶段
  • 2024年 : Databricks 发布AI/BI与Genie,Snowflake 推进Cortex分析能力,AI问数从「插件」升级为「入口」
  • 2024年之后 : 竞争焦点从「能不能听懂人话」转向「语义层谁建、治理谁管、数据留谁家」

这里面有一个容易被忽略的战略含义:当自然语言成为BI的入口,谁掌握语义层,谁就掌握企业的「指标宪法」。这就是为什么Databricks讲AI/BI的故事时,一定绑定它的治理体系一起讲——入口是钩子,语义层和治理才是护城河。Tomlinson所在的BI产品线,本质上是在为平台级竞争打前锋。

💼 分析师不是被替代,是被重新定价

回到最敏感的问题:数据分析师的饭碗还端得稳吗?

我的判断是稳,但定价逻辑变了。过去分析师的价值里,有相当一部分是「人肉翻译器」——把业务方的白话翻译成SQL,把查询结果翻译成图表。这部分价值正在被大模型快速摊薄,谁也拦不住。

但另一部分价值正在升值:定义指标、维护语义层、审查AI产出的口径、为数据的正确性兜底。AI可以生成一百张图表,但总要有人回答「哪张是对的」。行业里已经出现新的分工雏形:业务方通过自然语言自助探索,数据团队从「取数的」转型为「定义数据的人」和「验收AI的人」。

对数据团队负责人,我给三条务实建议:

1. 先把语义层建起来,再谈AI问数。指标口径散落在几百张临时SQL里,上再多AI也只是加速混乱。

2. 把AI问数当新员工管理。给它明确的能力边界清单,什么问题它能答、什么问题必须走人工复核,白纸黑字写下来。

3. 别用自然语言跑财务口径的关键报表。探索用AI,报表用经过评审的确定性资产,这条线短期内不要模糊。

至于要不要「重写SQL」?不要。SQL不会消失,它会下沉为AI背后那条确定性管道——用户看不见它,但它比任何时候都重要。

小结

自然语言问数不是SQL的掘墓人,而是BI的破壁机:它打破的是数据团队和业务方之间那道由技能门槛砌成的墙,把过去做不起的长尾分析做了起来。而SQL、语义层和治理体系,则退到底座的位置,决定这座墙拆掉之后,房子还结不结实。

Richard Tomlinson 们提出的这个命题,真正的答案不在模型下一个版本的评测分数里,而在每家企业自己那张指标口径表里。接下来两年的看点很明确:谁先把语义层产品化、把AI问数的确定性做到企业可接受的水平,谁就能接住这波从「看数」到「问数」的迁移。分析师们也不必焦虑——行业淘汰的从来不是岗位,是停止进化的用法。

本文由本站 AI 辅助聚合生成,原始来源如下:

🔎 本文基于以下资讯(素材溯源 · 信息来源)

📰 相关阅读推荐(与本文相关的其他资讯)