🏢 公司C档 · NaN分

别让大模型干数据库的活

··约1分钟阅读

📋 总体概括

Agent落地贵且不可靠,根因常不在模型,而在数据架构:让LLM包办集成、清洗与计算,等于为每一行扫描重复付Token税。本文从Databricks的Genie Ontology与'上下文工程'转向出发,拆解AI时代数据栈的新分工线。

📄 正文

做Agent的团队最近都在聊同一件事:账单。

一个客户问答Agent,上线两周,Token消耗是预期的十倍,答案还时对时错。复盘下来,问题不在模型,而在架构——团队让大模型包办了本该由数据库引擎干的活。这是2025年Agent落地最典型的翻车姿势,也指向一个正在成型的产业共识:Agent的瓶颈已经从模型能力,转移到了数据架构。

本文聊三个关键词:Token税、本体(Ontology)、上下文工程。它们分别对应成本、语义和岗位,也画出了下一代数据栈的分工线。

📉 Token税:架构错误的账单化

让概率模型干确定性工程,是最贵的架构错误。

先看一个场景。某SaaS团队做了一个"问数据"Agent,用户提问,Agent把相关表结构、示例数据、业务口径一股脑塞进上下文,让LLM自己理解表关系、自己拼接join逻辑、自己心算聚合结果。演示很惊艳,生产很灾难:每次请求动辄几十万Token,成本压不住;更糟的是,同样的提问,昨天算出的GMV和今天对不上。

这正是业界那篇被广泛转发的《Token Tax》一文戳破的问题:Token成本高、输出不可靠,很多时候不是模型的错,是你的架构让模型干了数据库该干的活。 数据集成、清洗、join、聚合,这些是确定性工作——引擎来做,成本近乎摊薄为零,结果可复算、可审计;LLM来做,每一行扫描都在烧钱,每一次计算都在掷骰子。

维度LLM包办式架构引擎分工式架构
数据集成与清洗靠提示词与重试统一引擎内完成
Token消耗随数据量线性膨胀只为推理与总结付费
输出稳定性同问不同答结果可复算
审计与追责几乎无从下手SQL与执行计划可回溯

道理不复杂,但很多团队是拿着账单才看懂的。一位做过类似项目的架构师私下坦言:"我们把三个月的提示词优化预算,最后都换成了重写一条物化视图。"

产业逻辑随之清晰:AI没有消灭传统数据工程,反而把它的价值放大了。湖仓一体引擎承接重计算,LLM只做它擅长的不确定推理——这条分工线画清楚了,Agent的成本结构才立得住。数据平台的的老牌能力(统一存储、查询优化、物化),正在以"给AI省钱"的方式迎来第二春。

🧠 本体:Agent的企业世界观

通用Agent不缺智商,缺的是企业的世界观。

Databricks在官方博客里讲了一个容易被忽视的细节:通用AI Agent擅长搜网页、做推理、写代码,这些是公开互联网教出来的本事;可一旦走进企业内部,它们就"失明"了——不知道表里的字段对应哪个业务对象,不知道"活跃客户"在这家公司口径里意味着什么,更不知道两个系统之间的隐含关联。

Databricks的答案是 Genie Ontology:在产品开发中,把散落各处的表、指标、业务规则,组织成一张语义网络,让Agent按业务含义去调用数据,而不是按字段名去猜。

注意这张图里LLM的位置:它不在数据通路上,只在两端。查什么、怎么查,由本体和引擎决定;LLM负责把结果变成人话。

这件事的产业意义在于:语义层从BI时代的可选项,变成了Agent时代的必需品。 过去建语义层,是为了让报表口径一致,建不建看团队自觉;现在建本体,是Agent能不能干活的先决条件——没有世界观的企业知识,再强的模型也只是在猜。上一轮数据建模,建的是表和看板;这一轮,建的是企业的世界模型。中间隔着整整一个语义基础设施的产业带,从指标平台到知识图谱到本体工具,都在被这波需求重新定价。

🔧 分析工程师,正在变成上下文工程师

上一轮建模建的是表,这一轮建模建的是上下文。

Databricks最近开的系列文章起了个直白的标题:《从分析工程师到上下文工程师》。开篇就点破了一个转变:从"为看板建模数据",转向"为Agent建模上下文"——系列第一篇,用的就是自家的Gong销售对话数据来练手。

这个转变比听上去深。分析工程师的技能栈,核心是维度建模、指标口径、看板设计,服务对象是人——人看得懂图,就行。上下文工程师的服务对象是Agent,事情完全变了:

看板时代

报表与仪表盘

看板时代

建模为人读

数仓成熟期

维度建模与指标口径

数仓成熟期

建模为一致性

语义层阶段

指标平台与语义层

语义层阶段

建模为复用

Agent时代

上下文与本体

Agent时代

建模为机器读

为机器读,意味着要回答新问题:Agent该先看到哪些信息?检索怎么切分才能命中?工具的契约怎么描述才能被模型稳定调用?哪些上下文必须精简、哪些必须详尽?这些都是建模,只是建模的对象从"数据结构"变成了"模型的工作记忆"。

据多位接近一线数据团队的人士观察,这个岗位的真实需求已经在冒头:招的不是会写DBT模型的人,而是既懂数据口径、又懂模型行为的人。稀缺,所以贵。类似十年前"数据工程师"从后端工程师里分化出来的过程,正在重演——只不过这次分出来的,是懂数据、更懂模型胃口的人。

对从业者来说,这是个难得的窗口期:你的维度建模功底没有贬值,它只是需要换个服务对象,重新议价一次。

🏗️ 分工线画清楚,钱才知道往哪流

新的价值分配,藏在架构图的层与层之间。

把前面几节拼起来,Agent时代的数据栈长这样:底层是统一湖仓引擎,负责存与算;中间是语义本体,负责让机器理解业务;上层是Agent编排与LLM,负责推理和交互;而"上下文工程师"这个新角色,横跨中间层,决定Agent看到什么。

这条分工线对产业的影响有三层。

第一,数据平台厂商的叙事从"支撑AI"变成"AI负载本身"。Token税的逻辑讲给CFO听最有效:同样的Agent应用,架构不同,推理成本可能差一个量级。过去数据平台采购讲的是数据治理和合规,现在多了一个最硬的理由——省钱。Databricks把Genie Ontology放到产品开发的核心位置讲,正是这个逻辑。

第二,模型厂商和数据平台的边界感反而更清晰了。模型越强,越需要高质量上下文喂养;上下文供给越好,模型输出的商业价值越高。这是一条正和的产业链,而不是零和的替代关系。

第三,企业的技术采购优先级正在被重排。一套好的语义层加统一引擎,比换一个更强的模型,对Agent落地质量的提升更可测、更可控。业内私下流传的判断是:未来两年的Agent项目竞标,胜负手不在谁用的模型新,而在谁的本体建得全、谁的引擎扛得住并发。

小结

Agent落地的真问题,从来不是"模型够不够聪明",而是"架构分没分好工"。把确定性工作还给引擎,Token税就交得少;把业务含义写成本体,Agent就有了世界观;把建模能力迁移到上下文,数据人就完成了这轮价值重估。

往前看,这套分工还会继续下沉:本体可能标准化,上下文工程可能工具化,但"让概率模型干概率的事、确定性引擎干确定的事"这条原则,会是AI时代数据架构的底层共识。早看懂这条线的团队,已经在账单上兑现了。

本文由本站 AI 辅助聚合生成,原始来源如下:

🔎 本文基于以下资讯(素材溯源 · 信息来源)

📰 相关阅读推荐(与本文相关的其他资讯)