数据产业观察日报|Agent嗷嗷待哺
dbt把分析师改叫'上下文工程师',Doris和StarRocks齐吹多模态湖仓,而真正要紧的是:没人验证Agent读了数据之后说了什么。
一、开篇暴击:今日最荒诞的一幕
dbt Summit 2026 上最精彩的一场戏,不是发布了什么新产品,而是一场集体改名仪式——官方博客标题写得明明白白:《From analytics engineer to context engineer》,从分析工程师到上下文工程师。
一夜之间,写SQL、调模型、修看板的兄弟姐妹们,统统获得了新头衔。工作内容变了吗?没有。变的是故事:以前你是「为人类决策服务的数据人」,现在你是「为LLM准备上下文的关键岗位」。薪资涨了吗?也不好说,但PPT肯定重做了一遍。
dbt 同场还发了另一篇更有意思的文章:《Model for the token, not the table》——为token建模,而不是为表建模。翻译一下:过去二十年数据建模是为了让BI工具有序地查表,现在要让大模型有序地「吃」上下文。
荒诞在哪?荒诞在整场大会没人问一句:如果建模的对象从表变成了token,那数据治理、血缘、口径这些老大难问题,是解决了,还是只是换了个更贵的容器装着?改名是行业里成本最低的创新。头衔免费,思路另算。
二、最被高估的事:又一家「统一多模态湖仓」
今天开源圈的两颗王炸几乎同时落地:Apache Doris 发布 5.0 Preview,标题叫《A Unified Multimodal Lakehouse for Real-Time Analytics》;StarRocks 发布 4.1,口号是「Built for Production, Designed to Simplify」。Doris 4.1 还顺手把全文日志搜索和实时SQL分析焊在了一起——《Unifying Full-Text Search and Real-Time SQL Analytics》。
先说公道话:这两家的工程能力是真的。Doris把倒排索引、向量检索和SQL揉进一个引擎,对标Elasticsearch+ClickHouse的组合拳,StarRocks继续压榨join性能,都是实打实的硬活。
但「统一多模态湖仓」这个词,已经是今年第N次出现了。Databricks说自己是,Snowflake说自己在路上,现在MPP阵营也说自己是。问题是:统一的到底是存储格式、查询接口,还是PPT模板?看各家文档,所谓「多模态」基本等于「加了全文索引和向量索引」——这叫功能扩展,不叫范式统一。真正的多模态湖仓,得回答文本、日志、向量、图数据如何在同一套血缘和治理下流转,而不是「我们也能搜日志了」。
DevToData今天那篇文章标题反而是全场最清醒的:《Stop Choosing Between BigQuery and Databricks Based on Marketing Slides》——别根据营销幻灯片选BigQuery还是Databricks。可惜啊,骂幻灯片选型的文章,本身也在幻灯片式的叙事里。大家都懂道理,一到发布会,全员失忆。记住一条铁律:凡是把「统一」写进标题的,一定有至少三样东西没统一。
三、最被忽视的事:有人在给Agent的「记忆」修下水道
今天的聚光灯全打在dbt Summit和两场湖仓大版本上,但有两条不起眼的新闻,可能五年后回看价值更高。
第一条:开源工具 Leviathan 发布,为Agent打造轻量全文索引,解决「上下文塞爆」问题。听起来像个周末项目?不,它戳中的是当下Agent落地最真实的痛:上下文窗口再大,也架不住往里倾倒整个知识库。检索式记忆(retrieval memory)正在从RAG的附庸,变成Agent架构的一等公民——而一等公民需要自己的索引基础设施。
第二条:Vast Data 用分层存储(tiered storage)缓解AI Agent的记忆需求。硅谷那边的逻辑很朴素:Agent的记忆要「热」的部分很小,「温」和「冷」的部分巨大,全放GPU旁边的闪存纯属烧钱。用分层存储把记忆当数据生命周期管理,这是存储厂商少有的、真正贴合Agent工作负载的设计,而不是把「AI」贴纸拍在旧产品上。
再加上Neo4j今天连发三篇——《contextual retrieval是什么》《从记忆到行为:skills、用户画像与整合回路》《rescored binary向量搜索省内存》——你会发现一个安静的共识正在形成:Agent的记忆,正在被当成一个独立的存储子系统来建设。修下水道从来不时髦,但没有下水道,再豪华的房子也没法住人。
四、最值得警惕的事:Agent读你的数据,然后一本正经地胡说
Elastic 今天发了两个东西,一个是 9.5 版本:列式存储、向量库索引模式与自动校准、AI驱动的告警分诊。产品功能,正常迭代。
但另一篇标题值得裱起来:《Trust, but verify: Atomic claim checking against LLM hallucinations》——信任,但要核实:针对LLM幻觉的原子级断言检查。
这话从一个搜索厂商嘴里说出来,分量完全不同。Elastic每天看着海量企业数据流过自己的引擎,它出来讲「要逐条验证LLM说出的断言」,等于行业老兵承认:我们给Agent接上数据管道的速度,远远快于我们验证Agent输出质量的速度。
把今天的新闻串起来看就毛骨悚然了:dbt在把数据做得「Agent-Ready」,Fivetran 和dbt联合发布企业数据Agent化新能力,Doris和StarRocks在让Agent的SQL跑得更快,Vast和Leviathan在解决Agent的记忆容量——整条链路都在疯狂加油门。可「Agent吃到错误上下文怎么办」「Agent基于幻觉数据做了决策谁负责」这个刹车,全行业只有Elastic一家在做原子级断言检查,还是个8分而非9分的新闻。
数据质量领域有句老话:garbage in, garbage out。Agent时代的版本更狠:garbage in, confident garbage out——垃圾进去,出来的是带着引用格式、语气笃定、还会自动生成汇报PPT的垃圾。等第一批「Agent基于脏数据自主决策」的事故上头条,大家才会想起今天这篇没人转发的verify文章。别等那天的调查报告里出现你的公司名。
五、数据说话
这张图就是今天数据产业的真实拓扑:上游,Doris、StarRocks、Fivetran、dbt四路大军把数据往「上下文」里灌;中游,Vast和Leviathan在给Agent的记忆修仓库和检索通道;而最下游的「验证」环节——只有Elastic孤零零一个节点,还是条虚线。
油门踩到底,刹车只有一个供应商在装,这就是Agent-Ready浪潮的全部真相。看懂了这张图的不对称性,你就看懂了明年数据安全预算该往哪儿砸。
明日预告:湖仓大战进入「多模态」回合,但裁判席上还坐着DuckDB和ClickHouse,好戏在后头。