数据产业观察日报|元数据即Prompt
📋 总体概括
Claude直连企业库写SQL刷屏,但AI查数的真上限不是模型而是你的dbt文档;Polars 2.0悄悄砍掉join保序,丹麦880万人信息裸奔给所有人敲了警钟。
📄 正文
一、开篇暴击:今日最荒诞的一幕
今天最魔幻的一幕,不在硅谷,在A股研报里。国联民生把星环科技列为10月金股,理由是——'中国的Databricks'。
七个字,一个估值锚,齐活。这不是分析,这是贴牌。
Databricks刚GA了permission-aware的on-behalf-of-user授权应用,星环科技的真功夫在另一条赛道上。拿人家最新的PR稿当自家标的的投资逻辑,就像给国产车贴个'中国保时捷'标签就敢喊300亿市值——仿佛公司价值不取决于自己做了什么,而取决于太平洋对岸那家独角兽融了多少钱。
二级市场永远需要一个'对标物'来快速定价,这可以理解。但当'对标'替代了'分析',当'中国的XX'成为金股理由的正文,你就该明白:研报写得越像绰号,里面的干货就越少。投资者看到的是星辰大海,数据行业的人看到的是——哦,又一个不懂行的钱要进来了。
二、最被高估的事:'Claude能写SQL了'的狂欢
Anthropic给Claude上线实时看板功能:连企业数据源、自写SQL、生成可视化。朋友圈瞬间分裂成两派——一派惊呼'分析师已死',一派转发'AI替代不了我'。两派都问错了问题。
真正的问题,被一篇低调的技术文章一针见血地戳穿了:你的dbt描述,才是AI Agent真正的Prompt。
看明白了吗?AI连上数据库不难,难的是它知道user_status_2是什么意思、ord_amt是含税还是不含税、这张表的过滤条件为什么必须带is_deleted。这些东西从来不在数据库里,而在dbt的YAML文档里,在数据团队多年积累的元数据里。
所以'AI自助分析'的真相是:模型能力已经不是瓶颈,瓶颈是你那三年来没人维护、half是'TODO待补充'的字段描述。Claude再聪明,读到的元数据是垃圾,它写出来的SQL就是高级垃圾——而且是用图表包装的垃圾,危害更大。
真正的赢家名单里没有Anthropic,反倒是Databricks和Snowflake:它们手里的目录、血缘、权限体系,正是AI查数的'操作系统'。Databricks今天同步推的on-behalf-of-user授权,说明人家想得比'能不能查'深一层——'该不该让这个用户查'。这边还在惊叹AI会写SQL,那边已经在管SQL的户口本了。差距,就在这一层。
三、最被忽视的事:Polars 2.0砍掉了'保序'
今天热度最高的技术新闻之一,是Polars 2.0发布。但大部分转发都停在了'新版更快了',没有人认真讨论那个真正危险的变化:joins不再保持行顺序。
这四个字翻译成人话就是:所有隐式依赖'join之后左表顺序还在'的管道,都埋了一颗雷。而这样的管道,遍地都是——做好的结果导出去给业务方核对顺序,和pandas行为对拍做回归测试,靠iloc取'第一条'当代表记录……这些代码不会报错,它们只会安静地给出错乱的结果,直到某个分析师发现报表数字'对不上',然后数据团队花两天排查,最后发现是引擎升级了语义。
这类'语义级变更'比任何性能跑分都重要。同期还有几件事值得记一笔:Apache Doris与Fluss打通流湖统一查询,Cloudflare K2把事件流建在R2对象存储上、生产端延迟压到一秒,Grab重构柜台服务存储把P99延迟砍了50%。它们共同指向一个趋势:存储层正在大合并,流、湖、对象存储的边界被一行行拆掉。今天不关注,明年你的架构选型就会被这些'细节'重构。
四、最值得警惕的事:880万人的裸奔
丹麦国家数据库,约880万人的身份信息遭到非法访问,警方已介入。一个国家近乎全体公民的数据,就这样'被访问'了。
这不是童话王国的偶发事故,这是给所有还在喊'数据要素流通'的人的一盆冷水:流通越快,失守越快。数据不流通时,泄露靠的是U盘;数据流通后,泄露靠的是一个配置错误、一次越权查询。
巧的是,央行今天也就金融信用信息基础数据库管理办法公开征求意见。一边是国家级基础设施在补治理的课,一边是Claude们正兴冲冲地直连企业数据源。你猜企业内部的安全建设跟得上哪一个的速度?
AI直连数据的最大风险从来不是'查错数',而是权限模型没跟上:Agent用谁的身份查?能看哪些行哪些列?查完的结果落在哪里?Databricks今天GA的on-behalf-of-user不是产品Feature,是生存必需品。而绝大多数自建分析栈的企业,连'谁能看哪张表'都还在用Excel维护。丹麦的880万,就是这个差距的代价演示。
五、数据说话
这张图说清了今天所有新闻的因果链。AI Agent是放大器:上游元数据是什么质量,下游就是什么成色——dbt文档写得稀烂,Claude生成的就不是看板,是精密包装的错误答案;权限模型没建好,它就不是生产力工具,是丹麦式泄露的企业内测版。所以别再问'模型够不够强'了,问自己两个问题:我的字段描述敢不敢给AI看?我的授权粒度敢不敢放Agent进去?两个都不敢,就先别追'AI自助分析'的风口——地基没打,楼越高塌得越响。
今日一句话总结:AI把SQL写明白了,但把'该不该查'留给了你。
本文由本站 AI 辅助聚合生成,原始来源如下: