🏢 公司C档 · NaN分

企业AI的隐性税单,藏在数据架构里

··约1分钟阅读

📋 总体概括

企业AI项目大量超支与ROI不及预期,根源常被归咎于算力与模型,但真正的隐性成本在数据架构:旧数仓撑不住AI负载,重复存储、管道维护、治理返工层层加税。本文拆解这笔没人预算过的税怎么算、谁在补课,以及企业该把数据架构提到什么位置。

📄 正文

企业AI的隐性税单,藏在数据架构里

过去三年,几乎所有大公司的董事会都批过AI预算。算力、软件、实施服务,一项项都写进了商业计划书。钱花到什么量级了?Menlo Ventures 2024年11月发布的《The State of Generative AI in the Enterprise》报告给出了刻度:仅2024年,企业在生成式AI上的支出就达到138亿美元,是2023年23亿美元的6倍。但SiliconANGLE最近一篇文章点破了一个尴尬的事实:这些预算表里,几乎没有一行是给底层数据架构留的。文章把这叫作「企业AI的隐性税」——它不进采购合同,不出现在汇报PPT里,却在每一个AI项目交付时准时出现。我的判断很直接:未来两年,决定企业AI ROI的不是模型多强,而是这笔税交了多少。

💸 预算表上没有的那一行

金句先行:AI项目烧钱的速度可以预估,但漏算的成本从来不在报表上。

设想一个典型场景:某大型企业立项一个AI应用,董事会批准计划,财务部门搭好商业模型,采购团队谈下三年算力框架。一切看起来无懈可击。然后项目组开工,才发现最基础的问题没人回答——数据从哪来、存在哪、谁负责治理、权限怎么管。这类失败还没上过头条,因为它不像模型幻觉那样有戏剧性,它只是安静地让项目延期、预算膨胀、ROI一再下调。这不是轶事,是有统计的:

  • 麻省理工学院 Media Lab 的 Project NANDA 团队2025年发布的《The GenAI Divide》报告,对300多家企业AI试点调研后发现,约95%的企业生成式AI试点未产生可衡量的业务回报,而报告把「数据与流程适配失败」列为主要原因之一。
  • 兰德公司(RAND) 2024年的研究《The Root Causes of Failure for Artificial Intelligence Projects》指出,超过80%的AI项目以失败告终,失败率约为传统IT项目的两倍;领导层误判与数据基础薄弱被并列为四大根因之一。
  • Gartner 在2024年7月明确预测:到2025年底,至少30%的生成式AI项目会在概念验证(PoC)后被放弃,理由是「数据质量差、风险控制不足、成本攀升或业务价值不清」——四条理由里,两条直接指向数据侧。

这正是「隐性税」的本质:它不是一次性支出,而是持续摊销的成本。算力是一口价,数据架构的债是按月计息。对照Gartner给出的PoC淘汰率可以推断,大量项目在立项环节就缺了数据架构评审——等到集成阶段才发现底层能力缺位,只能边跑边补,而补课的钱,最后都从AI项目的ROI里扣。

这不是国内独有的现象。Gartner 2024年面向全球CIO的调查中,「数据就绪度不足」被反复列为生成式AI落地的首要障碍之一;海外CIO圈子里流传的同一句话是:AI的账,最后都在数据团队身上找补。只是没人愿意在立项报告里写这一行。

🏗️ 旧地基,撑不起新负载

金句先行:给BI报表盖的房子,住不进大模型。

问题的根源在于,绝大多数企业的数据基础设施是为上一个时代的需求设计的。传统数仓和服务于看板的时代,数据是结构化的、批处理的、T+1就够用的。而AI负载完全不同:它要吃原始的、非结构化的文本图片音视频,要求特征新鲜度以分钟甚至秒计,需要血缘可追溯、权限可下钻。地基没换,楼盖得再高也是危房。

数据侧工作量到底有多重,业界早有量级共识。Anaconda 历年的《State of Data Science》调查显示,数据科学家近40%–45%的工时花在数据清洗与准备上;更早被《福布斯》广泛引用的 CrowdFlower 调查甚至给出了80% 这个数字。这意味着所谓「AI工程」,主体从来是数据工程。

完整的AI数据链路长这样:

注意这条链路里,真正的瓶颈往往不在中间那几个光鲜的环节,而在两端:上游的集成管道是否稳、数据是否可信,下游的权限治理是否能通过安全审计。把上面几份调查合起来看,一个可以写进董事会材料的换算是:AI项目约80%的工程量花在数据侧,但绝大多数企业的预算结构恰好倒过来,80%给了模型侧。这个倒挂,就是隐性税的税率。

💰 这笔税到底怎么算

金句先行:隐性税最狠的地方,是它专挑你没设防的科目收钱。

具体拆开看,这笔税有几个典型的税目,每项都能算出数字:

税目典型表现参考成本量级为什么被漏算
重复存储同一份数据在数仓、数据湖、向量库各存一份以AWS S3 Standard美东定价(约0.023美元/GB/月)计,1PB热数据存储约2.3万美元/月;三份冗余即近7万美元/月,年化约83万美元——这还只是存储费,不含跨区流量采购时只算了算力单价
管道维护每接一个AI应用就新建一批ETL作业按行业经验值,每条生产级ETL管道年均维护成本数万美元起,5个应用×10条管道就是数十万美元级被当作一次性实施费
治理返工权限、血缘、质量规则推倒重来治理返工通常吃掉数据团队20%–30%的迭代产能,以10人团队百万年薪包计即20万–30万美元治理长期被视作成本中心
数据修复模型效果差,回溯发现是数据质量问题结合Anaconda的调查口径,数据科学家近半工时本可服务建模,却消耗在反复修数据上归因困难,常被误判为模型问题
人才溢价既懂数据工程又懂AI的工程师薪资翻倍招聘平台数据显示,具备湖仓+LLM经验的数据工程师溢价普遍在30%–50%以上招聘计划按旧岗位编制

这些税目有个共同特征:单看每一项都不大,叠在一起就是项目利润率的全部。更麻烦的是归因错位——模型效果不好时,第一反应是换模型、调参数,很少有人第一时间去查底层的数据质量。于是修数据的钱,以「多轮模型迭代」的名义反复支出,税就这么越滚越多。

至于「云账单里有多少是在为架构不合理买单」——这个不用猜,Flexera 2024年的《State of the Cloud》报告(调研对象为491家企业)显示,受访企业自估约27%的云支出被浪费,主要流向闲置资源与过度冗余。企业上AI之后存储和集成开支的增长普遍超出立项预期,不是算力太贵,是同一份数据被反复搬运、反复计算。

🚧 补课的人已经上路

金句先行:每当泡沫期的问题显形,基础设施层就开始赚钱。

产业界的反应其实很快,而且反应直接写进了财报:

  • Databricks 在2025年初宣布年化收入突破30亿美元,并明确把AI数据平台(训练数据、特征、向量治理)作为核心叙事,2024年底以620亿美元估值完成新一轮融资。
  • Snowflake 2025财年(截至2025年1月)收入约36.3亿美元,同比增长约29%,其财报电话会反复强调的三个词是:AI、非结构化数据、治理。

湖仓一体从概念变成了默认选项,Iceberg、Delta Lake这类开放表格式成为各方角力的焦点;Databricks和Snowflake这两家昔日路线迥异的对手,如今产品版图越来越像,都在往AI数据平台的方向收拢。这背后是同一个判断:AI时代的数据平台,必须同时管好训练数据、特征、向量和非结构化资产。

回看这几年的节奏,其实脉络清晰:

2023年

生成式AI爆发

算力成为采购主角

算力成为采购主角

2024年

RAG与向量检索普及

非结构化数据首次成为核心资产

非结构化数据首次成为核心资产

2025年

AI项目规模化落地

数据架构短板集中暴露

数据架构短板集中暴露

2026年

湖仓与AI平台加速融合

治理能力成为采购硬指标

治理能力成为采购硬指标

平台厂商在补课,企业自己也在补。越来越多团队开始把数据就绪度(data readiness)当作AI立项的前置检查项,而不是上线后的救火项。数据目录、血缘追踪、细粒度权限这些曾被视作「锦上添花」的治理工具,正在变成AI采购清单上的硬需求。这是隐性税被显性化的第一步——只有先看见,才能开始省。

🔍 判断:从买算力到修地基

金句先行:AI竞赛的上半场比谁的模型强,下半场比谁的数据地基便宜、稳、快。

给企业三条务实建议,每条都配了可考核的量化指标:

第一,把数据架构评审塞进AI立项流程,并设置硬门槛。 数据接入、存储、治理三张清单,缺一不过会。可量化验收:每份清单标注责任人与SLA,例如核心数据端到端新鲜度≤5分钟、血缘覆盖率≥90%、敏感字段分级打标≥95%——任一未达标,项目不予进入开发阶段。

第二,ROI测算里必须加一行「数据侧成本」,并给足缓冲。 建议按模型侧预算的至少30%单列数据侧成本科目,覆盖存储冗余、管道维护和治理返工三项预估;宁可高估。验收方式:项目季度复盘时,数据侧实际支出与预估偏差超过20%即触发架构复审。

第三,优先收敛存储层,给出时间表。 以一套开放表格式(Iceberg/Delta Lake)打底的湖仓,替代各管一摊的烟囱系统。可量化目标:12个月内把关键数据副本数从3份以上收敛到「1主+1备份」,存储成本降幅目标20%–30%——对照Flexera调查中27%的平均云支出浪费率,这个目标并不激进。

对厂商而言,机会同样明确:谁能把「数据就绪」做成可交付、可度量的产品能力——比如提供数据就绪度评分、治理覆盖率仪表盘这类可直接写进采购合同的指标——谁就能吃到这轮补课预算。从Databricks和Snowflake的收入曲线看,这部分支出已经从IT预算的边角料,变成了企业数字化投入里增长最快的板块之一。

结语

企业AI的ROI困境,表面是模型问题,里子是架构问题。那笔没人预算过的隐性税,正随着AI项目规模化而复利增长。好消息是,产业已经开始正视它——从湖仓融合到治理工具走热,补课者众。坏消息是,多数企业的预算表还没改。下一轮AI竞争的分水岭,不在模型榜单上,而在每家公司的数据架构图里。早一年修地基,就少交一年税。

参考信源

1. SiliconANGLE:企业AI数据架构成本相关报道

2. MIT Project NANDA,《The GenAI Divide: State of AI in Business》(2025):约95%企业生成式AI试点未产生可衡量回报

3. RAND Corporation,《The Root Causes of Failure for Artificial Intelligence Projects》(2024):逾80%的AI项目失败

4. Gartner(2024年7月新闻稿):预测到2025年底至少30%的生成式AI项目将在PoC后被放弃;2024年全球CIO调查

5. Menlo Ventures,《The State of Generative AI in the Enterprise》(2024年11月):2024年企业生成式AI支出138亿美元,同比增长6倍

6. Flexera,《State of the Cloud Report 2024》(491家受访企业):企业自估约27%云支出被浪费

7. Anaconda,《State of Data Science》(2020–2022年历次调查):数据清洗与准备占数据科学家工时38%–45%;CrowdFlower调查(经《福布斯》引用):该比例最高达80%

8. Databricks 2025年初公告:年化收入突破30亿美元,2024年底62亿美元估值融资;Snowflake FY2025财报:收入约36.3亿美元,同比增长29%

9. AWS S3 Standard公开定价(美东区域,约0.023美元/GB/月),用于文中存储成本测算

本文由本站 AI 辅助聚合生成,原始来源如下:

🔎 本文基于以下资讯(素材溯源 · 信息来源)

📰 相关阅读推荐(与本文相关的其他资讯)