🏢 公司C档 · NaN分

AI瓶颈变了:卡不是问题,喂数据才是

··约1分钟阅读

📋 总体概括

AI基建竞赛正从拼芯片转向拼数据管道:算力有了,如何让高速网络把数据持续喂进受限功耗下的芯片,成为新瓶颈。结合AI Data Pipeline论坛与Postgres生态动向,本文拆解数据管道为何成为AI基建核心命题。

📄 正文

芯片军备竞赛打到今天,行业突然发现:最缺的不是GPU,是喂饱GPU的数据管道。

10月13日,SiliconANGLE旗下theCUBE将直播AI Data Pipeline Forum。这场论坛的主题设置本身就是一个信号——AI基础设施的讨论焦点,已经从“更快芯片”转向“系统级挑战”:高速网络、功耗散热、以及把数据源源不断送进算力集群的整条管道。

这不是概念切换,是产业瓶颈的真实迁移。

📈 瓶颈迁移:从FLOPS到Bytes

金句先放这里:算力的天花板是芯片,AI的天花板是管道。

过去三年,AI基建的投资叙事非常简单:谁的芯片多、谁的集群大,谁就赢。仅NVIDIA2025财年数据中心业务收入就达到1152亿美元,同比接近翻倍;微软、亚马逊、谷歌、Meta四家2025年合计资本开支预计超过3000亿美元。但素材传递的判断很明确——“AI基础设施瓶颈正在把注意力转向一个更大的挑战:让芯片有数据可吃、通过高速网络互联、并在日益严苛的功耗与散热限制内运转”。

拆开看,这是三个耦合的子系统:

  • 数据供给:训练与推理集群需要持续、高吞吐的数据流入,数据管道的吞吐一旦跟不上,芯片就在空转烧电;
  • 高速互联:数据要通过网络抵达芯片,网络带宽与时延直接决定集群有效算力;
  • 功耗散热:同样的数据流量,要在更紧的功率与冷却约束下完成,系统设计空间被大幅压缩。

用一张图概括这条新链路的层级关系:

注意那个反馈箭头:功耗与散热不再是后置的运维问题,而是反过来约束管道与网络的设计参数。IEA统计显示,2024年全球数据中心用电约415太瓦时,预计到2030年将增至约945太瓦时,AI是主要增量——在电力成为硬约束的前提下,管道、网络、散热的参数必须联合设计。这一“系统级视角”也反映在公开研究中:SemiAnalysis等研究机构近年的集群分析报告,已普遍把“有效算力(goodput)”而非峰值FLOPS列为核心评估指标。这正是这场论坛把"Data Pipeline"放进名字里的原因。

⚡ 为什么是“管道”成了主角

一个简单的类比:芯片是信用卡账单,管道是水电煤——后者欠费,前者立刻停摆。

逻辑链条其实很朴素。模型能力竞争推向推理侧之后,数据不再是“训练前一次性灌入”的静态资产,而是持续流动的输入流:特征要实时更新,语料要持续汇入,检索增强要在毫秒级完成。芯片每代都在提速,但如果管道吞吐、网络带宽、存储IO没有同步升级,系统整体的有效算力(而非纸面算力)就会被最慢的一环锁死。

数字能说明问题。Meta公开的Llama 3.1 405B训练报告显示,即便在数万张H100上做到业界顶尖的工程优化,模型算力利用率(MFU)也只有约40%上下——也就是说,六成的纸面算力消耗在通信、等待与数据供给上。工程能力普通的团队,MFU跌到20%–30%是常态。推理侧同样如此:云管理平台(如Datadog等)发布的遥测报告显示,云上GPU的平均利用率普遍低于50%,相当一部分实例长期处于闲置或低载状态。而在RAG与多步Agent场景中,每一次外部检索都会给端到端延迟叠加数十到数百毫秒——当推理按token计费、按毫秒竞价响应,管道的每一毫秒延迟都直接换算成成本。

这就是经典的“木桶效应”在AI基建中的重演,只不过这次的短板从芯片换成了管道。工程上这意味着什么?

层级旧叙事关注点新叙事关注点
芯片峰值算力供电与散热下的持续算力
网络带宽参数端到端吞吐与时延一致性
数据静态数据集实时高吞吐数据管道
系统单点性能全链路有效算力

表格里最值得划重点的是最后一行。“全链路有效算力”意味着评估AI基建的方式变了:不再问“你有多少卡”,而是问“你的卡有多少时间在真正干活”。而决定这个比例的,恰恰是数据管道与网络——基础设施里最不被讲故事、却最决定成本的部分。

对做数据的团队来说,这是久违的行情:管道能力第一次被摆到AI叙事的C位。

🗽 另一个信号:Postgres生态的生意经

金句:管道热不热,看数据库厂商往哪儿站队。

2025年以来的几笔公开交易,给出了产业侧的印证:

  • 2025年2月,ClickHouse收购Postgres CDC工具厂商PeerDB,随后把Postgres的实时变更捕获能力并入其数据管道产品ClickPipes;
  • 2025年5月,Databricks以约10亿美元收购Postgres云厂商Neon;
  • 2025年6月,Snowflake以约2.5亿美元收购Postgres托管服务厂商Crunchy Data,并发布基于Postgres的AI数据产品线。

作为参照,ClickHouse本身在2025年5月完成3.5亿美元C轮融资,估值63.5亿美元;公司同时持续在Postgres社区大会等场合展示其集成能力。

这件事的产业含义值得细读。Postgres是全球事实上的事务型数据库标准,沉淀了海量的业务数据;而ClickHouse是分析型查询的代表。当一个分析引擎收购CDC厂商、认真做“Postgres集成”,本质上是在缩短一条路径:业务库里的数据,更快、更低摩擦地流向分析管道,最终流向AI负载。

图里每一跳都是延迟与工程成本。厂商把集成做厚,就是在替下游的AI管道扫清第一公里。三家头部数据平台在同一年里先后出手收购Postgres相关公司,投入均以亿美元计——道理很简单:谁卡住了数据流向算力的路径,谁就卡住了新叙事的入口。

💡 对从业者:三个可以落地的判断

金句:瓶颈在哪,预算就在哪。

把上面的信号翻译成可操作判断,我认为有三条:

第一,重新盘点管道吞吐。多数团队评估AI基建时对芯片投入精确到个位数,对数据管道吞吐却只有模糊估计。建议把“管道能否喂满峰值算力”作为正式验收指标——参照前述数据,芯片利用率每提升10个百分点,等效于白捡一成算力;反过来说,芯片空转一分钟,烧掉的都是真金白银的电费与租金。

第二,把功耗约束前置到架构设计。系统级挑战的提法提醒我们:管道、网络、散热的参数是联动的。IEA的用电预测意味着2030年前电力供给将成为多数新建集群的第一约束,后置的散热补丁解决不了前置的架构失误。

第三,关注数据库与管道的融合趋势。Databricks、Snowflake、ClickHouse在2025年的连续出手不是孤立事件,数据库厂商向AI管道渗透会持续加速。选型时与其追新概念,不如看谁能把“数据从业务库到算力”的路径铺得又短又稳。

🧭 小结:数据管道的黄金窗口

AI基础设施的竞争,正在从“造出更快的芯片”转向“设计更好的系统”。当功耗、网络与数据供给成为联合约束,数据管道就从后台工具变成了核心基础设施——这是AI Data Pipeline Forum这类专门论坛出现的根本原因,也是ClickHouse们斥资收购、认真做数据库集成的原因。

接下来值得盯的是两件事:主流集群的“有效算力利用率”是否会成为公开指标;以及数据库、网络、存储厂商围绕管道入口的卡位战会打到什么程度。管道的黄金窗口,可能比很多人预想的来得更快。

本文由本站 AI 辅助聚合生成,原始来源如下:

🔎 本文基于以下资讯(素材溯源 · 信息来源)

📰 相关阅读推荐(与本文相关的其他资讯)