AI最脏的活,正在闷声赚钱
海天瑞声中报净利同比增157%,一家数据服务商的财报,把'大模型越大、干净数据越贵'写成了明账。本文结合一位开发者清洗15万张图像的实战记录与伯恩斯坦的算力账本,拆解数据工程为何成为AI产业链上利润弹性最大、也最容易被低估的一环。
所有人都在算显卡的账,很少有人算数据的账。
海天瑞声交出的中报值得放大看:上半年营收1.92亿元,同比增长22%;净利润977万元,同比暴增157%。营收涨两成,利润涨一倍半——这不是靠加杠杆,也不是靠涨价讲故事,而是作为智谱、Meta供应商,它在AI产业链里站到了一个利润弹性最大的位置:卖干净的数据。
与此同时,一条开发者的实战帖子在技术圈流传:把14.9万张混乱的图像,清洗成一套能离线跑在手机上的食物识别系统。作者的原话很扎心——你以为最难的是模型,其实最难的是数据。
这两件事,一处在上市公司报表里,一处在个人工程师的Colab笔记本里,说的却是同一句话:大模型越大,干净数据越贵。
📈 一份财报,把'卖铲人'的利润写成了明账
先看最硬的数字。
海天瑞声上半年营收1.92亿元,同比增22%;净利润977万元,同比增157%。两个增速之间的落差,就是这门生意的核心秘密:收入端只多卖了22%,利润端却翻了近1.6倍。
| 指标 | 2025上半年 | 同比 |
|---|---|---|
| 营业收入 | 1.92亿元 | +22% |
| 净利润 | 977万元 | +157% |
利润增速远超收入增速,通常只有两种解释:要么产品结构升级、高毛利业务占比提升,要么交付效率大幅改善。对数据服务商来说,这两件事其实是同一件事——当客户从'买一堆标注数据'变成'买清洗过、对齐过、可直接喂给模型的语料',同样的人力投入能换来数倍的议价空间。
名字里出现的两家客户也很有信息量。智谱是国内头部大模型公司,Meta是全球开源模型的旗手。一家中国的数据服务商同时出现在两边,说明高质量数据的采购是全球性行为,不是国内大模型厂商的临时凑合。语料军备竞赛打到今天,各家比拼的已经不只是'谁有多少卡',还有'谁的数据管道更干净'。
据多位接近头部模型公司的人士私下透露,训练语料的采购预算近两年一直在加码,但预算花不出去的抱怨同样常见——市面上真正'即插即用'的高质量数据太少,大量交付物还要模型团队自己返工。供给端的质量缺口,就是海天瑞声们利润表上那157%的来源。
一句话概括这门生意的本质:算力是期货,数据是现货;卡可以排队买,干净的数据买不到就得自己蹲在车间里搓。
🧹 14.9万张图片的'数据苦旅':模型工程师的真正日常
财报是宏观视角,个案是微观视角。一位开发者最近公开了他从零训练端侧食物识别模型的全过程,用的正是当前社区流行的轻量模型YOLO26n,目标很明确:模型要跑在手机和iPad上,全程离线,没网就崩的那种。没有云、没有API,模型糊涂了没有任何人兜底。
他手里有约14.9万张多来源图像。听起来不少?真正能用的只有49158张——来自11个数据集。剩下的去哪了?一个大型数据集没有标注框,直接出局;11个数据集各自命名体系不同、拍摄标准不同,还有大量重复图片反复出现。训练之前的第一份工作,不是调参,是决定扔掉什么。
整个流水线在Google Colab上按顺序跑完,作者把踩过的坑原样保留在文章里——包括自己犯的错。这份坦诚反而最有价值,因为它揭示了一个行业常识:多源数据融合时,脏是常态,干净是奇迹。
这条清洗管道,值得每一个做AI数据的人记下来:
49158张可用图,占比大约三分之一。这意味着哪怕你手里握着看似充裕的数据,真正进入训练集的可能只有零头,而筛选、去重、对齐的每一环,都是纯人工加纯工程的脏活。
这个故事和海天瑞声的财报互为注脚:个人开发者用业余时间踩的坑,恰恰是专业数据公司用来收费的专业能力。 当企业级客户面对的不是14.9万张图,而是TB级的文档、对话、音视频语料时,这条管道的每一段都要工业化、可审计、可复现——这就是数据服务商的护城河所在。
⚖️ 算力是明账,数据是暗账
把视角再拉高一层,看看这场军备竞赛里两条支出曲线的对比。
伯恩斯坦拆解过AI基建的成本:建一座1GW的数据中心,要花346亿至395亿美元,其中英伟达Vera Rubin架构的方案最贵。马斯克的Terafab芯片厂,则是另一条把算力自主权攥在自己手里的路线。这些数字都是公开的、可审计的,资本市场盯着每一分钱。
| 支出项目 | 量级 | 特点 |
|---|---|---|
| 1GW数据中心建设 | 346亿-395亿美元 | 公开、可审计、资本密集 |
| 单家数据服务商上半年收入 | 1.92亿元 | 分散、隐蔽、交付密集 |
对比之下,数据端的支出几乎是在'暗处'发生的:没有统一的采购清单,没有标准化的定价,预算散落在各家模型公司的预训练、后训练、评测等多个团队里。但量级差异不代表重要性差异——恰恰相反。
算力决定了你能不能训练,数据决定了你训练出来的东西值不值钱。1GW的集群堆在那里,喂进去的是脏语料,吐出来的就是一个昂贵的平庸模型。豆包等产品之所以被认为'工作进化速度太快',背后除了工程迭代能力,还有一条持续运转、持续清洗的语料管道在输血。
这里的产业逻辑可以讲得很直白:
- 边际成本不对称:多买一张卡,钱是一次性的;数据的质量每提升一档,需要的工程投入是指数级的;
- 供给不可复制:算力有英伟达一家供全球,高质量数据却分散在千万个场景里,谁掌握采集和清洗管道,谁就有定价权;
- 利润弹性倒挂:卖卡的赚 hardware 的钱,毛利固定;卖干净数据的服务商,人力成本相对固定,质量溢价直接落进利润表——157%的净利增速就是明证。
所以别再只盯着GPU的到货周期了。算力的账本在投行报告里,数据的账本藏在交付团队的工时表里——后者才是决定模型上限的那本账。
🏗️ 产业链正在分层:自建与外采并存,专业玩家卡位
数据服务这条产业链,正在从'人力密集的标注工厂'向'工程密集的数据公司'迁移。
看清这张图的三个关键节点,基本就看懂了未来几年的格局:
第一,头部模型厂商必然自建一部分。 核心语料、评测集、RLHF偏好数据,属于战略资产,没有哪家头部公司会把最敏感的部分完全外包。自建团队负责定义质量标准、把关安全红线。
第二,外采的只会越来越多,而不是越来越少。 原因很简单:多源数据的采集和清洗是重人力、重领域知识的活,垂直行业语料尤其如此。海天瑞声同时服务智谱和Meta的事实说明,即便是自研能力很强的模型公司,也要在通用和特定语料上依赖专业供应商。据业内人士的说法,下一代模型的竞争焦点正在从'通用能力'转向'垂直场景的可靠性',而垂直场景的数据,恰恰是外采依赖度最高的品类。
第三,专业玩家的门槛在抬高,而不是降低。 曾经数据标注被视作劳动密集型外包,利润薄、门槛低。但现在的交付物要求端到端:从采集方案设计、去重策略、标注规范,到质量审计、格式对齐,最后直接输出可训练的数据集。个人开发者用Colab手工跑通一条管道尚且满地踩坑,企业客户要的是可复现、可审计、规模化的同一条管道——这已经不是人海战术能覆盖的活。
对海天瑞声这类公司而言,真正的机会在于卡住'质量溢价'这一层:同样是1.92亿的营收,如果里面高价值语料和评测服务的占比持续提升,157%的利润增速就不只是一次性的结构改善,而是一个可持续的商业模式信号。
当然,风险同样清晰:模型厂商自建团队的天花板在上升,合成数据技术在部分场景开始替代真实标注,单靠'标注工时'讲故事的公司会被两头挤压。活得好的,一定是把数据当成软件工程问题而非人力问题来解的公司。
🔚 结语:下一个被重估的,是水下的那本账
回头看这两件事:一份净利增157%的中报,一个149000张图片里筛出49158张的清洗日志,指向的是同一个判断——AI产业链的价值,正在从'看得见的算力'向'看不见的数据工程'渗漏。
346亿到395亿美元的1GW数据中心是明账,会有无数分析师反复拆解;而每一家模型公司内部,数据管道上烧掉的钱、人力和时间,至今没有一份标准化的披露。这种信息不对称,本身就是投资和创业的机会窗口。
往前看,三件事值得持续跟踪:头部模型公司的数据外采预算是否继续加码;数据服务商的收入结构里,高毛利语料与评测服务的占比能否站稳;以及合成数据与真实数据的成本分界线,会落在哪个品类上。
牌桌上的明牌是算力,暗牌是数据。明牌决定谁上桌,暗牌决定谁赢。