Agent要真干活,先得便宜七成
📋 总体概括
Anthropic大幅降价、DoorDash自建GenAI平台、NetApp让AI代理管存储——三件事拼出同一个判断:Agent落地的瓶颈已从模型能力转向成本、平台与治理边界。本文从数据平台架构师视角拆解Agent技术栈的分层固化趋势。
📄 正文
2026年秋天,三件看似不相关的事几乎同时发生:Anthropic把Claude Haiku 5.5的运行成本砍掉约75%,DoorDash公开了从"厂商优先"转向"开放权重"的内部GenAI平台演进史,NetApp则宣布让AI代理直接接管存储运维——但边界仍由人来画。
把这三件事摆在一起,结论就浮出来了:Agent的瓶颈,已经不再是模型聪不聪明,而是账算不算得过来、平台接不接得住、边界画不画得清。
📉 降价75%,Agent的成本账被重写
模型每便宜一分钱,Agent就多活一个场景。
先看这波降价的力度。据AIGCLINK的消息,Claude Haiku 5.5运行成本平均比Haiku 4.5降低约75%,Sonnet 5.5也同步降价。更激进的是分档定价:提示词在10万token以内的请求便宜90%,10万以上便宜50%。
这不是常规的"每年降一点",是价格结构的重构。
| 维度 | Haiku 4.5 | Claude Haiku 5.5 |
|---|---|---|
| 平均运行成本 | 基准 | 降低约75% |
| 短提示词(≤10万token) | 基准 | 便宜90% |
| 长提示词(>10万token) | 基准 | 便宜50% |
| 电脑操作测试跑分 | 15.7% | 72.4% |
| 终端编程任务 | 0% | 39.2% |
| 努力度调节 | 不支持 | 支持,可权衡成本与智能 |
成本之外,能力曲线的跨越更关键。电脑操作测试跑分从15.7%飙到72.4%,终端编程任务从0%直接干到39.2%。
这两个数字的产业含义,做工程的人都懂:屏幕操作类Agent之前只能停留在demo阶段——跑三次失败两次,人工兜底的成本比自动化省下的还高。而终端编程从零起步,意味着模型第一次具备了"在命令行里可靠干活"的门槛能力。
还有一个容易被忽略的细节:Haiku现在也支持"努力度调节",让用户在成本与智能之间做权衡。
对架构师来说,这个功能非常"数据库"——就像缓存有L1/L2/L3,存储有热/温/冷分层,算力第一次变成了可以按任务难度调配的分级资源。简单任务低挡位跑,疑难杂症再拉高,这是把Agent从"每次都请专家"变成"先派实习生、搞不定再升级"的调度逻辑。
价格跌破"随便用线",能力跨过"可用线",高频低难度的Agent操作环节,才算真正具备从试点走向批量生产的经济性。
🏗️ DoorDash的教训:平台是被账单逼出来的
平台不是买来的,是被账单逼出来的。
InfoQ近日放出了一场分享,主角是DoorDash的Swaroop Chitlur和Siddharth Kodwani,主题是他们的内部GenAI平台建设历程。有几个关键信息点值得逐条拆:
第一,规模。这个平台服务超过5000名内部用户——不是十个工程师的玩具,是全公司级别的生产力基础设施。
第二,架构路线的核心转折:从"厂商优先"(vendor-first)的搭建方式,转向开放权重模型(open-weights models)。换句话说,DoorDash吃过单供应商绑定的亏,最后选择把一部分命脉握在自己手里。
第三,工程重心: navigating LLM网关和Agent网关,同时在准确率、延迟、成本三者之间做平衡。
用流程图看这条演进路径非常清晰:
做过多平台架构的人看到这里会心一笑:这和当年企业从单数据库绑定走向自建数仓、再到湖仓一体的剧本,几乎是同一套。
当年大家的教训是:中间件层——网关、路由、可观测性——才是平台真正的护城河。模型会换,供应商会换,但那层"把5000个用户的请求 intelligently 分发到最合适的模型上去"的调度能力,沉淀下来就是资产。
准确率、延迟、成本这个"不可能三角",DoorDash的答案不是选边站,而是用网关把选择权变成运行时参数——和Haiku 5.5的"努力度调节"殊途同归。
🚦 NetApp:AI管存储,人画边界
自治系统的第一课,不是能做什么,而是被允许做什么。
据SiliconANGLE报道,NetApp在其INSIGHT大会上做了个大胆动作:把存储运维操作交给AI代理执行。
但报道的标题里有个更重要的限定词——"人类仍然划定边界"(humans still draw the boundaries)。
这篇文章里有一句话,我认为可以刻在所有Agent项目的立项文档首页:问题不再只是数据存在哪里,而是"什么被允许对它采取行动"。
注意这个主语的变化。过去二十年的数据治理,管的是数据的静态属性:存在哪、谁有权读、怎么分类分级。而Agent时代的治理,管的是数据的动态行为:一个AI代理可以对这条数据做什么操作、做到什么程度、谁在什么时候介入。
NetApp的逻辑链条也很清楚:AI正在把几乎所有的企业工作负载变成数据工作负载,而数据治理正成为"企业能否信任自治系统接管底层基础设施"的试金石。企业的数据如今横跨本地数据中心和云端,代理的操作边界必须是显式定义的。
运维型Agent是最容易率先落地的场景——任务边界清晰、结果可验证、操作可回滚。但存储恰恰是企业数据资产的最底层,一步误操作可能波及全部业务。所以NetApp的选择极具代表性:放权,但不放界。
🔗 三块拼图,拼出Agent技术栈的分层固化
把三个信号叠在一起看,Agent的技术栈正在快速分层固化,像极了二十年前的云计算。
| 主体 | 角色 | 关键动作 | 产业信号 |
|---|---|---|---|
| Anthropic | 模型供应商 | Claude Haiku 5.5降价75%,跑分大涨,支持努力度调节 | 算力层进入按需分级定价时代 |
| DoorDash | 应用企业 | 从厂商优先转向开放权重,自建LLM/Agent网关,服务5000+内部用户 | 平台调度层是企业的真正资产 |
| NetApp | 基础设施商 | AI代理接管存储运维,人类划定治理边界 | 治理层是Agent规模化的前提 |
按时间线串一遍:
- 模型层信号 : Anthropic发布Claude Haiku 5.5,成本降约75%,操作与终端编程跑分跃升
- 平台层信号 : DoorDash在InfoQ分享GenAI平台演进,明确从厂商优先走向开放权重
- 治理层信号 : NetApp在INSIGHT大会宣布AI代理管存储,强调人类划定边界
三个信号分别对应栈的三层,而且节奏高度同步。这不太可能是巧合。
业界的私下共识是:单点能力(更聪明的模型、更好的编排框架)早就不是稀缺品了,稀缺的是把三者串成一条可靠生产链路的工程能力。谁先把这条链路跑通,谁就先拿到Agent的红利。
💡 给国内团队的三个落地判断
聊完别人家的故事,回到我们自己的工程实践。三个判断,供参考。
第一,成本敏感场景,优先押注小模型+努力度调节。
90%的Agent任务不需要最贵的模型。当短提示词便宜90%时,"先小模型跑、置信度不够再升级"的策略在经济上完全成立。别再用旗舰模型跑批量分类和格式抽取了,那是烧钱。
第二,网关层不要跳过,哪怕早期只有两个模型。
DoorDash用5000人的规模验证了这一点:从厂商优先到开放权重的迁移成本极高,而网关是让未来迁移成本趋近于零的那道保险。国内模型供给方众多、迭代速度快,这层抽象的价值只会更大。模型可替换性,应该写进架构评审的必查项。
第三,治理先行,权限粒度决定Agent上限。
NetApp给出的是反面参考式的正面教材:Agent能走多远,不取决于它多聪明,取决于你敢给它多大权限。建议每个Agent项目立项时先回答三个问题——它能对哪些数据执行哪些操作、异常操作的回滚机制是什么、人类在哪个节点强制介入。答不上来,就先别上线。
一句话总结:模型降价解决的是"用不用得起",平台网关解决的是"换不换得动",治理边界解决的是"敢不敢放"。 三者齐备,Agent才从发布会走进生产环境。
回头看这三件事,最有意思的不是任何单点,而是同步性:模型在降价、平台在去绑定、治理在画边界——产业在同一个季度里,把Agent落地所需的三个前提一次性补齐了。
接下来一年的看点很明确:当便宜七成的模型遇上画好边界的治理框架,第一批真正规模化、有审计、可回滚的生产级Agent,会从运维、客服、终端编程这些"高频低难"场景里长出来。而数据平台的架构师们,该把Agent网关和治理边界排进明年的OKR了。
窗口期不长。账算得过来的时候,就是竞争对手也算得过来的时候。
本文由本站 AI 辅助聚合生成,原始来源如下: