模型降到一折,钱去喂了检索
📋 总体概括
Claude Haiku 5.5把调用价打到一折,同一时间Neo4j与The New Stack密集讨论Graph RAG与上下文检索。两条线索指向同一判断:模型越便宜,价值越向检索层和数据管道迁移,数据基础设施正在被重新定价。
📄 正文
10月7日,Anthropic 发布 Claude Haiku 5.5,在不超过10万token的请求中,输入、输出单价均比上一代降低90%。几乎同一时间,Neo4j 和 The New Stack 先后发文,讨论 Graph RAG 与上下文检索。
两条新闻看似无关,实则指向同一件事:当模型便宜到可以论斤称,真正的稀缺资源,变成了"给模型喂对上下文"的能力。
数据基础设施,正在被重新定价。
📉 一折定价,模型开始按斤卖
降价90%不是促销,是对算力叙事的一次釜底抽薪。
先看场景。一家金融AI公司过去不敢让模型批量读财报——按上一代价格算,跑一遍全市场文档的账根本算不平。Claude Haiku 5.5 发布后,这道算术题被改写了。据官方口径,在10万token以内的请求中,新模型的输入、输出价格直接砍掉九成。
Anthropic发布Haiku 5.5
输入输出价格较上代降九成
公布金融等行业客户案例
更值得注意的是它的能力边界。Anthropic 强调,这个小模型能整理文档、查询数据库、操作浏览器,还能给更强的 Opus 和 Sonnet 当助手。在官方公布的客户案例中,金融AI公司位列其中。
翻译一下:小模型的定位不再是"便宜的备胎",而是"流水线工人"。单价降90%,意味着以前不划算的批量任务——文档整理、库表核对、网页操作——突然变得经济了。模型越便宜,调用量越指数级上升,这个剧本和云计算的历史一模一样。
但别忘了,每一次调用都需要上下文。token便宜了,"找对token"这件事,没有变便宜一美分。
🔍 语义相似度的旧地图,画不出智能体的新大陆
做过RAG的工程师都遇到过这种时刻:查询和正确答案的文本毫无重合,向量检索返回一堆"看起来像"实则无关的分块。
Neo4j 的博客说得很直白:今天大多数RAG系统,只是给新查询和存储的文本块打语义相似度分,然后返回最匹配的列表。问题在于,相关信息并不需要包含相似的词——数据实体之间,可能存在隐含的关联。
这就是"上下文检索"被单独拎出来的原因。它回答的不再是"哪段文本最像",而是"哪些实体和这件事真正相关"。
产业逻辑要看得更狠一点。当模型便宜到可以多轮循环,智能体会反复向检索层发起提问。模型端的成本降了,检索端的错误成本反而被放大了——智能体每绕一圈,错误上下文就被带进下一轮推理。检索质量,成了整个系统的短板。
换句话说,上下文检索不再是一个RAG的子话题,而是智能体架构里独立的工程层。谁把它做厚,谁就拿到了下一代数据平台的入场券。
🕸️ 关系即证据:Graph RAG 的适用边界
The New Stack 的判断更具体:当"关系本身是证据的一部分"时,就该上 Graph RAG。
文章开头的两个问题很典型:哪个团队拥有那个依赖了含漏洞组件的服务?哪些客户在使用这项服务?这两个问题,靠单次向量相似度命中永远答不出来——必须沿着服务、团队、组件、客户之间的实体关系,一跳一跳地遍历过去。
三种检索思路的差异,可以放在一张表里看:
| 维度 | 传统向量RAG | Graph RAG | 上下文检索 |
|---|---|---|---|
| 匹配方式 | 语义相似度打分 | 实体关系多跳遍历 | 实体关联与上下文组织 |
| 擅长场景 | 文档内容查找 | 依赖链、责任链追查 | 需要隐含关联的复杂提问 |
| 典型失败点 | 词面不相似即漏召回 | 图谱构建成本高、维护难 | 依赖前两者打底 |
| 受益方 | 通用知识库 | 图数据库厂商 | 智能体编排平台 |
这张表背后的产业信号是:Graph RAG 不是来替代向量RAG的,它是来补上"关系维度"的。
对数据库厂商来说,这是久违的好消息。Neo4j 近期高频输出上下文检索相关内容,本质是在抢占"智能体检索层"的话语权。我的判断是:未来的检索市场会分化成向量、图、结构化三栈混用,真正值钱的不是某一栈,而是上层的混合检索编排能力——知道什么时候该用哪把刀。
🏗️ 真正的吞金兽,藏在模型后面
把一个典型智能体系统的链路画出来,你会看得更清楚:
注意最后那条回边。智能体的本质就是循环:小模型初筛、大模型深推理、失败重试、再来一轮。每绕一圈,都要过一遍检索层。模型降价90%之后,循环次数会成倍增长,检索层的压力和成本也随之翻倍。
据多位接近厂商的人士观察,落地项目里最烧钱的环节,往往不是模型调用,而是前置的数据管道:清洗、实体对齐、图谱构建、索引的持续更新。这笔账过去被模型价格掩盖着,现在模型降到一折,管道成本在总账本里的占比,只会更扎眼。
这就是本篇最核心的判断:价值正在从"推理算力"向"上下文供给链"迁移。摄取管道、混合索引、检索编排、上下文工程——这一整条供给链,才是数据平台厂商真正该修的护城河。模型是水电煤,上下文供给链是你的仓库和物流。
💡 给国内玩家的三个提醒
第一,别只盯着模型卷价格。Haiku 5.5 一折定价说明模型层毛利会加速坍缩,跟着降价是被动应战。把预算投到检索与管道,比多买一批卡更划算。
第二,图数据库的窗口期到了。Graph RAG 的热度给了国产图数据库一次被集成进智能体技术栈的机会。关键看两点:多跳查询的性能,以及能否把自己做成检索编排里的标准组件。错过了这一轮,下一次站上牌桌要等很久。
第三,中间层拿定价权。谁掌握了上下文的组织方式,谁就掌握了对模型的调度权。数据中台团队应该重新审视自己的定位——过去是"给报表供数",未来是"给智能体供数"。前者的客户是分析师,后者的客户是24小时不休息的智能体,量级和实时性要求完全不是一个世界。
一句话收束:模型降价不是终点,而是把竞争的球,踢回了数据侧。
Claude Haiku 5.5 把token打到一折,Graph RAG 和上下文检索则提醒我们:变便宜的不是智能,是"试错的机会"。机会越多,喂对上下文的能力越值钱。
接下来12个月,判断一家数据平台是否跟上了时代,就看你能不能回答那个问题——
你的检索层,准备好了吗?
本文由本站 AI 辅助聚合生成,原始来源如下: