Data for AI技术数据库评论分析· 2717 字· 约5分钟阅读

别再只卷向量了,Agent在换思路

A
AI编辑团队AI 原创内容
2026-10-04 21:23 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

传统RAG靠语义相似度打分检索,但相关实体未必用相似的词。Neo4j连续发文推动上下文检索与智能体记忆体系,从工具、语义层到技能固化,Agent基础设施正在从向量库向关系化知识底座迁移。本文拆解这一技术转向背后的产业逻辑与工程代价。

过去两年,所有做RAG的团队都在调Embedding模型、切分策略、重排序器。但Neo4j最近连发的两篇技术文章,指向了同一个被忽视的问题:检索的瓶颈不在相似度算法,而在上下文本身。一篇讲上下文检索(Contextual Retrieval),一篇讲从记忆到行为的固化回路。两篇合起来看,信号很明确——Agent时代的数据底座,正在换一套逻辑。

很多向量检索已调到极致的团队,私下都在讨论一件事:相似度分数再高,答案不对就是不对。这条路的天花板,比想象中来得早。

🔍 相似度打分,正在漏掉关键信息

先看一个所有做过RAG的人都遇到过的场景。

用户问一个业务问题,系统把查询切词、Embedding、和库里存的文本块逐一算相似度,返回Top-K。工程上没毛病,但结果常常离谱:明明库里有一条高度相关的信息,它就是没被召回。

Neo4j在文章里点破了根因:信息不需要用相似的词来表达,才算相关。数据实体之间的关系,可能完全不走表面词汇。两个文本块没有一个共同的关键词,却在业务语义上强关联——传统基于语义相似度打分的RAG系统,对此无能为力。

这不是算法没调好,是范式本身的天花板。相似度检索的隐含假设是:相关≈语义相近。而这个假设,在多跳推理、跨实体关联的场景下会系统性失效。

打个比方,你问“负责华东区客户的供应商审核流程是谁签的字”,字面上和“采购合规审批记录”毫无重叠,但它就是答案所在的那条记录。向量模型再强,也很难跨越这种词汇鸿沟。

据多位接近企业级RAG落地的从业者反馈,检索召回率卡在瓶颈期的项目,问题十有八九不在Embedding选型,而在“库里到底存了什么结构”。

🧠 上下文检索,把关系补回检索

一句话点破:检索要的不是相似的词,而是相关的上下文。

Neo4j给出的方向是上下文检索——不再孤立地对文本块打分,而是让检索过程理解实体之间的关系结构。同样是“找出相关内容”,路径完全不同:

左边的路径,是过去三年几乎所有RAG团队的标配;右边的路径,把实体和关系纳入了检索决策。这不是要把向量库推翻重来——向量化本身依然有价值,而是说,单靠相似度排序已经不够,结构化关系必须成为一等公民。

用一张表对比两种范式的差异会更清楚:

维度传统RAG上下文检索
检索依据语义相似度打分实体关系+语义结合
隐含假设相关词才相关关联实体不需相似词
弱点跨实体多跳关联漏召回建图与维护成本
适配场景单点事实问答多跳推理、复杂关联

对深耕图数据库的Neo4j来说,这个叙事并不意外——图天然擅长表达“实体间的关系”。但值得注意的是它发布这些内容的姿态:不是卖图数据库,而是定义“Agent该怎么找上下文”这个方法论问题。谁定义了检索范式,谁就站在AI数据栈的上游。

🔁 从记忆到行为,Agent在学会自我固化

第二篇更值得琢磨。这是Neo4j自学习多智能体系列的第三部分,与前两部分共同作者包括Firat Tekiner。三篇文章串起来,就是一条完整的演进时间线:

第一部分

工具与钩子

第二部分

语义层与记忆

第三部分

技能、用户画像与固化回路

第一部分解决Agent怎么用工具、怎么通过钩子感知环境;第二部分引入语义层和记忆,让Agent“记住”发生过的事;第三部分走到了最关键的一步——把积累的经验变成程序化的技能和用户画像,再喂回给Agent。

这就是所谓的固化回路(Consolidation Loop):

这套设计的产业含义在于:Agent的记忆不再只是“聊天记录的存档”,而是被持续提炼成可复用的行为资产。技能是流程化的操作知识,用户画像是关于服务对象的结构化理解——两者共同决定了Agent下一步怎么行动。

一个现实的类比:客服团队里,老员工和新员工的差距不在知识库,而在肌肉记忆和对客户的了解。固化回路做的,就是把这种“隐性经验”持续显性化、结构化。Agent的护城河,不在模型参数里,在它的记忆资产里。

⚠️ 对数据团队的三个实在判断

概念讲完了,说点工程上真金白银的事。这波从相似度检索走向上下文检索、从记忆走向行为固化的转向,对数据基础设施团队意味着三件事。

第一,图和向量的融合是刚需,不是选装包。 向量检索解决“找相似的”,图解决“找相关的”,Agent两者都需要。这意味着数据栈里要么引入图数据库,要么在现有平台里补上实体关系层。从成本角度,不必推倒重来——在现有管道里增加实体抽取和关系存储,往往是最务实的路径。

第二,记忆管理会成为新的数据治理课题。 技能库和用户画像本质上是持续更新的结构化数据,涉及质量、时效、权限。画像尤其敏感——它聚合了用户行为,更新和访问边界需要提前设计,这直接落入治理与安全的范畴。

第三,评估体系要换。 别再用“相似度分数”评估检索质量,要用任务完成率和召回正确率评估。上下文检索的收益恰恰在传统指标照不见的地方:跨实体、多跳、词汇不重叠的查询。

pie title 固化回路中三类核心资产

"程序化技能" : 35

"用户画像" : 25

"原始记忆与交互" : 40

这个占比是示意性的,但它说明一个方向:Agent数据栈的价值重心,会逐步从原始交互存储,向提炼后的技能与画像资产迁移。存储原始记忆是成本,沉淀技能资产才是复利。

小结

向量检索是RAG的第一程,上下文检索是第二程,记忆固化是第三程。Neo4j的三部曲给出了清晰的路线:工具、语义层与记忆、技能与画像。对数据团队而言,现在该做的不是急着重构,而是先盘点——你的检索里有没有关系,你的Agent记忆里有没有回路。下一轮AI基础设施的竞争,不在模型大小,而在上下文的组织方式。

“本文基于Neo4j官方博客《What is contextual retrieval? How AI agents find the right context》与《From memory to behavior: skills, user profiles, and the consolidation loop》两篇内容展开分析与推演。