跳转到主要内容

摊销上下文:持久化智能体记忆 vs 长上下文窗口

阅读需 2 分钟Tian PanTian Pan

当 100 万 token 的上下文窗口实现商业化时,许多团队悄然认定,他们已经解决了智能体记忆(agent memory)的问题。当你可以把所有内容都丢进去并让模型自己处理时,为什么还要构建检索系统、管理向量数据库或设计淘汰策略(eviction policy)呢?答案就在你的基础设施账单中。在每天 1 万次交互、拥有 10 万 token 知识库的情况下,这种暴力的上下文内(in-context)方法每天的成本约为 5,000 美元。而处理同样负载的检索增强记忆系统的成本约为每天 333 美元 —— 随着用户群的增长,这 15 倍的差距会产生复利效应。

真正的问题不仅仅是成本。更严重的是,更长的上下文会导致答案质量显著下降。研究一致表明,模型会丢失位于极长输入中间位置的信息;当相关的证据被埋没在无关的代码块(chunks)中时,准确率会如预见般下降;且延迟的攀升会使交互式智能体显得反应迟钝。这种“塞进一切”的方法不仅浪费金钱 —— 它还以牺牲准确性为代价换取了简单化的假象。

“迷失在中间”效应并非提示工程问题

长上下文填充的结构性问题在于注意力稀释(attention dilution)。当你向模型发送 20 万个 token 时,注意力机制必须在所有内容中分配权重。位于长上下文中间位置的信息系统性地获得的注意力少于开头或结尾的内容。一个基准测试系列报告称,当同一文档在 20 个文档的上下文中从第 1 位移至第 10 位时,准确率下降了 30% 以上。这种情况在多个前沿模型中都普遍存在。

即使是那些具有最佳长上下文处理能力的模型 —— 那些在宣称的完整窗口内都能保持准确性的模型 —— 在实践中也只能在 60-70% 的容量范围内保持可靠的高效。宣称的上下文窗口大小与有效的上下文窗口大小并不是同一个数字。营销噱头是上限,而工程现实则要低得多。

延迟带来的惩罚更为显著。在 70B 参数模型上的生产基准测试衡量出,与聚焦检索相比,填充上下文(stuffed-context)查询的延迟增加了 719%。更重要的是:相同查询的 token 计数从填充模式下的 3,729 个 token 变为定向检索下的 67 个 token —— 这是一个 55 倍的差异。在规模化运行中,这种差异不是噪音。它是响应迅速的智能体与被用户弃用的智能体之间的区别。

三层记忆架构

高效的智能体记忆不是一个单一的系统,而是三个协调的层,每一层都有不同的成本概况和访问模式。

短期上下文记忆保存当前的对话、活动的运行状态以及任何需要跨过当前轮次保留的固定事实。这是模型的即时工作空间。诱惑是让它在轮次之间无限制地增长;而纪律则是将其视为一个工作集,在溢出之前进行压缩。

长期外部记忆通过使用具有混合检索功能的向量数据库跨会话持久化 —— 将语义相似性搜索与关键词匹配和元数据过滤相结合。在这里,时效性很重要:最近未被检索的记忆其相关性会衰减,这模仿了人类记忆的工作方式,并减少了陈旧事实被注入当前上下文所产生的干扰。外部记忆使得在第一轮学到的事实在第五十轮依然可用,而无需占用第二到第四十九轮的任何上下文 token。

结构化上下文 —— 这是大多数团队跳过的层 —— 存储了在对话中永远不会改变的企业定义、策略、血缘数据(lineage data)和参考信息。这属于一个单独的索引存储,而不是上下文窗口,因为它不需要被语义化检索 —— 当智能体在受监管的领域操作时,它需要被确定性地查找到。

扩展有效上下文的压缩模式

使外部记忆变得实用的架构技术是递归压缩(recursive compaction)。当上下文容量填满时(例如在 16k token 时),系统不再是简单的截断或报错,而是逐出最旧的 50% 消息,根据现有摘要加上逐出的内容生成一个新的摘要,将完整的消息存储在归档记忆中,并仅在窗口内保留压缩后的摘要。

这种模式将有效的上下文从模型的物理限制扩展到了任意大的历史记录。根据内容类型的不同,这种方法在长文档基准测试中的困惑度(perplexity)降低幅度在 16-30% 之间。成本是增加了一次摘要调用;收益是智能体能够维持连贯的长周期对话,而不会导致单次调用的 token 计数爆炸。

MemGPT 架构正式确立了这种方法:一个主上下文(快且贵)加上归档记忆(慢且便宜),并配有一个管理层来决定哪些内容被提升、逐出、总结和检索。该设计的生产部署报告称,智能体处理对话历史所需的直接上下文可能需要数百万 token,但其每轮成本却低得多。

决策框架:内容放在哪里

决定哪些内容保留在上下文(In-context)中,哪些内容持久化到外部记忆中,是一个信息质量问题,而不仅仅是成本问题。

在以下情况保留在上下文中

  • 在当前轮次中,信息会被多次主动引用
  • 对话中的顺序或位置至关重要(例如,用户刚刚纠正了某些内容,而该纠正需要覆盖早期的上下文)
  • Agent 正处于复杂的多步计划中,丢失任何中间状态都会导致需要重新计算

在以下情况持久化到外部记忆

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 12 分钟

2026 年的长上下文 vs RAG:为什么它是基于功能的决策,而非架构信仰

在 2026 年,长上下文与 RAG 的选择不再是整个产品的架构抉择,而是由四个维度(新鲜度、归因、尾部风险、成本)驱动的基于功能的决策。本文深入剖析了这一原则,帮助你的 AI 功能在不断变化的数学模型中始终处于正确的一侧。

insider
llm
阅读需 7 分钟

上下文长度军备竞赛:为什么填满窗口是错误的目标

每个大模型新版本发布时都会宣传更大的上下文窗口。但实践者正在发现,填满窗口会降低质量、增加延迟并消耗预算——而稀疏、精心筛选的上下文始终优于朴素的堆砌方式。

insider
llm
阅读需 11 分钟

右缘准确率下降:为什么上下文窗口的最后 20% 是个陷阱

填满 LLM 宣称的上下文窗口会导致右缘准确率崩溃 —— 这是继“迷失在中间”之后的一种失效模式。本文包含基准测试、按任务划分的安全裕度以及提示词修复方案。

insider
llm
阅读需 9 分钟

Token 预算作为产品约束:围绕上下文限制进行设计,而不是假装它们不存在

大多数 AI 产品在处理上下文限制时会直接崩溃。本文将探讨如何围绕这些限制进行设计——包括渐进式截断、优雅降级,以及将上下文压力作为一等公民的 UI 信号进行展示。

insider
llm
阅读需 9 分钟

检索引用税:为什么合规性会增加 30% 的 RAG Token 账单

在 RAG 系统中添加引用看起来只是改一行系统提示词。但在受监管的租户中,它会悄无声息地让推理成本增加 25%–40%。本文将探讨为什么这种“税收”是结构性的,以及哪些架构层面的调整可以帮你挽回大部分成本。

insider
rag