LLM 应用的特征存储模式:停止检索那些你可以预计算的内容
将特征存储架构应用于 LLM 上下文组装,可以显著降低检索延迟、减少推理成本,并防止因训练-推理偏差(training-serving skew)而导致的模型性能静默下降。
系统提示词是软件接口,而非配置字符串
大多数团队把系统提示词当成配置字符串对待——没有版本控制、没有测试,一次错误的编辑就可能引发静默故障。将软件接口设计原则应用于提示词,才是让 LLM 系统在规模化后仍可维护的关键。
长对话中的意图漂移:为什么你的智能体目标表征会失效
在长会话中,用户意图会发生偏移,而累积的上下文往往将其平铺为单一的静态目标。本文将探讨智能体如何被早期信号锁定、误将纠正视为澄清,以及应对这些问题的策略。
200 Token 的系统提示词如何击败你的 4000 Token 提示词
冗长的系统提示词因不断堆砌而增长,并通过注意力稀释、指令魔咒和逻辑矛盾悄然降低输出质量。本文介绍了如何通过压缩原则,让一个 200 Token 的提示词在评分上超越 4000 Token 的提示词。
长时 Agent 会话中的人格漂移:为什么你的 Agent 会忘记自己是谁
经过 8–12 轮对话后,Agent 人格自一致性下降超过 30%。以下是 Transformer 注意力机制导致 Agent 偏离系统提示词的原因,以及三种真正有效的生产级解决模式。
分页是一项工具目录规范:为什么智能体在处理列表返回时会耗尽上下文
返回无界列表的工具会将智能体变成函数调用时代的 SELECT * 反模式。分页是一种降级原语 —— 应该将其作为工具目录中的规范,而不是逐个工具去决定。
工具输出压缩:决定上下文质量的注入策略
AI智能体管道中的工具结果Token密度相差100倍。你选择的注入策略——原始注入、压缩还是提取——从根本上决定了智能体在规模化后的准确率上限、成本上限和延迟下限。
压缩陷阱:为什么长时运行的智能体会忘记已经尝试过的事情
上下文压缩会悄无声息地丢弃失败记录和约束信息——而这些信息正是防止智能体重复尝试已知无效操作的关键。本文介绍如何在架构设计上规避这一问题。
长会话上下文退化:多轮对话如何变得陈旧
超过 50 轮的会话会积累矛盾、用户意图漂移和奉承循环。这是一份用于检测退化并保持长对话有用性的工程指南。
Monorepo 中的编程智能体:为什么上下文窗口与 50 个服务的代码库无法兼容
编程智能体在大型 Monorepo 中遇到了硬伤:任何跨服务更改的相关代码所跨越的包,都超出了任何上下文窗口的承载能力。本文将探讨实际有效的解决方案。
长期运行 AI 智能体中的上下文毒化
长期运行的 AI 智能体中积累的上下文是如何默默地破坏推理能力的,导致该问题的四种故障模式,以及防止级联故障的检查点、剪裁和不变性检查模式。
10倍提示工程师的神话:为什么系统设计比提示词打磨更重要
生产数据显示,前5小时的提示词工作带来35%的提升,而接下来的40小时仅增加1%。LLM应用的真正杠杆在于检索质量、任务分解、输出验证和评估基础设施——而非提示词打磨。