你的 Embedding 模型选择决定了 RAG 的上限,而 LLM 无法突破它
Embedding 模型决定了 RAG 质量的上限,而更换 LLM 无法提升该上限。本文提供了一个实用的选择框架:领域匹配、维度选择、多语言表现和指令微调。
分层内存压缩:你的智能体内存缺失的四个层级
大多数 LLM 智能体内存将四个层级压缩为两个 —— 缓冲区和向量存储。工作记忆、会话记忆、情节记忆和语义记忆各自都需要独立的层级。
无人测试的隐私边界:为什么“无状态”工具是 AI 时代的 IDOR
“无状态” AI 工具调用是如何通过共享缓存、向量库和记忆模块在租户之间悄悄泄露数据的 —— 以及如何在客户发现之前捕获这些问题的审计协议。
单向量版本标签:每个 Embedding 迁移背后的缺失列
向量数据库在发布时并没有配备 Postgres 已经拥有二十年的迁移工具 —— 没有 ALTER TABLE,没有在线模式变更,也没有单行版本控制。使 Embedding 升级得以平稳进行的规范,始于一个大多数团队都忘记添加的列。
Reranker 是你 RAG 评估中从未衡量的“静默”第二个模型
大多数 RAG 流水线串联运行两个模型 —— 检索器和重排序器 —— 但评估套件通常只对生成器的输出进行评分。当 reranker 发生漂移时,仪表盘显示答案质量下降,却找不到因果关系。本文将介绍如何构建能够捕捉这些静默回归的 reranker 评估。
检索膨胀:当“加个 RAG 就行”变成架构上的干扰
通过添加检索步骤来修复每个模型失败看似是进步,直到你的系统变成一堆检索器的堆砌,拼凑出的提示词依然无法解决原始问题。本文提供了一套针对 RAG 的诊断框架、消融实验准则和复杂度预算。
你的向量数据库也有热点 Key:为什么 ANN 索引在生产成本上“撒了谎”
公开的 ANN 基准测试通常运行均匀的查询负载,但在生产环境中检索是齐夫分布(Zipfian)的 —— 这种差异表现为分片过载、RAM 浪费以及超出预期的 p99 延迟。
Embedding 迁移是新时代的 Schema 迁移
在生产环境中更换 embedding 模型不仅仅是一个批处理任务 —— 它是一场具有语义影响的 Schema 迁移。为什么点对点评估会遗漏回归问题,双写窗口和邻域稳定性指标究竟能为你带来什么,以及成本结构在哪些地方会让团队措手不及。
知识截止期是 UX 界面,而非脚注
每个大语言模型都有知识截止期,而每个产品都在对此保持沉默。请将内容的新鲜度视为一个经过设计的 UX 界面——而非注脚——否则用户将根据模型本该拒绝回答的内容来评估信任度。
知识图谱的时效性与向量索引的时效性具有不同的 SLA
向量索引的性能是逐渐下降的,但知识图谱的失效则是断裂式的 —— 在同一个 CDC 流水线下运行它们,会导致多跳查询静默地输出错误答案。
2026 年的长上下文 vs RAG:为什么它是基于功能的决策,而非架构信仰
在 2026 年,长上下文与 RAG 的选择不再是整个产品的架构抉择,而是由四个维度(新鲜度、归因、尾部风险、成本)驱动的基于功能的决策。本文深入剖析了这一原则,帮助你的 AI 功能在不断变化的数学模型中始终处于正确的一侧。
没人召集的索引策略委员会:超越一次性迁移的 RAG 语料库治理
大多数 RAG 的失败并非模型失败,而是治理失败。本文探讨语料库治理的四个维度——法律、新鲜度、作者信任、所有权,以及决定你的检索索引是产品界面还是共享收件箱的索引策略规范。