规模化工具发现:为何纯嵌入检索在超过 20 个工具后开始失效
当AI智能体的工具库超过20个后,平面嵌入检索就会崩溃。本文解析其失败原因、结构化能力元数据的形态,以及分层路由器如何解决更好的工具描述无法修复的架构问题。
知识时效路由:在生产 AI 中将查询匹配到正确的时间层
生产 AI 系统同时承载四个不同新鲜度层级的知识——参数化权重、RAG 索引、会话上下文和实时检索。将查询路由到错误的层级会产生自信但错误的答案,且没有任何可见的错误信号。
“什么发生了变化”查询是你的索引无法回答的 RAG 问题
向量相似度检索会将同一文档的两个版本视为近乎相同,因此在处理不断演进的文档时,任何 RAG 系统在处理增量查询时都会静默地产生“没有任何变化”的幻觉。本文将解释这种失败为何是结构性的,以及一个能够感知变化的索引究竟长什么样。
你的 Embedding 模型选择决定了 RAG 的上限,而 LLM 无法突破它
Embedding 模型决定了 RAG 质量的上限,而更换 LLM 无法提升该上限。本文提供了一个实用的选择框架:领域匹配、维度选择、多语言表现和指令微调。
Reranker 是你 RAG 评估中从未衡量的“静默”第二个模型
大多数 RAG 流水线串联运行两个模型 —— 检索器和重排序器 —— 但评估套件通常只对生成器的输出进行评分。当 reranker 发生漂移时,仪表盘显示答案质量下降,却找不到因果关系。本文将介绍如何构建能够捕捉这些静默回归的 reranker 评估。
检索膨胀:当“加个 RAG 就行”变成架构上的干扰
通过添加检索步骤来修复每个模型失败看似是进步,直到你的系统变成一堆检索器的堆砌,拼凑出的提示词依然无法解决原始问题。本文提供了一套针对 RAG 的诊断框架、消融实验准则和复杂度预算。
你的向量数据库也有热点 Key:为什么 ANN 索引在生产成本上“撒了谎”
公开的 ANN 基准测试通常运行均匀的查询负载,但在生产环境中检索是齐夫分布(Zipfian)的 —— 这种差异表现为分片过载、RAM 浪费以及超出预期的 p99 延迟。
RAG 流水线中被你忽略的查询重写层
大多数检索失败源于查询形态的问题,而非嵌入模型本身。本文将深入探讨 HyDE、查询分解、多查询并行分发以及排名融合等技术,并教你如何在盲目更换编码器之前,诊断出你的 RAG 流水线真正需要的优化方案。
无结果并不代表不存在:为什么智能体将检索失败视为证明
那些回答“无结果”的智能体很少是在对现实世界做出陈述。它们只是将一个空数组描述为一种证明——而这正是隐性生产事故产生的原因。
向量检索中的流行度偏见:为什么相同的五个文本块总是主导每个查询
为什么少数文本块会主导每个 RAG 查询 —— 高维中心点(Hubness)和 ANN 图结构如何默默地瓦解了检索多样性,以及保持长尾内容活力的诊断方法与缓解策略。
你的 RAG 分块器是一项无人 Review 代码的数据库 Schema
将你的 RAG 分块器视为预处理,每一次边界微调都会变成一次静默的 Schema 迁移。对其进行版本管理、灰度发布,并同步负责检索评估。
分块策略是 RAG 流水线中隐藏的核心决策
你在索引阶段确定的分块大小和边界策略决定了 RAG 系统的质量上限。本文将介绍如何正确调优,并在回归问题演变为无声故障前捕获它们。