被切分边界拦腰截断的关键句,以及随之消失的答案
固定大小的 Token 切分会将关键子句拦腰切断,导致碎片化的片段无法被单独检索。本文探讨了为什么这种失败在标准评估中难以察觉,以及哪些切分策略能真正解决这一问题。
悄然渗入你提示词中的评估集
少样本检索和共享的 CSV 文件如何悄无声息地将精心准备的评估库变成你提供给模型的上下文示例——以及如何通过存储层隔离来阻止这一切。
当你的 RAG 流读取时发生的 Wiki 中途编辑问题
当你的 RAG 摄入任务在作者编辑中途运行时,索引可能会捕获一个在 Wiki 中从未真实存在的状态。本文将探讨为什么基于轮询的流水线在大规模场景下会产生脏读,以及如何通过 CDC、版本锁定和写入静默模式来解决这些问题。
被你的 RAG 当成工程规范引用的那张营销页
相关性与权威性是两个不同的维度,而标准 RAG 栈把它们压成了一个分数。本文讨论为什么打磨过的营销文案会在向量赛跑里击败你的工程 RFC,以及该怎么办。
你的 Embedding 并不知晓外包人员已离职
你的向量索引是一个无人更新的权限缓存。当源数据的访问权限发生变更时,Embedding 仍会像什么都没发生一样继续响应——而这正是无人预料到的数据泄露。
那个把上周 Slack 消息当成昨天消息来读的智能体
一个智能体检索到一条 6 周前写的“我们明天发布”的消息,并将其视为当前的计划。检索流水线保留了正文,却弄丢了时钟。
语义过时的 Embedding:当向量不再理解当下
随着现实世界的词汇演变,嵌入式知识库正在悄然失效。召回率仪表板往往会忽略这一点,因为它们仍基于过时的相似性定义进行评分。
Token 预算是产品决策,而非配置值
设置上下文窗口分配(历史记录 vs 检索结果 vs 工具输出)的那行代码,是隐藏在 f-string 中的产品决策。本文将介绍如何将其显性化、衡量它,并为其指定负责人。
当 RAG 本该是一次 JOIN 时
将关系型问题路由到向量索引会将精确答案转化为似是而非的答案。如何识别复杂的谓词、聚合和连接 (JOIN) —— 并将其发送给查询语句,而不是余弦相似度。
那些在悄无声息中重新排列你整个语料库的嵌入模型升级
将你的嵌入模型更换为基准测试更高的模型会使你存储的每一个向量失效。本文探讨了为什么升级会悄悄降低检索质量,以及如何像处理数据库 Schema 变更一样进行迁移。
自信地返回错误答案的语义缓存
语义缓存用精确匹配的保证换取了低延迟,而代价则是将误命中作为流畅的事实返回。本文将探讨如何衡量误命中率、选择 Embedding 模型、缓存检索而非生成,并将阈值调优作为一项安全决策。
你的向量索引是一个没有失效策略的缓存
向量索引是你源数据的派生副本,这使得它成为了一个会过时的缓存:修改内容永不自动同步、已删除的文档留下“残影”、被撤销的权限导致泄露。为什么 RAG 的可靠性是一个缓存失效问题,而不是相似度搜索问题。