评估了错误的 RAG 管道环节
一个 RAG 系统本质上是由两台机器组成的,但大多数评估框架只给生成器评分。本文将解释为什么检索环节需要独立的评分体系,以及如何构建它。
淘汰嵌入模型:在不中断搜索的情况下重新索引数百万个向量
更换嵌入模型表面上看起来只是配置更改,但实际上是一次完整的数据迁移。本文将介绍如何重新嵌入语料库、执行双索引切换、预估成本和时间,并在你的用户发现问题之前证明新索引的效果更佳。
那个因等待另一个 Agent 而死锁的 Agent
两个能力出色的 Agent 可能会在你的账单飞涨时永远互相等待。为什么是协作——而非模型能力——导致了 Agent 群体的崩溃,以及分布式系统准则如何修复这一问题。
你的智能体读不懂的弃用通知
智能体不会阅读更新日志或 Sunset 响应头。本文将探讨为什么工具弃用对大语言模型智能体来说会静默失败,以及如何对工具契约进行版本化,从而让模型能够真正接收到通知。
无法回滚的功能开关:提示词
提示词的修改会瞬间改变所有用户的生产环境行为,既没有金丝雀发布,也没有有效的回滚机制。本文将探讨提示词和模型版本固定为何脱离了发布规范,以及将其重新纳入规范的五个原语。
FinOps 鸿沟:为什么没有人批准你那 4 万美元的 AI 账单
模型支出通过你的变更管理流程从未审查的代码路径进入生产环境。本文将探讨为什么 Token 成本在审批中是不可见的,以及弥补这一鸿沟的归因、成本分摊(Showback)和支出闸门(Spend-gate)等原语。
腐烂的黄金数据集:为什么你的评估集会与产品脱节
一个持续通过的黄金评估集可能在对你撒谎。本文探讨评估数据集如何因覆盖范围缺失、标签陈旧和分布偏斜而腐烂,以及如何通过数据卫生保持评分的真实性。
P99 是产品决策,而非基建决策
你的尾部延迟目标并不是基建团队单纯优化出的一个数字 —— 这个数字本身就是一个产品选择。本文探讨了 UX 交互设计与延迟预算如何相互权衡,以及为什么 P99 应该出现在设计评审中。
没人使用的长尾:工具带是如何变得尾大不掉的
你给智能体增加的每一个工具,都在削弱它选择正确工具的能力。那几十个无人问津的工具正在悄悄降低那三个核心工具的被选概率 —— 本文将探讨如何保持工具目录的精简与高效。
间接提示注入:你以为处于惰性的数据平面
你的智能体将检索到的每个文档都视为惰性数据,但检索到的文本实际上是以系统提示词的权限运行的。本文将探讨间接提示注入的工作原理、为什么 EchoLeak 证明了它的存在,以及真正有效的防御手段。
没人会为你的智能体承保
你的智能体准确率足以在无人看管的情况下运行,但部署过程却卡在了一个问题上:当它出错时,谁来承担损失。本文探讨了为什么自主性现在成了一个保险问题,以及如何让智能体变得可承保。
试点炼狱:廉价的 90% 正是你的 AI POC 无法转正的原因
一个可运行的 AI 演示只是那看起来像 100% 但其实很廉价的 90%。那些能确保其在生产环境中安全运行的评估、护栏、可观测性、成本上限和权属划分,才是没人预估过的昂贵的 10% —— 这里有一份清单,帮你提前预估这些成本。