MCP 中的 OAuth:在工具服务器中传递用户身份
MCP 标准化了智能体如何获取工具服务器令牌的方式,但将更棘手的问题——这些服务器如何将用户身份传递给下游 API——留给了实现者。本文探讨了哪些方案能够通过严格的审计。
策略文件:为什么你不应该把拒绝规则写在系统提示词里
生产环境的系统提示词就像是披着一件风衣的三个配置文件——对话语气、输出格式和拒绝策略被塞进同一个工件中,共用同一个评审人和发布节奏。每一次策略修改都会导致无关任务的行为回归。这里有一种能显著获益的解耦方案。
Prompt 修改不只是措辞变动:将 Prompt 视为软件的代码审查规范
Prompt 修改看起来像是英语,但行为表现却像代码。通过配对评估与 Prompt 的 PR、行为差异注释以及划分审查角色等规范,在用户发现之前捕捉行为回归。
会话边界问题:计费、评估和记忆的对话终点在哪里
一个 session_id 列,三种含义 —— 计费、评估和记忆对“对话”的定义各不相同,而单一的默认设置会导致三个根因相同但互不相关的 Bug。
“展示过程”的 UX 陷阱:当推理链只是披着产品外壳的调试输出
大多数 AI 功能之所以带有可见的推理过程,仅仅是因为模型输出了它,而将其隐藏似乎很浪费。这是一个团队从未真正做出的产品决策——也是信任流失的一个可衡量的来源。
总结税:当压缩消耗的 Token 超过了它节省的量
长期运行的 Agent 在溢出或层级化处理时会触发摘要生成,而在大规模应用中,压缩过程会悄然成为主要的推理成本——而仪表盘永远不会告诉你这一点。
我们已经有了:当 AI 功能在重新造你已有的代码轮子
在成熟的公司中,大多数 AI 功能其实是在重复代码库中已有的逻辑。解决方法是在开发前进行审计,并采用一种组合模式,让模型成为备选路径而非首选路径。
80% 陷阱:聚合 RAG 指标如何掩盖系统性长尾失效
报告 80% 检索准确率的 RAG 系统往往掩盖了长尾查询中的系统性失效。本文将探讨如何审计覆盖范围缺口,并在不降低头部性能的情况下进行修复。
稀疏信号问题:当无法进行 A/B 测试时如何衡量 AI 功能质量
B2B AI 功能鲜少拥有足够的日活用户来支撑 A/B 测试。本文介绍如何在频率统计无法规模化时,利用贝叶斯方法、代理信号和结构化专家知识获取来衡量质量。
Agent 的写操作侧:在行动层设计可逆性
AI Agent 的每一次写操作都是一个潜在的事故。如何在 Agent 删除无法找回的数据之前,为行动层设计可逆性。
撒谎的 AI A/B 测试:LLM 实验中的新奇效应、结转偏差与锚定偏差
三种心理偏差——新奇效应、锚定偏差和结转偏差——会系统性地夸大 AI 功能的 A/B 测试结果,而标准的留存组(Holdout Group)方案对这些都无能为力。本文将介绍一种真正有效的纵向队列设计(Longitudinal Cohort Design)。
AI 代码审查倒置:当作者是机器时应关注什么
当 AI 智能体编写了你大部分的提交时,逐行代码的正确性审查会忽略那些关键的漏洞。这里有一套真正适用于机器创作代码的审查规范。