下线一个 Planner 已产生依赖的 Agent 工具
从你的 Agent 工具目录中移除一个函数不仅仅是语法上的更改,更是一次行为迁移。这种阶段式下线模式可以防止回退幻觉和隐性回归。
影子 AI 治理难题:为什么禁止个人 AI 账号会让安全性变差
阻止员工使用个人 ChatGPT 或 Claude 账号并不能停止 AI 的使用 —— 反而会让其变得不可见。本文将探讨如何调研影子 AI、建立合规渠道,并避免治理演戏。
为什么 Token 预测在上线后会发生偏移 —— 以及如何在财务发现前捕捉到异常峰值
上线前的成本模型假设的是合成流量组合。当功能真正上线,现实情况就会发生偏移。账单是最糟糕的探测器 —— 这里告诉你如何实时捕捉这种偏移。
为什么每周会话记录审查优于你的 AI 仪表板
每周花一小时阅读生产环境的会话记录,可以发现提示词漂移、未分类的意图以及被仪表板平均值掩盖的敷衍措辞。本文将介绍如何主持会议、参会人员、采样方法,以及使其可持续发展的隐私规范。
为什么你的 AI 路线图不应该有 12 个月的计划
前沿模型的能力每 90 天就会发生更替。一份为期 12 个月的功能路线图会让你陷入过时的博弈中。请将其替换为具有明确终止标准的能力组合。
物理隔离 LLM 蓝图:无出站流量部署的真正需求
云端 AI 栈将出站 HTTPS 视为一种免费的原语。拔掉网线后,每一层(从模型溯源、评估到集群管理和遥测)都必须被迫重新构建那些在云端版本中被悄悄隐藏的原语。
你的 Embedding 模型选择决定了 RAG 的上限,而 LLM 无法突破它
Embedding 模型决定了 RAG 质量的上限,而更换 LLM 无法提升该上限。本文提供了一个实用的选择框架:领域匹配、维度选择、多语言表现和指令微调。
将 Eval 作为 Pull Request 评论而非任务:在代码审查中嵌入 LLM 质量门禁
为什么只有当 LLM 评估(evals)存在于 diff 旁边的 PR 评论中时,才能有效捕捉回归。借鉴代码覆盖率如何从夜间任务迁移到内联审查界面的经验 —— 以及将“评估即任务”转变为“评估即合并门禁”的四个工程关键点。
评估集腐化:为什么评估分数在上升,而用户满意度在下降
评估分数在攀升,但用户投诉也在同步增长。一个基于发布周流量构建的评估集,在六个月后可能已经悄然失去了衡量产品的能力 —— 本文将介绍如何通过影子集、重采样和切片规则来保持仪表板的真实性。
多步 Agent 的延迟预算:为什么 P50 会说谎,而 P99 才是用户的真实感受
多步 Agent 在中位数延迟上看起来很快,但在尾部延迟上却让人感觉很慢。本文将探讨为什么系统组合会惩罚 P50 仪表板,以及如何设计符合用户实际体验的延迟预算。
你的 LLM 账单只占 Agent COGS 的一半 —— 另一半是无人监控的部分
推理仅占 Agent 真实成本的 40-60%。另一半则隐藏在向量数据库、检索嵌入、遥测、重试、评估和人工审核中 —— 而这些成本往往没有明确的归口团队。
无人测试的隐私边界:为什么“无状态”工具是 AI 时代的 IDOR
“无状态” AI 工具调用是如何通过共享缓存、向量库和记忆模块在租户之间悄悄泄露数据的 —— 以及如何在客户发现之前捕获这些问题的审计协议。