博客
来自AI智能体经济的洞见、分析与更新。 按标签浏览.
团队间的 Token 预算之战:当你的 AI 平台团队变成“财政部”
有限的供应商配额加上三个面临上线期限的产品团队,就构成了一个预算分配系统。负责运行你 LLM 网关的团队往往被要求进行配额分配——通常是在没有政策支持、没有发起人、甚至没有遥测数据来支撑决策的情况下。
难度浓缩器:AI 客服分流正在让留下的员工精疲力竭
分流率衡量的是避开的难度,而非消除的难度。当 AI 处理了 80% 的简单工单时,人工队列中剩下的就全是 100% 的极端情况 —— 在数据仪表盘察觉之前,团队早已感受到了这种压力。
浏览器 Agent 会话泄漏:当单个 Profile 服务于多个租户时
为了规避冷启动成本,长期运行的浏览器 Agent 往往会复用 Profile,但这可能导致一个租户的会话被错误地提供给另一个租户的请求。追踪记录显示成功 —— 而另一个用户的仪表板内容正被读取。
凭证残留:你已停用的智能体仍处于生产环境登录状态
通过删除代码来停用 AI 智能体,会让 OAuth 令牌、服务账号、向量索引和评估数据集残留在生产环境中。解决方案始于上线之时,而非落幕之际。
评估天花板:当你的黄金测试用例失去区分度时
一旦每个候选模型在相同的测试用例上都获得了 95+ 的分数,你的评估套件就不再具备任何衡量价值 —— 是尺子不再适用,而不是被测平台的问题。
评估数据集是附带正确答案的客户数据
黄金评估集是与标记的正确答案配对的真实客户查询 —— 但大多数团队将其视为工程辅助工具,绕过了为底层生产数据构建的每一项隐私控制。
评估选择偏差:为什么你的测试集会对那些导致用户流失的失败视而不见
从生产链路中更新的评估集继承了幸存者偏差:遭遇最严重失败的用户已经离开,并停止生成链路。分数在攀升,而留存率在下降。以下是如何打破这一循环的方法。
备用方案变成了默认方案:为什么你的分层配比需要 SLO
你的备用路径本应只处理 0.5% 的请求。现在它却承载了 38% 的流量。修复方案是将分层配比视为一等 SLO。
LLM 提示词中 “现在” 的五种定义
每个 LLM 提示词中隐藏的五层隐性时间 —— 以及为什么当请求被重放、批处理或针对固定快照进行评估时,这些层级会产生无声的冲突。
流式推理中的海勒姆定律:节奏、停顿和中间 Token 是未成文的契约
当更换模型虽然保留了结构化输出 schema,但改变了 Token 节奏、停顿模式和中间表述时,你实际上发布了一个破坏性变更,违反了一个你从未正式定义的契约。
延迟预算博弈:如何告诉产品经理“实时性”是有能力代价的
一种在延迟目标成为正式承诺前与产品进行谈判的结构化方法——包含转换表、“三选二”框架,以及为什么 TTFT 通常是真正关键的指标。
MCP 冷启动税:工具服务器开销如何在智能体第 7 步发生累加
为什么 200 毫秒的 MCP 工具调用会演变成 4 秒的智能体循环,冷启动税究竟存在于何处,以及如何通过预热池规范将数秒的惩罚降低到 100 毫秒以下。