博客
来自AI智能体经济的洞见、分析与更新。 按标签浏览.
那些悄然成为你唯一评测集阅读者的提示工程师
你的评测集只是一个文件,而使其具备可读性的判断力却存在于某个工程师的脑海中 —— 本文将探讨这种巴士系数如何在他们离职后才显现出来。
被你的团队视为独立于模型版本的提示词版本
Prompt v37 是针对 Claude 4.6 调优的。平台团队将别名滚动到了 4.7。你的事故时间线显示没有部署 —— 因为没有人追踪这种配对关系。
那些悄悄将你的高级流量路由到 Haiku 的供应商自动路由器
通过供应商的 'auto' 别名减少 34% 的开支看起来像是一场胜利,直到你流量最高的界面的客户满意度连续两个季度下滑 —— 而批准此次上线的评估流程甚至从未见过路由器重定向到 Haiku 的那些提示词。
你的编程 Agent 开启的那个导致真实 PR 被关闭的拉取请求
当一个编程 Agent 根据过时的评论写下 “Closes #1247” 时,GitHub 会将其视为一条关键指令。本文探讨了 Agent 编写的 PR 元数据如何破坏人工审查工作,以及防止这种情况发生的门控机制。
RAG 去重环节的隐蔽失效:当近重复数据占满 Top-K 检索结果时
数据摄入阶段去重逻辑的隐蔽回归,可能导致你的 RAG 上下文中充斥着几乎相同的分块,而各项检索指标却依然显示正常。本文将探讨为什么相关性评分会漏掉这一问题,MMR 和契约测试如何填补这一漏洞,以及为什么流水线的质量上限受限于其最薄弱的不变量。
RAG 阈值固定在了绝对分值上,而 Embedding 升级却悄然改变了分布
当 Embedding 升级悄然改变了重排序器的分值分布时,固定的阈值就变成了一个完全不同的过滤器 —— 而性能倒退就隐藏在那个从未被修改过的数字里。
那些与实际限流不符的提供商频率限制响应头
提供商的频率限制响应头与实际限流器往往并不一致 —— 不同的窗口、不同的作用域、不同的单位。本文将探讨这种差异存在的原因,以及如何设计能够应对这种不一致性的控制循环。
当供应商重新定义 Bucket 时,那份让你溢出流量成本暴增的预留容量合同
预置吞吐量合同看起来像是一种固定费率的对冲工具,直到供应商悄悄改变了溢出流量的计算方式。防御手段包括账单核对、锁定计量的合同条款,以及能以小时而非季度为单位捕捉偏差的分层仪表板。
重试预算如何从你的仪表板中隐藏了供应商的真实错误率
一个在悄无声息间实现 99.9% 成功率 SLO 的同时导致账单翻了 3 倍的重试循环 —— 为什么重试后的可用性是向领导层报告的错误指标,你应该衡量什么,以及隐藏在可靠性层中的成本-质量调节开关。
由于注册表缓存存在一小时延迟,你的智能体仍在调用已被撤销的工具
当用户移除一个智能体工具时,一小时的注册表缓存以及将拒绝视为暂时性错误的重试策略,会将一次常规的撤销变成一个安全事件,而用户只能通过审计日志才发现这一问题。
云厂商负载均衡器悄然忽略的会话亲和性
聚合缓存命中率掩盖了在高负载下亲和性提示被丢弃的对话。本文探讨了为什么单 Pod KV 状态和尽力而为的路由会导致长 Agent 会话的首字延迟激增,以及你应该如何进行监测。
客户无法复现的隐形个性化层
推理时个性化层虽然可以提升整体满意度,但通过注入客户无法读取、重置或在其评估套件中复现的隐藏状态,它依然会破坏 API 合约。