你的编程 Agent 开启的那个导致真实 PR 被关闭的拉取请求
当一个编程 Agent 根据过时的评论写下 “Closes #1247” 时,GitHub 会将其视为一条关键指令。本文探讨了 Agent 编写的 PR 元数据如何破坏人工审查工作,以及防止这种情况发生的门控机制。
当供应商重新定义 Bucket 时,那份让你溢出流量成本暴增的预留容量合同
预置吞吐量合同看起来像是一种固定费率的对冲工具,直到供应商悄悄改变了溢出流量的计算方式。防御手段包括账单核对、锁定计量的合同条款,以及能以小时而非季度为单位捕捉偏差的分层仪表板。
重试预算如何从你的仪表板中隐藏了供应商的真实错误率
一个在悄无声息间实现 99.9% 成功率 SLO 的同时导致账单翻了 3 倍的重试循环 —— 为什么重试后的可用性是向领导层报告的错误指标,你应该衡量什么,以及隐藏在可靠性层中的成本-质量调节开关。
被反向代理剥离的 SSE Keep-Alive,以及你支付了两次费用的 Prompt
LLM 流式响应看起来像是从模型到用户的通畅管道 —— 直到一次 35 秒的工具调用导致反向代理断开连接,你的客户端针对无状态 API 重试整个 Prompt,最终用户的账单为同一个响应支付了两次费用。
你的 RAG 语料库信任边界取决于谁能写入其数据源
通过竞争对手公开评论进行的间接提示词注入,可以将你的 RAG 管道变成一个数据外泄通道。信任边界不在于谁编写了摄取代码,而在于谁可以写入数据源。
当候选人说“我会直接用提示词解决”时,面试官之间出现的 40 分分歧
针对同一位候选人产生的 40 分评价差异,并不是候选人的问题,而是评分标准的问题。本文将探讨当你的团队尚未达成共识时,如何校准 AI 工程师的招聘环节。
以 Token 数量而非结果驱动的 A/B 测试
当实验平台让统计 Token 数量变得容易而衡量用户结果变得困难时,提示词 A/B 测试往往会发布一些团队无法将其与性能倒退区分开来的局部最优解。
针对你已不再提供服务的模型版本的 Bug 报告
客户针对你上个月已轮换掉的权重提交 Bug 报告的那一刻,你的模型版本控制政策就不再仅仅是内部的 MLOps,而变成了面向客户的可见合约。
你的 AI 功能无法使用 CDN 边缘缓存,因为响应因用户而异
个性化 AI 功能继承了与缓存网页不同的物理特性。你的团队从 CDN 支持的界面借鉴的延迟 SLO,对于按用户生成的响应来说,在结构上是无法实现的 —— 以及你应该如何应对。
翻倍且没有事后复盘:那份编码智能体带来的 CI 账单
编码智能体不会在工作就绪时才推送 —— 它通过推送来发现工作是否就绪。CI 成本不再随提交次数增加,而是随计划步骤缩放,财务部门去年建立的预测模型已不再适用。
抹除后续问题所需上下文的对话记忆修剪启发法
基于近因和长度的修剪会剔除后续轮次默默依赖的约束,而用户会将言之凿凿的错误回答视为能力退化。修剪是检索的对偶,那些为了 Token 数量而调整修剪策略的团队,正在悄然降低回答质量。
会话摘要抹掉了用户授予你的同意标志
压缩保留了智能体的回答,却遗忘了用户的选择。应将对话记忆视为语义和结构化两个流,否则你交付的将是隐私违规。