那个在你待办事项中悄悄更改的弃用日期
供应商可以在不发布差异对比、不发送通知的情况下直接修改弃用日期。当初将原始日期放入延期池的团队,直到收到支持工单时才发现大事不妙。
KV 缓存预热 Cron 任务只在蓝环境运行而从未进入绿环境,原因竟是主机绑定从未迁移
一次蓝绿部署导致固定在旧环境颜色的 Cron 任务孤立,Prompt 缓存变冷,账单悄然翻了三倍 —— 本文剖析了这一静默回归的始末,并提出了四个闭合缝隙的最佳实践。
配额窗口机制重写后,这批夜间脚本是如何拖垮你的交互流量的
一个夜间 LLM 批处理任务稳定运行了 10 个月,直到供应商重写了每日窗口的计算方式——将 00:05 UTC 的 Cron 任务变成了交互式流量的自杀式 429 异常。本文探讨为什么负载隔离、抖动和桶语义契约测试才是结构化的修复方案。
那些将模型未完成的残缺回答存入数据库的流式 UI
当流在生成中途报错时,乐观写入的内容可能会变成正式记录。本文探讨了为什么聊天 UI 会将残缺回答误认为完整答案,以及修复该问题的“定稿契约”。
你在供应商支持呼叫中通过屏幕共享泄露的系统提示词
系统提示词保护方案加固了应用程序边界,却忽略了屏幕像素。泄露面覆盖了你的工程师参与的每一次屏幕共享、Loom 录制和供应商支持呼叫。
使所有 Prompt 缓存前缀失效的分词器升级
一次分词器的变更可能会在其他所有信号显示正常的情况下,让你的 Prompt 缓存命中率在一夜之间从 80% 跌至个位数。本文将探讨哪些环节会出问题、为什么这种现象难以察觉,以及你应该监控哪些指标。
供应商重新校准后,你的智能体所信任的转录置信度得分
针对特定 ASR 模型调整的置信度阈值是与该特定校准达成的契约。当供应商重新训练置信度头(confidence head)时,相同的数值意味着不同的含义 —— 你的准入闸口也在悄然松动。
你的评测套件也是生产负载:当每晚测试耗尽线上流量配额时
当每晚运行的评测套件与线上产品共享同一个供应商组织账号时,一场由“嘈杂邻居”引发的生产事故就不可避免。本文将介绍如何隔离配额、根据 Token 影响对 PR 进行限制,并像对待真正的生产负载一样对待你的评测任务。
那些响应体显示 OK 且被客户端信以为真的 429 错误
当 429 错误的响应体显示为 OK 时,单纯的客户端会信任该响应体,跳过退避算法,从而将频率限制演变成重试风暴导致的宕机。修复方法是结构性的:同时读取状态码、响应头和响应体,并以最严格的声明为准。
以 Token 数量而非结果驱动的 A/B 测试
当实验平台让统计 Token 数量变得容易而衡量用户结果变得困难时,提示词 A/B 测试往往会发布一些团队无法将其与性能倒退区分开来的局部最优解。
针对你已不再提供服务的模型版本的 Bug 报告
客户针对你上个月已轮换掉的权重提交 Bug 报告的那一刻,你的模型版本控制政策就不再仅仅是内部的 MLOps,而变成了面向客户的可见合约。
为了节省 Token 而被你剥离的思维链,其实隐藏着一项合规证据要求
为了降低推理成本而剥离推理 Token 看起来是一项简洁的优化,直到审计员要求你提供一个你已不再生成的合规理由。推理踪迹是具有双重用途的产物 —— 它们既是工程成本项,也是受监管的证据 —— 而负责提示词的团队往往并不负责审计工作。