使所有 Prompt 缓存前缀失效的分词器升级
一次分词器的变更可能会在其他所有信号显示正常的情况下,让你的 Prompt 缓存命中率在一夜之间从 80% 跌至个位数。本文将探讨哪些环节会出问题、为什么这种现象难以察觉,以及你应该监控哪些指标。
与工具本身脱节的工具描述
当工具的 JSON Schema 和其文本描述存放在不同位置时,它们会各自独立演进并产生偏差 —— 导致模型遵循了描述中的错误,而这些错误本可以通过 Schema 捕获。本文将探讨为什么工具描述是你有效系统提示词的一部分,以及如何确保它们的真实性。
你的网关在 LLM 调用与工具执行之间丢失的 traceparent 请求头
生产环境中的 LLM 智能体技术栈经常在模型调用与工具执行之间丢失 W3C traceparent 请求头,导致原本连贯的用户交互逻辑碎裂成一堆“孤儿追踪”森林 —— 本文将揭示泄漏发生的环节以及如何修复它。
供应商重新校准后,你的智能体所信任的转录置信度得分
针对特定 ASR 模型调整的置信度阈值是与该特定校准达成的契约。当供应商重新训练置信度头(confidence head)时,相同的数值意味着不同的含义 —— 你的准入闸口也在悄然松动。
你的延迟 SLO 取决于其他团队的 Prompt 大小
共享的每分钟 Token 数(TPM)限制使得你的延迟 SLO 与你自己的服务脱钩。解决方法是以提供商进行限流的单位来衡量内部容量,而不是以请求数或美元。
检索流水线的数据驻留:那些跨境而去的 Embedding,以及并未跨境的 LLM 调用
你的推理端点固定在法兰克福,但你的 Embedding API、向量控制平面、重排序(Rerank)服务、Prompt 缓存和追踪存储却并非如此。本文将深入探讨 RAG 请求中的六个数据驻留层面,以及每个环节在不知不觉间跨境传输时所存在的组织架构差距。
那些响应体显示 OK 且被客户端信以为真的 429 错误
当 429 错误的响应体显示为 OK 时,单纯的客户端会信任该响应体,跳过退避算法,从而将频率限制演变成重试风暴导致的宕机。修复方法是结构性的:同时读取状态码、响应头和响应体,并以最严格的声明为准。
以 Token 数量而非结果驱动的 A/B 测试
当实验平台让统计 Token 数量变得容易而衡量用户结果变得困难时,提示词 A/B 测试往往会发布一些团队无法将其与性能倒退区分开来的局部最优解。
那个批准了“单次调用成本”却从未衡量“单次解决任务成本”的智能体预算
一个使单次调用成本下降了 25% 但单次解决任务成本却上升了 40% 的智能体,是智能体部署中最常见的单位经济失效案例。本文将探讨为什么供应商的 SKU 并不是工作单元,以及如何建立正确的衡量指标。
你的客户成功团队无法消化的智能体发布节奏
当 AI 团队通过功能标志每周发布行为变更,而客户成功团队每月才进行一次培训时,这种差距会导致客户信任悄然崩塌。解决方法是建立协调契约,而不是增加更多会议。
CTO 已拨款但安全团队拒绝让你上线的 AI 功能
能够按时上线的 AI 功能会将安全威胁模型视为需求阶段的“形态约束”,而不是发布前的核对清单。这是一份面向工程领导者的安全左移指南。
那些你团队的人员已悄然停止阅读的标注队列
标注者吞吐量是每个 LLM 评估计划的无声天花板,而队列排序则是无人设计的采样器。本文探讨如何将“为评分而采样”视为一等公民的工程界面。