下午 3 点和凌晨 3 点的同一个 Prompt 并不是同一个 Prompt:LLM 评估中的昼夜漂移
LLM 调用的行为取决于挂钟时间 —— 批次大小、缓存状态和路由层级会随着供应商负载而变化。凌晨 2 点运行的评估是在生产环境永远不会遇到的条件下进行校准的。这里有五个实践,可以缩小非高峰期评估与高峰期现实之间的差距。
结构化输出重试循环:你被忽视的算力浪费
98.4% 的结构化输出成功率背后,可能隐藏着一个悄悄消耗了 12–18% 推理预算的 2% 重试循环。本文提供了一份实用指南,涵盖重试 Token 预算、分字段失败仪表盘以及确保账单透明的备用路径。
Token-Per-Watt:你的仪表盘无法计算的 AI 可持续性指标
幻灯片上显示的总 GWh 并不是 AI 可持续性指标。与产品遥测数据结合的任务瓦特 (Task-watts) 才是 —— 而你的首席财务官 (CFO) 即将要求的仪表盘目前还无法计算它。
你的工具结果缓存是一份你从未签署过的过期数据契约
链路追踪中看似正常的缓存工具结果,正在悄无声息地产生言之凿凿的错误答案。请将缓存视为一种单工具的新鲜度契约 —— 根据波动性设置 TTL、在结果中包含新鲜度元数据、建立绕过层,并增加过期缓存评估切片。
翻译并非本地化:多语言 AI 正面临的文化校准债务违约
仅仅发布翻译后的提示词和评估集并不等同于多语言产品的上线。失败的模式往往是文化层面的,而非语言层面的,且你的仪表盘无法识别这些风险。
12 个月的 AI 功能悬崖:为什么你的生产模型在无人标记的日历上悄然衰减
AI 功能发布时通过率为 92%,但在没有进行任何更改的情况下,12 个月后却下滑至 78%。五个复合时钟——模型弃用、权重轮换、输入漂移、提示词补丁债务、评判模型校准——产生了一个大多数团队只有在模型弃用截止日期前才会发现的悬崖。这是你必须在产品发布前就列入日历的维护节奏。
双语问题:为什么类型安全会在提示词边界失效
静态类型系统在提示词边界会失效。本文探讨了三种失败模式——插值、描述式 Schema、输出解析——以及当编译器无法识别接缝时,弥合这一差距的工程规范。
Agent 飞行记录仪:在第一次事故发生前必须捕获的字段
当 Agent 脱轨时,大多数团队拥有的取证记录都是徒劳的。这里列出了飞行记录仪在第一次事故发生前必须捕获的字段,以及与之配套的存储、采样和隐私规范。
无真值情况下的智能体 SLO:为无法实时评分的输出建立错误预算
传统的 SRE 实践为你提供了与用户满意度直接挂钩的可用性和延迟目标。但智能体(Agentic)特性打破了这种映射。本文将介绍当“成功”在请求发出数小时后才出现时,该如何编写错误预算——以及为什么照搬延迟 SLO 手册的团队虽然能完成每个季度的目标,却眼睁睁看着用户流失。
AI 网络保险:你的智能体会首先发现的保障缺口
大多数网络保险和 E&O 保单是为数据泄露和程序漏洞设计的,而非针对使用你的凭证运行的智能体。这种保障缺口通常在理赔时才会显现,而那时往往没人提前为此做好规划。
AI 工程师面试系统性失灵:停止考实现,开始考评测设计
Leetcode 筛选和系统设计环节是针对编写确定性代码的工程师进行校准的。AI 工程需要一种不同的信号 —— 能捕捉到这种信号的环节是评测设计,而非具体实现。
为什么弃用 AI 功能比你想象的更难:用户构建了你看不见的信任脚手架
停止 AI 功能的服务不像停用 API。契约是模型被观察到的行为,用户会在其上构建不可见的脚手架,而这些脚手架会在切换时断裂。