双语问题:为什么类型安全会在提示词边界失效
静态类型系统在提示词边界会失效。本文探讨了三种失败模式——插值、描述式 Schema、输出解析——以及当编译器无法识别接缝时,弥合这一差距的工程规范。
厂商基准测试是你的天花板,而非预测
厂商基准测试数据描述的是受控环境下的表现,而非你的技术栈。你的产品所获得的实际增益在结构上会更小——而唯一值得据此批准预算的预测,是你自己的影子评估。
方差正在吞噬实验:为什么传统的 A/B 测试功效计算不适用于 LLM 功能
经典的 A/B 测试数学模型假设每个用户的行为是确定的。LLM 功能两次打破了这一假设,导致标准的样本量模板在两个方向上都给出了错误的判断 —— 本文介绍了修复这一问题的四个转变。
无真值情况下的智能体 SLO:为无法实时评分的输出建立错误预算
传统的 SRE 实践为你提供了与用户满意度直接挂钩的可用性和延迟目标。但智能体(Agentic)特性打破了这种映射。本文将介绍当“成功”在请求发出数小时后才出现时,该如何编写错误预算——以及为什么照搬延迟 SLO 手册的团队虽然能完成每个季度的目标,却眼睁睁看着用户流失。
30 秒都去哪了:APM 无法察觉的 Agent 步骤内部延迟归因
传统的 APM 将 Agent 的一个步骤视为单一的粗粒度 Span,导致值班工程师只能靠猜。通过将其分解为七个阶段,区分首字延迟 (Prefill) 与解码 (Decode),并追踪关键路径而非总 Span 时间。
AI 面试毫无区分度:为什么你的流程无法识别能交付 LLM 产品的人才
标准的工程面试流程往往只筛选确定性系统的技能,却忽略了预测谁能交付 LLM 产品的核心能力——包括评测设计、成本直觉、提示词调试和容错思维。解决方案是重构面试流程,而不是生硬地增加一个 AI 面试环节。
护栏系统的自研与外购:内容审查 API 已成为安全关键路径上的核心依赖
托管的内容审查 API 将你的安全控制转变为一个同步的外部依赖 —— 本文将探讨自研与外购的决策、故障开启 (fail-open) 与故障关闭 (fail-closed) 之间的权衡,以及如何通过集成规范确保处于安全关键路径上的供应商不会绑架你的事件响应流程。
校准弃答:你的 LLM 技术栈每一层都在惩罚的能力
LLM 技术栈中的每一项默认设置——预训练、RLHF、裁判 LLM、用户反馈——都在促使模型给出自信的错误答案。只有当你构建了愿意为此付费的评估体系、评分标准和 UI 时,校准弃答才能真正落地。
聊天历史是数据库。别再把它当成滚动回溯了。
将对话历史视为滚动回溯(Scrollback),是智能体在第 8 轮对话后就开始跑题,以及上下文费用呈超线性增长的原因。解决办法是回归其本质——一个读密集型数据库——并据此进行设计。
确定性预算:将随机性视为按层面的分配,而非全局开关
温度不是一个全局开关。应按层面分配随机性——路由、解析、合成、生成、探索——否则你将为不需要的方差付出代价。
评估框架(Eval Harness)而非提示词,才是你真正的供应商锁定
重写提示词是切换 LLM 供应商时最简单的部分。评估框架才是真正的供应商锁定所在 —— 当你尝试重新协商时,真正的账单就会随之而来。
评估集作为模拟器的偏移:当离线指标提升而生产表现恶化时
一个 LLM 评估套件就是一个模拟器。如果跳过重新校准周期,你可能会针对一个在第三个月就不再像生产环境的数据集发布六个“全绿”版本。