AI 事故严重程度分类法:幻觉何时算作 Sev-0?
传统的严重程度分类法在概率性 AI 系统中失效了。这是一个用于分类 AI 事故的多维框架——超越了二进制的“故障/正常”,旨在捕捉故障范围、可逆性以及复合型损害。
AI On-Call 心理学:为非确定性告警重建运维直觉
AI 系统的 On-Call 打破了标准的 SRE 直觉。本文提供了一套实用的分类法、轮值设计方案和培训课程,帮助你在不导致团队职业倦怠或错过真实回归的情况下,运行随机性生产系统。
不会说谎的 AI 产品指标:行为信号比点赞评分更可靠
聚合满意度评分和点赞率会掩盖 AI 自信出错的情形。以下是能真正告诉你模型改进是否有效的行为信号体系。
AI 可靠性下限:为什么 80% 准确率比没有 AI 还糟糕
存在一个可靠性下限,低于该下限的 AI 功能摧毁用户信任的速度,远比它积累价值的速度快。本文介绍如何在发布前找到这条红线。
别再手写提示词了:利用 DSPy 和 MIPRO 实现自动化优化
DSPy 及其 MIPRO 优化器通过声明式签名和贝叶斯搜索取代了手动提示词工程 —— 在复杂任务中生成的提示词效果比手写提示词提升 20–40%。本文将介绍该系统的工作原理以及何时值得投入这些开销。
认知外包陷阱:当你的团队离开 AI 就无法工作
将所有知识工作都交给 AI 代理的工程团队会逐渐失去底层技能。本文介绍如何识别不健康的 AI 依赖,并设计刻意练习以保护人类能力。
AI 流水线的复合故障模式:局部成功远远不够
如果你的 AI 流水线每个阶段的成功率都是 95%,那么三步链的整体成功率只有 86%。本文解析从业者常常低估的概率乘法、让情况雪上加霜的相关性效应,以及防止生产环境中乘法式崩溃的架构模式。
上下文压缩改变了你的模型真正看到的内容
Token 剪枝和提示词压缩可以将 LLM 推理成本降低 3 到 10 倍,但它们会在无形中改变模型看到的内容。本文将深入分析其失败模式——如指代链丢失、约束条件遗漏、工具输出幻觉——并探讨如何安全地验证和分配压缩预算。
为 Agentic 写入路径构建数据质量门禁:输入是垃圾,输出是不可逆的操作
拥有写入权限工具的 Agent 会将上游的数据质量问题直接转化为现实世界的副作用。本文将介绍防止此类问题的验证架构。
AI 应用中的依赖注入模式:编写经得起模型切换的代码
将业务逻辑直接与 OpenAI 或 Anthropic SDK 耦合,会使每次模型废弃都变成长达一个月的重构。本文将介绍如何将依赖注入应用于 AI 组件,从而让模型切换简化为配置更改。
AI 的依赖注入:在不损失测试保真度的情况下模拟模型调用
在测试中模拟 LLM 调用看起来是一个简洁的抽象,但幼稚的桩代码 (stub) 会悄然失效,变成关于生产环境行为的谎言。通过分层 Fixture 架构 —— 桩模拟、录制回放、实时调用 —— 加上刻意的接缝设计,可以在不为每一次 commit 消耗高昂成本的情况下恢复测试保真度。
记录概率性功能:模型行为与开发者引导之间缺失的一层
由 AI 驱动的功能没有稳定的输入输出契约可供记录。本文介绍了如何为每次表现都不同的功能编写 API 文档、变更日志和运维手册 —— 利用行为包络(behavioral envelopes)、版本控制纪律和可观测性作为动态文档。