CI 流水线中的 AI 智能体:如何为无法单元测试的部署设置质量关口
传统的 CI/CD 基础设施并非为非确定性软件而设计。本文介绍如何为 LLM 驱动的功能添加有意义的部署质量关口,同时避免将流水线变成烧钱的评估农场。
AI 工程师职级体系:为什么你的 SWE 晋升框架在骗你
标准软件工程晋升框架系统性地误判 AI 工程师的表现。当模型承担大部分编码工作时,初级与高级工程师之间究竟区别在哪里?
AI 泛滥反模式:过度使用 LLM 只会让你的流水线更糟
在流水线的每个环节都加 LLM,是让系统变慢、变贵、难以调试的最快方式。这里是一个决策框架,帮你判断 AI 真正有用的场景,以及什么时候查找表才是正确答案。
1% 错误率,1000 万用户:规模化 AI 故障的数学逻辑
为什么在离线评估中看起来正常的准确率指标,在生产规模下会变成灾难;如何为考虑尾部行为的 AI 功能设置 SLO;以及当模型已经足够好,但每月仍有数百万次错误时,该如何做出产品决策。
AI 功能下线指南:如何在不破坏用户信任的情况下停止 LLM 功能
面向工程师和产品经理的实用指南,介绍如何干净地停用基于 LLM 的功能 —— 涵盖数据生命周期拆解、行为迁移测试、用户信任动态以及沟通策略。
AI 轮值:当你的系统在“思考”时,该针对什么发告警
如何为非确定性 AI 系统设计告警,AI 事件与传统故障的区别,以及在凌晨 2 点能真正帮到轮值工程师的 Runbook 结构。
AI 产品指标陷阱:当参与度看起来像价值却并非如此
团队如何在追踪会话数量和完成率的同时,错过了真正能预测价值的指标——以及为何 AI 功能上线后头 30 天的数据几乎总是具有误导性。
对齐税:衡量交付安全 AI 的真实成本
你在生产级 AI 系统中添加的每一层安全措施,都会在延迟、Token 和用户摩擦方面产生可衡量的成本。本文将介绍如何量化这些成本并做出有原则的权衡。
非确定性服务的 API 契约:随机输出下的版本管理
传统 API 契约在封装 LLM 的服务中会失效。本文介绍如何对概率性系统进行版本管理、测试并维护向后兼容性。
AI 驱动端点的 API 设计:为不可预测性建立版本控制
当你升级 API 背后的 AI 模型时,虽然 JSON 架构保持不变,但语气、拒绝行为和推理风格都可能发生变化。本文介绍了快照固定、结构化输出、行为包络和阴影部署等模式,这些模式能够确保 AI 端点对调用者保持稳定。
AI 驱动型 API 的行为 SLA:为非确定性输出编写协议
当你的 API 封装了 LLM 时,传统的 SLA 就会失效。学习如何定义行为协议 —— 包括格式保证、拒绝率、延迟 p95、幻觉预算 —— 以及如何在不破坏用户体验的情况下,对行为变更进行版本管理和沟通。
浏览器原生 LLM 推理:你不知道自己需要的 WebGPU 工程化实践
通过 WebGPU 在浏览器中直接运行 LLM 将改变你的整个应用架构。本文将探讨其实际的能力上限,以及在哪些场景下混合路由方案优于纯云端方案。