无需标注的评估:在拥有标准答案前衡量 LLM 质量
一份在第一周 —— 即在你拥有标注数据之前 —— 衡量 LLM 输出质量的实用指南。涵盖了自我一致性、约束满足、行为不变性以及 LLM 作为裁判(LLM-as-judge),并探讨了每种方法的失效模式。
AI 应用的开发与生产环境一致性:预发布环境欺骗你的七种方式
预发布环境系统性地歪曲了 LLM 应用在生产环境中的表现。本文介绍了从 Prompt 缓存预热到隐蔽的流量分配漂移等七种特定的失效模式,以及发现这些问题的预发布检查方法。
长尾覆盖问题:为什么你的AI系统在最关键的地方失败
准确率和F1等聚合指标看起来很好,但你的AI系统可能在最重要的少数输入上悄然失败。如何在用户发现之前检测、衡量并修复长尾覆盖盲区。
AI 系统的影子流量:在上线前验证模型变更的最安全方式
如何使用生产流量回放在变更影响用户之前验证 LLM 模型和提示词变更——以 A/B 测试一小部分成本获得信心所需的基础设施、指标与采样策略。
LLM 本地开发循环:在不耗尽 API 预算的情况下实现快速迭代
如何使用录制回放模式、确定性 Fixtures 和分层测试策略,为 LLM 应用构建快速的内部循环 —— 且无需在每次代码变更时耗费大量 API 预算。
模型弃用就绪:在 90 天倒计时之前审计你的行为依赖
当一个模型被弃用时,最难的部分不是更新 API 调用,而是发现系统所假设的所有隐形行为契约。以下是在时间耗尽前审计这些契约的方法。
真正能阻断 PR 合并的提示词回归测试
大多数团队声称在测试他们的提示词。但几乎没有团队建立了能让构建失败的 CI 门控。这里有一个轻量级框架,可以在不烧掉 API 预算的情况下改变这一局面。
CI 流水线中的 AI 智能体:如何为无法单元测试的部署设置质量关口
传统的 CI/CD 基础设施并非为非确定性软件而设计。本文介绍如何为 LLM 驱动的功能添加有意义的部署质量关口,同时避免将流水线变成烧钱的评估农场。
非确定性服务的 API 契约:随机输出下的版本管理
传统 API 契约在封装 LLM 的服务中会失效。本文介绍如何对概率性系统进行版本管理、测试并维护向后兼容性。
演示到生产的失败模式:为什么AI原型在真实用户到来时会崩溃
演示使用精心挑选的输入、预热缓存和有耐心的评估者。生产环境面对的是对抗性查询、分布偏移的请求以及8秒内就会放弃的用户。以下是缩小差距的预发布方法论。
LLM 输出的基于属性的测试:发现你的评估集从未想过的 Bug
精心策划的评估集仅编码了你预想到的失败模式。基于属性的测试通过生成数千个对抗性输入变体,来发现测试套件在结构上无法触及的领域边界处的 Bug。
语义化版本控制对 AI 智能体意味着什么
当你的服务具有非确定性时,传统的语义化版本控制就会失效。本文介绍如何对 AI 智能体进行版本管理,以避免下游消费者遭受静默破坏。