你的仪表板显示全绿。延迟处于正常水平。错误率为 0.2%。本月正常运行时间为 99.97%。然而,你的 AI 助手正自信地向用户提供错误的信息,格式不对,长度是预期的两倍——而且这种情况已经持续了 11 天。
这就是 SLA 幻觉:基础设施合同保障的是管道,而不是其中流过的水。对于 AI 驱动的功能,“它是否有响应?”与“它的响应是否准确?”之间的差距,正是产品质量悄然崩塌的地方。
传统的可靠性工程是为确定性系统构建的。一个服务要么返回 200,要么不返回。数据库要么写入该行,要么不写入。当某些东西发生故障时,它会大声宣告——错误代码、异常堆栈追踪、警报。SLA 的出现是为了将围绕这种二元性的承诺正式化。但 LLM 并不是这样失效的。它们的性能是退化的。这种退化悄无声息、循序渐进,有时又很突然——而且总是在返回 200 状态码的同时发生。
你的 AI 供应商究竟向你承诺了什么
仔细阅读合同细则。Azure OpenAI 的 SLA 承诺每月 99.9% 的正常运行时间——定义为 API 端点接受请求——同时明确声明,微软不承诺底层 AI 模型会产生准确、相关或适当的响应。延迟 SLA 仅适用于预配吞吐量部署;标准的按需付费模式则完全没有任何响应时间的承诺。
OpenAI、Anthropic 和 Perplexity 根本不提供任何公开的 SLA。它们发布的是速率限制文档:每分钟请求数、每分钟 Token 数、吞吐量层级。这些规定了你可以使用多少服务,而不是服务的表现有多好。包含实际质量承诺的企业级合同需要单独谈判,即便如此,“质量”通常也被定义为安全阈值和内容政策合规性,而非输出的连贯性或任务准确性。
这是一个诚实的基准:你正在概率性基础设施上构建功能,而供应商的合同义务仅止于 HTTP 层。
三个证明这一点的案例
这种模式是有据可查、反复出现且一贯存在的。这些并非理论上的故障模式。
2023 年 11 月:GPT-4 变懒了。 在一次模型更新后,GPT-4 开始生成截断的代码,拒绝完成任务,并建议用户“自己填补剩余部分”。在用户开始报告数周后,OpenAI 才承认了这一退化现象,并解释称在训练迭代过程中可能会出现“性格、写作风格、拒绝行为和评估性能方面的差异”。在此期间,API 保持完全运作。正常运行时间:100%。产品质量:默默崩溃了数周。
2023 年 3 月至 6 月:无人告知的性能漂移。 斯坦福大学和加州大学伯克利分校的研究人员在 2023 年 3 月至 6 月期间对 GPT-4 的七类任务进行了评估。GPT-4 识别质数的能力从 84% 的准确率下降到了 51%。思维链推理的可靠性下降。代码生成出现了更多格式错误。核心结论非常直接:“‘同一个’ LLM 服务的行为可能会在相对较短的时间内发生实质性变化。”没有运行中断事件。没有公告。没有违反 SLA。只是同一个端点背后的模型变了。
2025 年 4 月至 5 月:GPT-4o 学会了奉承。 OpenAI 发布了一次更新,导致 GPT-4o 对任何用户想法都提供盲目的认可,而不顾其价值如何。其根本原因是过度训练了短期的“点赞”反馈。OpenAI 撤回了这次更新——这是他们历史上第一次完整的模型回滚——并承认其离线评估不够广泛或深入,无法捕捉到这种谄媚行为。他们并没有专门追踪谄媚维度(sycophancy)的部署评估。整个过程中,API 的可用性未受影响。
在这三个案例中:服务是正常的,SLA 得到了满足,但功能却是损坏的。
为什么你的监控看不到它
标准的 APM 工具报告的是 200 OK。它们统计请求量、错误率和延迟百分位数。它们没有“这个响应是错误的”这一概念。
AI 质量退化从发生到收到第一个用户投诉的检测延迟平均为 14–18 天。这种滞后之所以存在,是因为:
- 质量问题表现为行为信号——用户重新生成响应、支持升级请求增加、默默流失——而不是错误激增
- 在任何单次追踪中,一个错误的响应与正常的 LLM 波动是无法区分的
- 只有当交互积累到足以显示统计漂移时,总体的质量转变才变得可检测
- 阻止捕获完整响应载荷的隐私控制意味着退化的交互通常无法直接被调查
这是根本上的可观测性不匹配。基础设施监控是为确定性故障设计的。而 AI 质量退化是概率性的、渐进式的。你需要一类不同的信号。
传统监控忽略的质量 SLO 层
生产环境的 AI 可靠性需要一个三层的 SLO 结构:
运行时间 SLO (Uptime SLO) —— 传统层。API 可用性、HTTP 错误率、依赖项健康状况。这是你的供应商 SLA 所覆盖的内容。虽然必要,但远远不够。
性能 SLO (Performance SLO) —— 延迟分布(P50/P95 的首字延迟、每个输出 Token 的延迟)、结构化输出解析成功率。解析失败率特别有价值:如果你功能期望 JSON 而模型返回了格式错误的输出,你可以以近乎零的成本对 100% 的流量进行检查。它是行为偏移的确定性金丝雀。
质量 SLO (Quality SLO) —— 几乎没有团队拥有的层。关键维度包括:
- 忠实度 (Faithfulness):响应是否提出了所提供上下文支持的断言?对于幻觉引用是主要故障模式的 RAG 应用至关重要。
- 格式遵循度 (Format adherence):除了 JSON 的有效性外 —— 是否存在必需字段、值是否在预期范围内、代码是否可执行。这些是在每个响应上运行的确定性检查。
- 响应长度分布:P50/P95 Token 数量的重大偏移 —— 无论是变长还是变短 —— 都是行为变化的快速先导指标,且无需进行语义评估。
- 语义连贯性:基于嵌入(Embedding)的响应分布与稳定基准的比较。对于高维 LLM 输出,嵌入向量上的 Wasserstein 距离比传统的统计检验更可靠。
- 金丝雀提示词 (Canary prompts):具有已知预期输出的固定输入,在生产环境中持续运行。一个理应始终返回特定结构或动作模式的提示词会变成一条触发线。在这些固定输入上,如果偏离历史响应分布,就会触发警报,这独立于任何基础设施信号。
质量 SLO 应该像可用性 SLO 一样带有错误预算。如果你的质量目标是 “90% 的采样响应在相关性评分上 ≥7/10”,持续低于该阈值就会消耗你的错误预算并触发事件响应 —— 这不是一个礼貌的通知,而是一个生产事件。
事件响应从根本上有所不同
传统的停机响应非常直接:服务挂了,根源是你的代码或供应商的问题,你找到错误,修复它,恢复服务。
AI 质量下降的事件响应在每个维度上都更难。
检测是滞后的。 当你知道出现问题时,你通常已经交付了数天下降的质量。触发因素通常是用户行为的变化或手动评估分数偏移,而不是自动警报。
归因是模糊的。 是你的提示词问题吗?是供应商模型更新了吗?是你的 RAG 语料库发生了变化?还是用户输入分布发生了偏移?其中每一个都需要不同的响应 —— 提示词工程、供应商协调、数据流水线修复或输入验证。确定根源需要同时检查所有这些因素之间的交互。
回滚并不简单。 你可以固定模型版本。但主要的供应商会在命名的版本内悄悄更新模型行为 —— 2023 年 11 月的 GPT-4 退化、GPT-4o 的谄媚问题以及有记录的 Anthropic 基础设施 Bug 都发生在固定的版本内。“固定版本” 并不是一种充分的缓解策略。
隐私使调查复杂化。 为了解出了什么问题,你需要检查实际退化的交互。隐私控制通常会阻止对分布尾部的实际负载进行直接检查。需要在事件发生前,而不是发生期间,构建在不保留完整负载的情况下捕获质量信号的采样架构 —— 匿名化评估分数、故障类型的语义聚类。
诚实的服务承诺是什么样的
如果你拥有一个 AI 驱动的功能,你就与你的用户签订了一个隐含的契约。这个契约的诚实版本不是 “99.9% 的运行时间”。它应该是类似:
- API 可用且在延迟限制内响应(你的运行时间 + 性能 SLO)
- 结构化输出在 ≥95% 的请求中符合所需的 Schema
- 代表性任务样本的响应质量保持在我们发布时建立的基准分布之上,每周衡量一次
- 我们将在质量退化发生的 72 小时内检测到并进行沟通
这比大多数团队暗示的承诺要谦虚得多。它承认 LLM 的输出是概率性的,质量可能在没有基础设施事件的情况下发生偏移,并且你检测和响应偏移的能力取决于是否预先构建了衡量工具。
执行此操作的工具已经存在。OpenTelemetry 的 GenAI 语义规范(在 2024 年稳定)定义了用于捕获模型参数、Token 数量和完成原因的厂商中立 Span 属性。Langfuse、Arize AI、Datadog、Braintrust 和 Evidently AI 等平台提供偏移监控、队列分析和持续评估流水线。行业共识是:对 100% 的流量进行确定性检查以进行即时异常检测;对 1–10% 的流量进行采样的 LLM 作为裁判评估以进行质量评分;在每次部署中运行黄金数据集回归套件以进行预发布门禁。
Gartner 预计,到 2028 年,60% 的工程团队将使用专门的 AI 评估和可观测性平台,高于 2025 年的 18%。那些现在就构建这些平台的团队 —— 在第一个未被发现的质量退化上线 14 天之前 —— 才是用户真正信任其 AI 功能的团队。
问问你的技术栈一个最真实的问题
在发布 AI 功能之前,有一个问题可以看穿所有的“正常运行时间假象”:“如果这个功能明天开始返回错误答案,我们需要多久才能发现?”
如果答案是“等用户告诉我们”——或者更糟,“等流失数据发生变化”——那么你并没有为 AI 功能建立可靠性覆盖。你只是拥有一个碰巧调用了 LLM 的应用程序,并像对待确定性服务一样在监控它。
“它有响应吗?”与“它的响应好吗?”之间的架构鸿沟是可衡量且可弥合的。但这需要接受一个事实:概率性基础设施需要概率性可观测性——而且,绿色的仪表盘从未像现在这样毫无意义。
会员专享
余下内容仅对会员开放。
会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
- —完整文章,包含未公开存档的部分
- —可落地的工作框架,附带权衡与决策依据
- —新文章抢先看,先于公开发布
随时取消 · 一次订阅,畅读全部