·tian
测试无法察觉却破坏了一切的模型升级
你迁移到了更新的模型,所有评估都通过了,延迟也降低了,但支持工单却不断增加。本文将探讨这类能够绕过所有断言的回归问题,以及如何在用户发现之前捕捉到它们。
insider
llm
evaluation
production
+2·tian
JSON Schema 校验通过了,但下游消费者因语义漂移拒绝了你的输出
JSON Schema 验证的是数据的形状而非含义。当 LLM 升级导致在符合 Schema 的情况下数值分布发生偏移时,下游消费者会遭遇崩溃,而生产者的监控面板却依然显示正常。
insider
llm
structured-outputs
contract-testing
+2·tian
AI 代码审查漂移:当你的 LLM 审查标准比代码演进得还快
LLM 代码审查器并非一个稳定的工具 —— 它是由多个独立漂移的组件组成的堆栈。本文将探讨为什么你的 PR 机器人捕获率会悄无声息地下降,以及哪些校准纪律能防止安全网变薄。
insider
ai-code-review
llmops
drift
+2·tian
参数幻觉是漂移信号,而非模型 Bug
当模型虚构参数值时,成本最低的假设并不是“模型失败了”,而是“你提供给模型的描述与连接另一端的 API 不再匹配”。
llm-tools
agents
function-calling
observability
+1·tian
评估集也有季节性:为什么质量在报税季的第一个周一会下降
生产流量并非一成不变。在 3 月采样并在 10 月运行的评估集,面对的是从未在黄金数据行中出现过的 “10 月特征” 客户。以下是如何保持质量把关真实性的方法。
evals
llm
mlops
observability
+1