跳转到主要内容

5 含有标签「drift」

Posts tagged "drift" on TianPan.co.

查看所有标签

·tian

测试无法察觉却破坏了一切的模型升级

你迁移到了更新的模型,所有评估都通过了,延迟也降低了,但支持工单却不断增加。本文将探讨这类能够绕过所有断言的回归问题,以及如何在用户发现之前捕捉到它们。

insider
llm
evaluation
production
+2
·tian

JSON Schema 校验通过了,但下游消费者因语义漂移拒绝了你的输出

JSON Schema 验证的是数据的形状而非含义。当 LLM 升级导致在符合 Schema 的情况下数值分布发生偏移时,下游消费者会遭遇崩溃,而生产者的监控面板却依然显示正常。

insider
llm
structured-outputs
contract-testing
+2
·tian

AI 代码审查漂移:当你的 LLM 审查标准比代码演进得还快

LLM 代码审查器并非一个稳定的工具 —— 它是由多个独立漂移的组件组成的堆栈。本文将探讨为什么你的 PR 机器人捕获率会悄无声息地下降,以及哪些校准纪律能防止安全网变薄。

insider
ai-code-review
llmops
drift
+2
·tian

参数幻觉是漂移信号,而非模型 Bug

当模型虚构参数值时,成本最低的假设并不是“模型失败了”,而是“你提供给模型的描述与连接另一端的 API 不再匹配”。

llm-tools
agents
function-calling
observability
+1
·tian

评估集也有季节性:为什么质量在报税季的第一个周一会下降

生产流量并非一成不变。在 3 月采样并在 10 月运行的评估集,面对的是从未在黄金数据行中出现过的 “10 月特征” 客户。以下是如何保持质量把关真实性的方法。

evals
llm
mlops
observability
+1