跳转到主要内容

17 含有标签「llm-evals」

Posts tagged "llm-evals" on TianPan.co.

查看所有标签

·tian

下线一个 Planner 已产生依赖的 Agent 工具

从你的 Agent 工具目录中移除一个函数不仅仅是语法上的更改,更是一次行为迁移。这种阶段式下线模式可以防止回退幻觉和隐性回归。

insider
agents
tool-use
deprecation
+2
·tian

评估集腐化:为什么评估分数在上升,而用户满意度在下降

评估分数在攀升,但用户投诉也在同步增长。一个基于发布周流量构建的评估集,在六个月后可能已经悄然失去了衡量产品的能力 —— 本文将介绍如何通过影子集、重采样和切片规则来保持仪表板的真实性。

insider
llm-evals
ai-engineering
observability
+1
·tian

下午 3 点和凌晨 3 点的同一个 Prompt 并不是同一个 Prompt:LLM 评估中的昼夜漂移

LLM 调用的行为取决于挂钟时间 —— 批次大小、缓存状态和路由层级会随着供应商负载而变化。凌晨 2 点运行的评估是在生产环境永远不会遇到的条件下进行校准的。这里有五个实践,可以缩小非高峰期评估与高峰期现实之间的差距。

insider
ai-engineering
llm-evals
llm-ops
+2
·tian

用户侧概念漂移:当你的提示词依然奏效,但用户已经变了

固化的黄金数据集依然显示为绿色,但生产环境的满意度却在悄然崩塌 —— 因为改变的是用户,而非模型。本文探讨检测模式以及评估集的“保质期”管理规范。

llm-evals
drift-detection
observability
prompt-engineering
+1
·tian

演示循环偏见:你的开发流程如何悄然演变为针对“有魅力的失败”进行优化

演示往往会选择流畅、自信的输出,而非正确的输出。本文将探讨 LLM 开发循环如何悄然滑向“有魅力的失败”,以及修复这一问题的评估工作流。

insider
llm-evals
ai-engineering
product
+2
显示第 13–17 篇,共 17 篇
上一页2 / 2