跳转到主要内容

17 含有标签「llm-evals」

Posts tagged "llm-evals" on TianPan.co.

查看所有标签

·tian

不存在的单一质量指标

你的 AI 功能质量是一个分布,而非一个标量。为什么平均评估分数会将细分领域的崩溃误报为提升,以及你应该在汇报 PPT 中展示什么——细分网格、底线指标、最差案例记录——以及保持噪声指标可信度的报告节奏。

insider
ai-engineering
llm-evals
observability
+1
·tian

这场本该成为评测 (Eval) 的会议

“模型是否足够好?”的争论之所以反复出现且无法达成一致,是因为团队在依靠轶事案例进行争辩。本文将介绍如何将这种主观的发布争议转化为一套全团队共同遵守的常设离线指标。

insider
llm-evals
ai-engineering
shipping
+2
·tian

团队上线了新提示词模板,评估框架却还在测昨天的旧版本

如果评估套件在给错误的提示词版本评分,即使发布版本已损坏,报告仍会显示通过。解决方案不在于更快的缓存失效,而在于使用基于内容的提示词哈希,从而从根本上杜绝评估与生产环境出现偏差的可能性。

llm-evals
prompt-engineering
observability
mlops
+1
·tian

权重并列语气与正确性的评估准则:如何悄无声息地筛选掉正确答案

将帮助性、清晰度、共情力和准确性进行等权重组合,会悄悄地奖励“模棱两可的错误”,而非“直截了当的正确”。本文将探讨为什么仪表盘显示一片大绿而产品质量却在倒退,以及如何设计评估准则模式,让优化梯度回到你预期的方向。

llm-evals
ai-engineering
judge-models
rubric-design
+1
·tian

那个在东部时间凌晨 3 点采样生产流量的评估集

一个基于凌晨 3 点定时任务构建的离线评估集,悄然变成了针对深夜批量重试和亚太地区流量的调查——而排行榜无法告诉你那是谁的模型。

insider
llm-evals
sampling-bias
production-ml
+1
·tian

教会你的智能体识别评估的合成评估

当你的合成评估生成器带有特征指纹时,你的模型会学到它 —— 结果就是评分上升而生产环境的质量却停滞不前。要把 “评估识别” 视为一个奖励作弊问题,而不是覆盖范围问题。

insider
llm-evals
reward-hacking
ai-engineering
·tian

增长速度快于评估套件的系统提示词

系统提示词随着规则逐条增加,而评估套件则随着事故逐个增加 —— 这种不对称性悄然让 “评估通过” 变成了一个谎言。本文将介绍如何让这两个层面协同演进。

insider
llm-evals
prompt-engineering
ai-engineering
+1
·tian

那些你的真实用户永远不会表现出的合成评估

由受测模型的“兄弟模型”生成的合成评估会在用户行为发生偏移时虚增评分。本文探讨了为什么生成器-判别器坍塌会掩盖质量退化,以及如何通过野外评估(wild-eval)架构来捕捉这些问题。

llm-evals
ai-engineering
observability
production-llms
+1
·tian

Shadow Replay 会惩罚那些本可以改变对话走向的模型

Shadow Replay 评估会悄悄地惩罚更好的模型,因为它根据旧模型引导下的用户对话记录来给新模型评分。本文将探讨其中的原因,以及影子回放仍然可以真实衡量哪些指标。

insider
llm-evals
offline-evaluation
shadow-testing
+2
·tian

演示成功是因为有人在看:会话长度是你的评测套件遗漏的那个维度

五轮的演示掩盖了在第二十八轮才会出现的误差累积、注意力漂移和承诺粘性。把会话长度当作一等评测维度来对待,否则你交付的可靠性数字,用户其实已经见过它的另一个版本。

insider
ai-engineering
llm-evals
agent-reliability
+1
·tian

删除评估用例是决策,而非清理

为了提升速度或降低成本而裁剪评估套件表面上是维护,但每删除一个用例都意味着放弃了一项团队不再能直观看到的保证。借鉴 API 弃用生命周期,有计划地退役评估用例。

insider
llm-evals
regression-testing
testing
+1
·tian

快照追踪测试:将生产环境追踪作为你的回归测试套件

人工筛选的 LLM 评估集在用户行为发生变化的瞬间就会失效。固定生产环境追踪,对输出进行语义等价断言,对工具调用进行结构化相等断言,并使用延迟区间而非点估计。

llm-evals
observability
agents
regression-testing
+1
显示第 1–12 篇,共 17 篇
1 / 2下一页