跳转到主要内容

151 含有标签「evals」

Posts tagged "evals" on TianPan.co.

查看所有标签

·tian

评估总线因子:当定义“正确标准”的人离职时

在知道测试内容的人离职后很久,评估套件可能依然显示为绿色。这种损害是无声的,恢复成本极高,而且解决方案是组织层面的,而非技术层面的。

evals
ai-engineering
team-process
llm-as-judge
·tian

评测分诊队列:为什么 FIFO 会错过那些至关重要的失败

评测失败的 FIFO 队列浪费了流程中最昂贵的资源 —— 评审员的时间。根据流量、严重程度和新鲜度对失败进行评分,按集群进行批处理,并保留对抗性配额。

evals
llmops
ai-engineering
observability
·tian

当你的禁止列表变成秘籍:提示词中负面示例的隐性成本

成熟的生产环境提示词往往会积累一长串“不要做”的列表,但这在无形中适得其反——既暴露了攻击面,又增加了原本想要禁止的内容的产出率。

prompt-engineering
llm-security
evals
ai-architecture
·tian

自我批判税:让模型检查自己的工作如何导致成本翻倍却收益甚微

Self-Refine、验证链(Chain-of-Verification)和反思提示词在基准测试中承诺了巨大的质量提升 —— 但在生产环境中,它们会使成本增加三倍,导致延迟激增,而实际收益却远低于宣传水平。本文将教你如何在上线前评估这项 “自我批判税”。

insider
llm
cost-optimization
reliability
+1
·tian

快照评估衰减:当绿色的 CI 不再意味着你的产品仍然可用

一个运行了六个月的绿色评估套件可能正在用昨天的现实测试昨天的产品 —— 本文将探讨快照评估衰减是如何在众目睽睽之下隐藏的,以及如何保持评估集的生命力。

insider
evals
ai-engineering
observability
+2
·tian

用户信任半衰期:为什么一次糟糕的体验会抹除数周的信任校准

AI 用户花费数周建立信任校准,却会在一次糟糕的体验中失去它。构建针对验证、撤销和“无行动参与”的遥测系统,在用户流失之前捕捉信任侵蚀。

insider
ai-product
trust
ux
+2
·tian

AI 工程师晋升自评报告:让随机性工作在绩效评审中清晰可见

AI 工程工作不适用于确定性的自评模板。本文介绍如何量化那些基于评估驱动、具有随机性且逐步发布的 AI 工作,从而让校准委员会能够真正认可你的贡献。

ai-engineering
career
evals
performance-review
+1
·tian

评估选择偏差:为什么你的测试集会对那些导致用户流失的失败视而不见

从生产链路中更新的评估集继承了幸存者偏差:遭遇最严重失败的用户已经离开,并停止生成链路。分数在攀升,而留存率在下降。以下是如何打破这一循环的方法。

insider
evals
llm
agents
+2
·tian

多维 Agent 二分查找:当回归出现在交互中时

当 Agent 的回归源于新模型与新工具描述之间的交互时,单轴回滚会产生明显的假阴性。解决方案是对模型、Prompt、工具目录、检索索引和采样配置的笛卡尔积进行二分查找——并以命名的版本信封作为回滚的最小单元。

agents
debugging
evals
observability
+1
·tian

规范翻译税:当规范、提示词和评估发生漂移时

规范、提示词和评估是同一意图在不同媒介下的三种翻译。如果没有强制的一致性,它们就会产生漂移。一年后,没有人能分清某个回归到底是提示词的 Bug、规范的缺失,还是从第一天起就错误的评估。

insider
ai-engineering
llm-ops
spec-driven-development
+2
·tian

好奇的顾客:如何为把 AI 智能体当作解谜游戏的用户进行设计

在合作用户和恶意攻击者之间存在着第三类人群:把你的 AI 智能体当作解谜游戏的好奇顾客。本文将介绍如何构建评估、拒绝机制和回退方案,使你的品牌在这些关键时刻经受住考验。

insider
ai-agents
product-design
evals
+1
·tian

入职缺口:为什么新工程师需要三个月才能上手 AI 技术栈

AI 代码库承载着一种隐藏的领域知识税,使得原本三周的入职期延长到了三个月。解决方法是决策历史,而非架构图。

insider
ai-engineering
team-design
onboarding
+2
显示第 61–72 篇,共 151 篇