跳转到主要内容

151 含有标签「evals」

Posts tagged "evals" on TianPan.co.

查看所有标签

·tian

针对幻影库存的 RAG:当你的语料库描述产品已删除的功能时

一个 RAG 系统检索到了关于你四个月前已删除功能的文档,并自信地引导客户点击一个根本不存在的按钮。评估指标依然显示绿色。本文将探讨为什么检索和归因指标会错过这类失败,以及为了解决这个问题,组织层面需要做出哪些改变。

rag
ai-engineering
evals
retrieval
·tian

评估员吞吐量是评估流水线中隐藏的瓶颈

在任何重视人工评分的 AI 系统中,评估员的吞吐量都限制了评估速度。本文介绍了一套运营规范——包括校准周期、感知队列的优先级排序以及评分标准反馈循环——旨在将标注产能视为一个 SRE 问题,而非招聘问题。

insider
evals
ai-engineering
operations
+1
·tian

二稿 Agent 模式:为什么“先探索再交付”优于“自我批判”

一种双阶段的 Agent 架构 —— 先进行发散性的初稿探索,再在受限上下文中进行精简执行 —— 在质量和成本上通常都优于 n-of-k 的自我批判循环。

insider
ai-agents
llm
agent-patterns
+2
·tian

影子评估:当私有切片取代了你的评估汇总

私有的评估 Notebook 看起来效率很高,但会让组织缺乏统一的评估汇总。解决方案是建立合并门控契约:共享框架、验证过的切片、明确的负责人,以及任何人都能重新运行的排行榜。

evals
ai-engineering
llmops
ci-cd
+1
·tian

没人构建的“从支持工单到评估案例”流水线

支持工单是大多数 AI 团队拥有的信号最强的评估数据集,但在评估套件在 Git 中逐渐失效时,它们却在 Zendesk 中腐烂。这里有一个能够闭环的四阶段流水线。

evals
ai-engineering
llm-ops
customer-support
·tian

随时间波动的质量偏移:为什么你的 AI 功能在东部时间上午 10 点表现不同

供应商负载不仅仅是一个带有质量副作用的延迟问题 —— 它是一种你的评估套件从未察觉的分布偏移,而你交付的功能其质量下限从未被团队真正衡量。

ai-engineering
evals
observability
llm-ops
+1
·tian

工具 Schema 演进陷阱:当一个可选参数改变了你 Planner 的先验分布

在现有工具描述中新增一个可选参数,发布过程顺利,没有破坏任何调用者,也没有导致评估失败 —— 但由于 Planner 的先验分布发生了偏移,它悄无声息地让工具调用频率增加了两位数。为什么工具 Schema 需要语义化版本(SemVer)、频率基准,以及与系统提示词(System Prompt)同样严格的评估规范。

ai-engineering
agents
tool-calling
evals
+1
·tian

你的 PRD 只是一个未经测试的 Prompt —— 直到你对其进行评测

AI 功能的 PRD 本质上是一个未经编译的系统提示词。在验收前进行评测,能让定义不明确的问题在上线前就暴露出来。

insider
ai-engineering
product-management
prompt-engineering
+1
·tian

标注偏移:评估集如何逐渐无法衡量你交付的产品

当评估分数上升而产品却在悄然衰退时,说明测量系统的校准已经失准。本文将探讨标注偏移如何隐蔽地发生,为什么评分标准和产品都在你脚下不断变化,以及保持评估数据真实性的四个关键动作。

evals
llm-ops
ai-engineering
observability
+1
·tian

非对称评估经济学:为什么一个测试用例的成本比它测试的功能还要高

单个评估用例所消耗的工程精力通常比其测试的功能还要多。本文探讨了为什么团队在评估上投入不足,以及为什么从资本支出(Capex)的角度来看待这个问题能解决这一困境。

insider
evals
ai-engineering
engineering-management
+1
·tian

Demo 到 Dogfood 的鸿沟:为什么你的 AI 功能死在了发布幻灯片与周一早晨之间

大多数企业级 AI 试点只留下了一个精彩的 demo 和一个沉寂的 Slack 频道。Dogfood 阶段是你所能运行的最廉价的生产级评估 —— 本文将介绍真实的准入标准是怎样的,以及为什么 demo 并不代表产品已准备就绪。

insider
ai-engineering
dogfooding
product-launch
+1
·tian

Eval 回填税:为什么每一次模型能力发布成本都超出了你的预算

新的模型能力会引入历史评估套件从未设计捕捉的失败模式 —— 而回填这些评估的工作是每一次能力发布中被低估的关键路径。

insider
evals
ai-engineering
capability-launches
+1
显示第 49–60 篇,共 151 篇