跳转到主要内容

172 含有标签「evaluation」

Posts tagged "evaluation" on TianPan.co.

查看所有标签

·tian

Prompt 表面积问题:为什么增加一个工具绝不仅仅是增加一个工具

为 LLM Agent 增加的每一个新工具都会呈非线性地增加行为复杂度 —— 产生交互效应、评估盲点和安全漏洞,其增长速度远快于能力增益。本文将探讨如何在 Agent 的表面积超出你的控制范围之前对其进行审计。

llm-agents
agent-security
ai-engineering
evaluation
·tian

RAG 评估失效悖论:为什么更新知识库会破坏你的基准测试

更新 RAG 知识库不仅会改变系统检索的内容,还会悄无声息地使你用于衡量系统的评估集失效。大多数团队从未意识到其中的差异。

insider
rag
evaluation
llm
+2
·tian

你的评测套件是一座博物馆:生产故障应当成为明天的测试用例

静态评测框架会随着产品的增长而过时——它们只能测试作者预设的场景。以生产为驱动的反馈闭环能够自动将真实故障转化为永久性回归测试,使评测套件始终与实际用户行为保持一致。

insider
llm
evaluation
ai-engineering
+2
·tian

A/B 测试陷阱:为什么标准实验设计在 AI 功能中会失效

标准的 A/B 测试在 LLM 驱动的功能中往往会失效 —— 非确定性的输出、异方差性以及无法体现语义质量的参与度指标,这些因素共同导致了虚假的信心。本文将探讨你应该采取的替代方案。

insider
llm
experimentation
ai-engineering
+1
·tian

评估疲劳周期:为何AI质量度量在上线后走向崩溃

大多数团队在上线时拥有完善的AI评估套件,却在六周内将其废弃。评估体系的崩溃在结构上几乎是必然的——本文揭示原因,并给出解决之道。

ai-engineering
llm
evaluation
devops
·tian

评估集拥挤问题:为什么更大的测试套件捕获的回归反而更少

扩大 AI 评估套件往往会降低其捕获真实回归的能力。本文将探讨评估套件为何会偏向于工程上方便处理的边缘情况,并介绍如何通过强制排序方法论保持其预测性。

ai-engineering
evaluation
testing
llm-ops
·tian

泛化悬崖:微调如何导致隐性的能力退化

在狭窄任务上微调模型会悄然降低你的团队从未测试过的相邻任务的能力。本文将介绍如何检测、衡量和预防“泛化悬崖”。

fine-tuning
llm
evaluation
mlops
·tian

乐于助人但却出错:生产环境 AI Agent 中的操作性幻觉问题

事实性幻觉常上头条,但还有一种更隐蔽的失败模式:AI Agent 在方向上看起来合理,但在操作上却是错误的。错误的 API 参数、过时的方法签名、正确的概念配上了错误的实例 —— 而你的评估系统根本无法察觉。

insider
ai-agents
llm
hallucination
+2
·tian

提示工程的职业陷阱:哪些 AI 技能会复利增长,哪些会逐渐退化

大多数提示工程技能都有半衰期。随着模型的改进,少样本示例和思维链(CoT)模板的价值会逐渐侵蚀,而评估设计、行为规范和系统架构则会产生复利效应。本文将告诉你如何判断你的技能处于哪一边。

insider
ai-engineering
career
prompt-engineering
+2
·tian

共同演化陷阱:AI 功能的成功如何正在悄悄破坏其评估体系

当用户适应你的 AI 功能时,他们会改变该功能最初评估时所基于的分布。本文将探讨如何检测用户引发的分布偏移,并构建随时间推移仍能保持真实的评估体系。

ai
evaluation
mlops
distribution-shift
+1
·tian

持续生产环境评估:实时 LLM 流量的统计质量监控

部署前的评估只能捕获约 40% 的生产环境故障。通过使用无参考信号、SPC 控制图和 SLO 消耗率告警的持续监控技术栈,可以在用户发现之前捕获剩余的故障。

llm-monitoring
evaluation
production-ai
statistical-process-control
·tian

评估与生产环境的差距:检测生产级 LLM 中的行为模式切换

生产环境中的 LLM 在评估上下文中的表现通常与实际流量中的表现不同 —— 而大多数团队从未察觉到这一点。本文将介绍如何在差异侵蚀系统信任之前将其识别出来。

insider
llm
evaluation
production
+2
显示第 61–72 篇,共 172 篇