跳转到主要内容

17 含有标签「metrics」

Posts tagged "metrics" on TianPan.co.

查看所有标签

·tian

以 Token 数量而非结果驱动的 A/B 测试

当实验平台让统计 Token 数量变得容易而衡量用户结果变得困难时,提示词 A/B 测试往往会发布一些团队无法将其与性能倒退区分开来的局部最优解。

insider
ai-engineering
experimentation
llm-ops
+1
·tian

那个批准了“单次调用成本”却从未衡量“单次解决任务成本”的智能体预算

一个使单次调用成本下降了 25% 但单次解决任务成本却上升了 40% 的智能体,是智能体部署中最常见的单位经济失效案例。本文将探讨为什么供应商的 SKU 并不是工作单元,以及如何建立正确的衡量指标。

insider
ai-agents
finops
unit-economics
+2
·tian

当“转接人工”变成排队:AI 客服栈中隐藏的激励机制 Bug

拦截率仪表盘在撒谎。你上线的奖励函数悄悄地让“转接人工”变成了 AI 代理成本最低的操作——而你的支持团队则沦为了它的溢出队列。

ai-agents
customer-support
metrics
incentive-design
+1
·tian

把沉默当作同意的 ChatOps 机器人

ChatOps 机器人不再收到回复时,仪表盘看起来是稳态——但静音、复问和旁路动作才说出了真相。围绕沉默来仪表化智能体的实战手册。

chatops
ai-agents
slack
observability
+1
·tian

撒谎的"转移率":当 AI 客服的"成功"掩盖了用户流失

转移率统计的是"沉默",而不是"得到帮助"。同一个数字可能意味着客户问题被解决了,也可能意味着客户已经流失—— 仪表盘没法分辨,直到队列报告出来。

insider
ai-support
metrics
churn
+2
·tian

当评估指标全看“感觉”时,你的 A/B 测试无法区分两个模型

点击率无法区分用户是真心喜爱一个模型还是仅仅在忍受它。在你信任实验结果并据此选择模型之前,请先证明你的指标能够检测出你故意搞坏的模型。

insider
evaluation
ab-testing
llm
+2
·tian

重提率:你的评估流水线从未提取出的失败信号

在会话中重复同一个问题的用户是在告诉你之前的回答失败了——但回合级评估和会话结束时的 CSAT 都会忽略这一点。本文将介绍如何将重提率作为核心指标进行检测。

insider
llm-evaluation
conversational-ai
metrics
+1
·tian

任务完成率指标变绿,而用户却在默默受苦

94% 的任务完成率仪表板可能一直显示绿色,但与此同时 Agent 正在消耗大量 Token、反复回溯并让用户感到疲惫。为什么完成率是一个错误的指标,以及四个能洞察其盲点的轨迹指标。

ai-agents
observability
evaluation
metrics
·tian

难度浓缩器:AI 客服分流正在让留下的员工精疲力竭

分流率衡量的是避开的难度,而非消除的难度。当 AI 处理了 80% 的简单工单时,人工队列中剩下的就全是 100% 的极端情况 —— 在数据仪表盘察觉之前,团队早已感受到了这种压力。

insider
ai-engineering
customer-support
operations
+2
·tian

AI 功能 PMF 信号:为什么你的指标在欺骗你

NPS、点赞评分和激活率等传统信号对 AI 功能而言系统性地具有误导性。以下是真正的产品市场契合度的实际表现——以及如何衡量它。

ai
product
metrics
retention
+1
·tian

反馈信号时序问题:为何你的 AI 指标正在欺骗你

点赞/踩和 CSAT 评分往往与 AI 产品的长期价值背道而驰。本文介绍如何构建真正能捕捉核心价值的度量体系。

insider
ai
product
metrics
+2
·tian

安静放弃模式:AI 参与度指标为何在说谎

那些点击 AI 建议后立即重写的用户,在你的分析系统中看起来与真正活跃的用户完全相同。以下是如何测量实际情况的方法。

ai-product
metrics
analytics
llm
+1
显示第 1–12 篇,共 17 篇
1 / 2下一页