·tian
那个通过后门污染了你评估集的点赞按钮
隐式的点赞反馈会使你的评估集向点击人群倾斜,而偏离了付费人群。本文将详细分析这种泄漏是如何发生的,以及如何围绕它进行治理。
llm-evaluation
mlops
product-analytics
feedback-loops
·tian
重提率:你的评估流水线从未提取出的失败信号
在会话中重复同一个问题的用户是在告诉你之前的回答失败了——但回合级评估和会话结束时的 CSAT 都会忽略这一点。本文将介绍如何将重提率作为核心指标进行检测。
insider
llm-evaluation
conversational-ai
metrics
+1·tian
Agent 作为用户:当机器人成为你的主力用户时,产品分析为何失效
当 AI agent 成为你产品最重要的消费者时,会话漏斗开始说谎,参与度指标发生倒置,NPS 调研一无所获。本文讲解如何为 agent 消费者埋点,以及为什么你现有的分析仪表盘正在主动误导你。
ai-agents
product-analytics
observability
api-design
·tian
为什么 LLM 在分析你的产品数据时会犯自信的错误
LLM 在分析行为数据时,会自信地幻觉出指标、遗漏分母,并混淆相关性与因果关系。本文将探讨它们的失败之处以及如何安全地使用它们。
insider
ai-engineering
product-analytics
llm
+2