·tian
组织级古德哈特定律:当团队开始操控 AI 采用率指标
当 AI 采用率指标成为绩效目标,团队便开始优化指标而非结果。本文探讨这种现象如何发生、为何难以察觉,以及哪些衡量方式真正能经受住组织激励机制的考验。
ai
engineering
metrics
organizational-behavior
·tian
采纳率是一个虚荣指标:你的 Copilot ROI 隐藏在敲击键盘后的 90 秒里
Copilot 采纳率衡量的是闭环中无摩擦的那一半。ROI 存在于随后的验证税中 —— 以下是真正揭示真相的指标。
ai-engineering
developer-productivity
metrics
copilot
·tian
为什么幻觉率不是衡量生产级 LLM 系统的核心指标
幻觉率虽易于衡量,但与用户结果的关联性较弱。本文提供了一个选择行为指标的框架,能真实反映你的 AI 功能是否奏效。
evaluation
observability
production-ai
metrics
·tian
不会说谎的 AI 产品指标:行为信号比点赞评分更可靠
聚合满意度评分和点赞率会掩盖 AI 自信出错的情形。以下是能真正告诉你模型改进是否有效的行为信号体系。
ai-engineering
product
metrics
observability
·tian
衡量真实的 AI 编程生产力:能在 90 天滞后期中幸存的指标
速度代理指标在第 30 天时看起来非常诱人,但在第 90 天时却与代码质量背道而驰。本文探讨了那些能够揭示 AI 编程工具究竟是在复利生产力,还是仅仅将债务转移到下游的滞后指标与领先信号。
insider
ai-engineering
developer-productivity
metrics
+1显示第 13–17 篇,共 17 篇
上一页2 / 2