那个因为你的智能体表现得过于自信而流失的客户
过度自信的 AI 智能体不会在满意度调查中丢掉续约机会——它们是在六周后的续约电话中丢掉的。应将置信度的展示视为一种经过版本控制的产品界面,而非一种风格上的偶然。
被你扔掉的产品路线图,其实就是那份 Prompt 日志
你 AI 功能的 prompt 日志,是手里分辨率最高的产品发现信号——也是产品团队没人在读的那一份。这里是把它挖成未满足需求清单的方法。
对话中途耗尽的 Token 预算:为什么免费用户觉得你的模型变笨了
按用户分配的 Token 预算往往在对话中途咬人最狠——静默截断、丢弃工具调用、模型回退都会被用户读成质量退化,而升级转化的对话从未发生。
那位通过反复试验摸清你 Prompt 的高级用户
你的 AI 功能与用户之间有一份未公开的契约,它完全编码在系统 prompt 里。一小部分有耐心的用户会逆向破解它,其余的人则只能用到一个更糟糕的产品。与其藏着,不如把契约显式呈现出来。
当两个 AI 功能争夺同一次点击
两个 AI 功能可以各自通过 A/B 测试,却仍然让产品变差。跨功能的注意力竞争是任何团队级仪表盘都看不到的组合问题。
聚合指标隐藏的首次用户断崖
AI 功能的聚合指标往往看起来健康,但新用户却在一两次尝试后就流失。本文剖析首次用户断崖如何隐藏在你的指标中,以及消除它的几种模式。
免费层级流量才是你真实的评估集
针对付费用户队列的追踪记录来对 LLM 进行评分,实际上是在针对简单的分布进行评分。仍在犹豫是否升级的群体主要集中在免费层级 —— 而评估集往往忽略了这一点。
用户信任半衰期:为什么一次糟糕的体验会抹除数周的信任校准
AI 用户花费数周建立信任校准,却会在一次糟糕的体验中失去它。构建针对验证、撤销和“无行动参与”的遥测系统,在用户流失之前捕捉信任侵蚀。
安静放弃模式:AI 参与度指标为何在说谎
那些点击 AI 建议后立即重写的用户,在你的分析系统中看起来与真正活跃的用户完全相同。以下是如何测量实际情况的方法。
在 AI 功能感觉准备好之前就发布它
为什么最初的 500 名真实用户产生的可操作信号,比再花四周调优提示词更多——以及如何设计一个能获取这些信号而不损害信任的早期访问计划。
为什么每周会话记录审查优于你的 AI 仪表板
每周花一小时阅读生产环境的会话记录,可以发现提示词漂移、未分类的意图以及被仪表板平均值掩盖的敷衍措辞。本文将介绍如何主持会议、参会人员、采样方法,以及使其可持续发展的隐私规范。
70% 可靠性恐怖谷:AI 功能丧失用户信任的深渊
一个成功率为 70% 的 AI 功能可能比一个失败率为 70% 的功能更糟糕 —— 集中且不可预测的失败比持续的不稳健更快地摧毁用户信任。本文探讨了为什么综合准确率会误导人、为什么用户无法自我校准,以及如何针对“恐怖谷”地带进行设计。