·tian
评分了每一轮对话却错过了整个交流:聊聊多轮评估的陷阱
95% 的单轮准确率并不意味着 95% 的会话都能成功。本文将探讨为什么平均单轮得分会掩盖复合失败,以及如何转而对整个对话进行评估。
insider
llm-evaluation
ai-agents
multi-turn
+2·tian
长对话中的意图漂移:为什么你的智能体目标表征会失效
在长会话中,用户意图会发生偏移,而累积的上下文往往将其平铺为单一的静态目标。本文将探讨智能体如何被早期信号锁定、误将纠正视为澄清,以及应对这些问题的策略。
insider
ai-agents
context-engineering
production-ai
+1·tian
用于多轮 Agent 评估的合成用户:当你的测试固件需要“反击”时
单轮评估往往会忽略那些关键的多轮失败模式。具备人格、耐心预算和放弃阈值的 LLM 驱动用户模拟器每晚可以运行数千次对话 —— 但前提是模拟器与生产环境之间的差距是经过校准的,而非臆断。
llm-agents
evaluation
simulation
multi-turn