·tian
当 LLM 评审 LLM 时,错误被“洗白”而非被捕获
在一个由一个模型评审另一个模型并反馈给下一次评估的闭环中,根本不存在地面真值(ground truth)——错误被“洗白”成了高分。这里介绍了该在何处重新引入人工。
llm-evaluation
ai-agents
llm-as-judge
ai-quality
+1·tian
为什么每周会话记录审查优于你的 AI 仪表板
每周花一小时阅读生产环境的会话记录,可以发现提示词漂移、未分类的意图以及被仪表板平均值掩盖的敷衍措辞。本文将介绍如何主持会议、参会人员、采样方法,以及使其可持续发展的隐私规范。
insider
ai-quality
evals
observability
+2