·tian
那个因为模型拒绝处理难题而提升的成功指标
模型升级后任务完成率的提升,可能意味着智能体变得更强了 —— 也可能意味着它不再尝试处理难题。请分解你的成功指标,否则流失率将让你付出代价。
llm-evaluation
agent-metrics
abstention
observability
·tian
你没列进预算的"弃答税"
教会 Agent 说"我不知道"看上去是安全胜利,直到人工队列接下账单为止。本文给出把 LLM 弃答视为成本转移动作时的端到端账本。
insider
ai-agents
llm-cost
ai-ops
+2·tian
弃权作为一种路由决策:为什么“我不知道”应该属于路由层,而不是提示词
将“我不知道”放在系统提示词中会让弃权行为变得不可测试、无归属且不可扩展。将其移动到路由层,你将获得 SLO、评估机制以及真实的升级路径。
llm
agents
abstention
routing
+1·tian
校准弃答:你的 LLM 技术栈每一层都在惩罚的能力
LLM 技术栈中的每一项默认设置——预训练、RLHF、裁判 LLM、用户反馈——都在促使模型给出自信的错误答案。只有当你构建了愿意为此付费的评估体系、评分标准和 UI 时,校准弃答才能真正落地。
llm
evaluation
calibration
abstention
+1·tian
检索空洞问题:为什么你的 RAG 拒绝说“我不知道”
向量搜索总是返回前 K 个结果,无论匹配质量如何,这会将缺失的信息转化为自信的虚构。修复这一问题不仅需要提高阈值——弃权机制必须成为一等输出。
insider
rag
retrieval
llm
+2