跳转到主要内容

5 含有标签「abstention」

Posts tagged "abstention" on TianPan.co.

查看所有标签

·tian

那个因为模型拒绝处理难题而提升的成功指标

模型升级后任务完成率的提升,可能意味着智能体变得更强了 —— 也可能意味着它不再尝试处理难题。请分解你的成功指标,否则流失率将让你付出代价。

llm-evaluation
agent-metrics
abstention
observability
·tian

你没列进预算的"弃答税"

教会 Agent 说"我不知道"看上去是安全胜利,直到人工队列接下账单为止。本文给出把 LLM 弃答视为成本转移动作时的端到端账本。

insider
ai-agents
llm-cost
ai-ops
+2
·tian

弃权作为一种路由决策:为什么“我不知道”应该属于路由层,而不是提示词

将“我不知道”放在系统提示词中会让弃权行为变得不可测试、无归属且不可扩展。将其移动到路由层,你将获得 SLO、评估机制以及真实的升级路径。

llm
agents
abstention
routing
+1
·tian

校准弃答:你的 LLM 技术栈每一层都在惩罚的能力

LLM 技术栈中的每一项默认设置——预训练、RLHF、裁判 LLM、用户反馈——都在促使模型给出自信的错误答案。只有当你构建了愿意为此付费的评估体系、评分标准和 UI 时,校准弃答才能真正落地。

llm
evaluation
calibration
abstention
+1
·tian

检索空洞问题:为什么你的 RAG 拒绝说“我不知道”

向量搜索总是返回前 K 个结果,无论匹配质量如何,这会将缺失的信息转化为自信的虚构。修复这一问题不仅需要提高阈值——弃权机制必须成为一等输出。

insider
rag
retrieval
llm
+2