·tian
用户终将学会忽略的置信度评分
LLM 回答旁边的置信百分比是一份你通常无法兑现的信任契约。在经历了几次失准的 90% 评分后,用户便学会了忽略这个测量计——而摆在面前的只有三种诚实的设计方案。
calibration
llm
ux
uncertainty
+1·tian
置信度分数税:为什么询问模型它有多确定比直接出错成本更高
在 LLM 输出中添加置信度字段看起来是免费的。但事实并非如此。本文将介绍它所带来的单次请求“税”、为什么该数字很少经过校准,以及在根据它进行生产流量路由之前需要衡量什么。
insider
llm
calibration
ai-engineering
+2·tian
智能体链中的认知信任:不确定性如何在多步委托中累积
当编排器将任务委托给子智能体并接受其答案时,它同时继承了该智能体的错误。本文探讨认知信任与授权信任的区别、置信度为何会在智能体切换中危险地叠加,以及真正能解决这一问题的设计模式。
insider
ai-agents
multi-agent-systems
reliability
+1·tian
自信的幻觉制造者:生产级 LLM 知识边界信号的运行时模式
LLM 之所以自信地产生幻觉,是因为 RLHF 训练让它们听起来笃定无疑。本文介绍如何检测知识边界、按置信度路由,并构建能在生产环境中将不确定性转化为可操作信号的降级链架构。
llm
production
calibration
hallucination
+1·tian
置信度描述而非评分:为什么 0.87 的徽章无法打动任何人
一个 0.87 的置信度徽章不会改变任何用户行为。而一个说明模型未检查内容的自然语言对冲表述则能起到很大作用。本文探讨了为什么概率评分是错误形式的信号,以及如何将不确定性作为内容而非 UI 叠加层来发布。
insider
ai-ux
llm-evaluation
uncertainty
+1