跳转到主要内容

17 含有标签「calibration」

Posts tagged "calibration" on TianPan.co.

查看所有标签

·tian

你模型的置信度分数只是一种感觉,而非概率

LLM 自我报告的置信度并非概率 —— 它只是受 RLHF 激励机制影响而产生的流畅 Token。本文将探讨为什么校准是你从未衡量过的特性,以及你应该转而使用什么进行门控。

insider
llm
calibration
ai-reliability
+2
·tian

供应商重新校准后,你的智能体所信任的转录置信度得分

针对特定 ASR 模型调整的置信度阈值是与该特定校准达成的契约。当供应商重新训练置信度头(confidence head)时,相同的数值意味着不同的含义 —— 你的准入闸口也在悄然松动。

insider
voice-agents
asr
calibration
+2
·tian

当候选人说“我会直接用提示词解决”时,面试官之间出现的 40 分分歧

针对同一位候选人产生的 40 分评价差异,并不是候选人的问题,而是评分标准的问题。本文将探讨当你的团队尚未达成共识时,如何校准 AI 工程师的招聘环节。

hiring
ai-engineering
interview-loop
calibration
+1
·tian

裁判模型被悄悄升级的评估框架

终端被悄悄更新的 LLM 裁判是一个没有校准契约的测量工具。固定快照版本、构建锚点集并运行双裁判窗口,确保 6 分的提升代表的是你的系统得到了改进 —— 而不是尺子变了。

insider
llm-eval
judge-model
calibration
+2
·tian

被两个漂移向量拉扯的评估准则

一个同时由人类和 LLM 裁判阅读的评估准则会在两个轴向上同时发生漂移。综合得分掩盖了这种波动。本文介绍了一种测量协议,使每种漂移都变得可追溯。

insider
evals
llm-judge
measurement
+2
·tian

你没列进预算的"弃答税"

教会 Agent 说"我不知道"看上去是安全胜利,直到人工队列接下账单为止。本文给出把 LLM 弃答视为成本转移动作时的端到端账本。

insider
ai-agents
llm-cost
ai-ops
+2
·tian

用户终将学会忽略的置信度评分

LLM 回答旁边的置信百分比是一份你通常无法兑现的信任契约。在经历了几次失准的 90% 评分后,用户便学会了忽略这个测量计——而摆在面前的只有三种诚实的设计方案。

calibration
llm
ux
uncertainty
+1
·tian

置信度分数税:为什么询问模型它有多确定比直接出错成本更高

在 LLM 输出中添加置信度字段看起来是免费的。但事实并非如此。本文将介绍它所带来的单次请求“税”、为什么该数字很少经过校准,以及在根据它进行生产流量路由之前需要衡量什么。

insider
llm
calibration
ai-engineering
+2
·tian

自信的幻觉制造者:生产级 LLM 知识边界信号的运行时模式

LLM 之所以自信地产生幻觉,是因为 RLHF 训练让它们听起来笃定无疑。本文介绍如何检测知识边界、按置信度路由,并构建能在生产环境中将不确定性转化为可操作信号的降级链架构。

llm
production
calibration
hallucination
+1
·tian

LLM 裁判的天花板:为什么你的自动评估在关键分数点上不再与用户对齐

LLM 作为裁判与人类的一致性在模糊的中间地带最高,但在决策边界处会崩溃。保持评估诚实的关键规范包括:分片 Kappa 分析、漂移仪表盘、针对高风险分片的跨模型系列集成,以及一个明确的、超过后需由人类评分的天花板。

llm-eval
ai-engineering
llm-as-judge
evaluation
+1
·tian

校准弃答:你的 LLM 技术栈每一层都在惩罚的能力

LLM 技术栈中的每一项默认设置——预训练、RLHF、裁判 LLM、用户反馈——都在促使模型给出自信的错误答案。只有当你构建了愿意为此付费的评估体系、评分标准和 UI 时,校准弃答才能真正落地。

llm
evaluation
calibration
abstention
+1
·tian

评估困局:当你的 LLM 评测器比被评分的模型更聪明时

当负责评分的 LLM 变得更敏锐时,即使你的系统没有变化,得分也会下降。本文将介绍如何区分评测器偏移与模型回归,并停止对错误的工具进行调试。

evals
llm-as-judge
ai-engineering
calibration
+1
显示第 1–12 篇,共 17 篇
1 / 2下一页