·tian
裁判模型被悄悄升级的评估框架
终端被悄悄更新的 LLM 裁判是一个没有校准契约的测量工具。固定快照版本、构建锚点集并运行双裁判窗口,确保 6 分的提升代表的是你的系统得到了改进 —— 而不是尺子变了。
insider
llm-eval
judge-model
calibration
+2·tian
评估数据集是附带正确答案的客户数据
黄金评估集是与标记的正确答案配对的真实客户查询 —— 但大多数团队将其视为工程辅助工具,绕过了为底层生产数据构建的每一项隐私控制。
insider
llm-eval
ai-privacy
gdpr
+2·tian
你的推理内部结算正在悄悄侵蚀评估纪律
仅对推理 Token 计费而不奖励评估覆盖率,这在变相鼓励模型升级并惩罚评估工作。结果是:在账单飙升的同时评估覆盖率却在缩减——这与 FinOps 的初衷背道而驰。
finops
llm-eval
ai-engineering
cost-attribution
+1·tian
LLM 裁判的天花板:为什么你的自动评估在关键分数点上不再与用户对齐
LLM 作为裁判与人类的一致性在模糊的中间地带最高,但在决策边界处会崩溃。保持评估诚实的关键规范包括:分片 Kappa 分析、漂移仪表盘、针对高风险分片的跨模型系列集成,以及一个明确的、超过后需由人类评分的天花板。
llm-eval
ai-engineering
llm-as-judge
evaluation
+1·tian
70% 可靠性恐怖谷:AI 功能丧失用户信任的深渊
一个成功率为 70% 的 AI 功能可能比一个失败率为 70% 的功能更糟糕 —— 集中且不可预测的失败比持续的不稳健更快地摧毁用户信任。本文探讨了为什么综合准确率会误导人、为什么用户无法自我校准,以及如何针对“恐怖谷”地带进行设计。
ai-product
trust-calibration
llm-eval
ux-design
+1