跳转到主要内容

6 含有标签「model-evaluation」

Posts tagged "model-evaluation" on TianPan.co.

查看所有标签

·tian

量化质量悬崖:当 int4 通过中位数评估却在长尾场景失效时

int4 量化将推理成本减半,且几乎不影响中位数基准测试——却在悄无声息地破坏稀有 Token 补全、低资源语言和长文本推理能力。本文将探讨为什么这种“悬崖式”下降在通过审核的评估套件中是不可见的,以及如何在客户发现之前通过上线纪律让这种退化显现出来。

insider
quantization
llm-inference
model-evaluation
+1
·tian

权重中的幽灵:预训练残留如何在生产环境中破坏你的微调模型

微调调整的是权重,而不是重置它们。预训练先验在分布外输入上持续渗透,产生置信度极高却错误百出的答案,而你的评估套件根本察觉不到。以下是在这些问题触达用户之前如何检测和缓解它们的方法。

insider
llm
fine-tuning
production-ai
+1
·tian

你的供应商模型卡没有告诉你的事

模型卡报告的是平均基准分数。它们遗漏了尾部行为、系统提示交互效果、文化盲点,以及那些悄悄破坏生产系统的静默回归。以下是各团队正在构建的替代方案。

insider
llm
production-ai
model-evaluation
+1
·tian

能力激发差距:升级到更新模型为何会破坏你的产品

当你升级到更新的前沿模型时,你的产品所依赖的特定能力可能会悄然退化。以下是安全训练导致这一现象的原因、如何检测它,以及在无需微调的情况下恢复被抑制行为的技巧。

insider
llm
rlhf
model-evaluation
+2
·tian

校准差距:你的 LLM 说有 90% 的把握,但实际上只有 60% 的准确率

LLM 的置信度分数惯常将准确率高估 30 到 80 个百分点。本文介绍如何用可靠性图和 ECE 度量校准差距、用温度缩放与自适应重校准来修复它,以及如何设计即使在置信度失真时仍能保持可靠的生产系统。

insider
llm-calibration
production-ai
model-evaluation
+2
·tian

能力探测:在用户发现之前绘制模型的能力边界

通过探针套件、能力矩阵、金丝雀提示词以及探针到回归的流水线,在部署前绘制 LLM 的失败边界,在模型升级中捕获静默回归。

llm-testing
capability-probing
model-evaluation
production-ai