·tian
量化质量悬崖:当 int4 通过中位数评估却在长尾场景失效时
int4 量化将推理成本减半,且几乎不影响中位数基准测试——却在悄无声息地破坏稀有 Token 补全、低资源语言和长文本推理能力。本文将探讨为什么这种“悬崖式”下降在通过审核的评估套件中是不可见的,以及如何在客户发现之前通过上线纪律让这种退化显现出来。
insider
quantization
llm-inference
model-evaluation
+1·tian
权重中的幽灵:预训练残留如何在生产环境中破坏你的微调模型
微调调整的是权重,而不是重置它们。预训练先验在分布外输入上持续渗透,产生置信度极高却错误百出的答案,而你的评估套件根本察觉不到。以下是在这些问题触达用户之前如何检测和缓解它们的方法。
insider
llm
fine-tuning
production-ai
+1·tian
你的供应商模型卡没有告诉你的事
模型卡报告的是平均基准分数。它们遗漏了尾部行为、系统提示交互效果、文化盲点,以及那些悄悄破坏生产系统的静默回归。以下是各团队正在构建的替代方案。
insider
llm
production-ai
model-evaluation
+1·tian
能力激发差距:升级到更新模型为何会破坏你的产品
当你升级到更新的前沿模型时,你的产品所依赖的特定能力可能会悄然退化。以下是安全训练导致这一现象的原因、如何检测它,以及在无需微调的情况下恢复被抑制行为的技巧。
insider
llm
rlhf
model-evaluation
+2·tian
校准差距:你的 LLM 说有 90% 的把握,但实际上只有 60% 的准确率
LLM 的置信度分数惯常将准确率高估 30 到 80 个百分点。本文介绍如何用可靠性图和 ECE 度量校准差距、用温度缩放与自适应重校准来修复它,以及如何设计即使在置信度失真时仍能保持可靠的生产系统。
insider
llm-calibration
production-ai
model-evaluation
+2·tian
能力探测:在用户发现之前绘制模型的能力边界
通过探针套件、能力矩阵、金丝雀提示词以及探针到回归的流水线,在部署前绘制 LLM 的失败边界,在模型升级中捕获静默回归。
llm-testing
capability-probing
model-evaluation
production-ai