·tian
评估背后的隐藏运营组织:标注者经济学
每一个评估分数都继承了你未曾预算的人工标注流程质量。了解标注者经济学、吞吐量驱动的质量衰减以及 LLM 评审如何塑造你交付的各项指标。
evals
rlhf
data-annotation
llm-as-judge
+1·tian
先收敛、后悄然崩溃的评估
停滞不前的评估分数并不总是意味着模型达到了天花板。当标注者趋于同质化时,一致性指标会上升,而评估则不再能衡量团队认为它正在衡量的内容。
evals
llm-judge
labeling
ai-engineering
+1·tian
你那两个独立的评估指标正不断破坏拒绝校准
将拒绝逻辑拆分为安全性评估和帮助性评估,注定会导致每次模型升级时两者此消彼长。解决方案是针对每个案例采用统一的“正确操作”指标进行评分。
insider
evals
llm-safety
refusal-calibration
+2·tian
你的生产微调循环学会欺骗的奖励模型
由点赞率驱动的闭环微调不可避免地会产生奖励篡改。四个调节机制可确保循环指向最终结果而非代理指标。
insider
rlhf
fine-tuning
reward-hacking
+2·tian
增长速度快于评估套件的系统提示词
系统提示词随着规则逐条增加,而评估套件则随着事故逐个增加 —— 这种不对称性悄然让 “评估通过” 变成了一个谎言。本文将介绍如何让这两个层面协同演进。
insider
llm-evals
prompt-engineering
ai-engineering
+1·tian
量化质量悬崖:当 int4 通过中位数评估却在长尾场景失效时
int4 量化将推理成本减半,且几乎不影响中位数基准测试——却在悄无声息地破坏稀有 Token 补全、低资源语言和长文本推理能力。本文将探讨为什么这种“悬崖式”下降在通过审核的评估套件中是不可见的,以及如何在客户发现之前通过上线纪律让这种退化显现出来。
insider
quantization
llm-inference
model-evaluation
+1·tian
当被遗忘权遇上微调:当删除止于快照
一旦客户数据进入损失函数,删除就不再是简单的行操作,而变成了系统重构。本文探讨血缘链、四种政策选择,以及现在已成为阻碍交付关键问题的采购条款。
insider
privacy
gdpr
fine-tuning
+2·tian
评估集作为模拟器的偏移:当离线指标提升而生产表现恶化时
一个 LLM 评估套件就是一个模拟器。如果跳过重新校准周期,你可能会针对一个在第三个月就不再像生产环境的数据集发布六个“全绿”版本。
insider
llm
evals
ai-engineering
+2·tian
合成偏好陷阱:AI 排序的 RLHF 如何让你的模型悄然漂移到“老师”的口吻中
合成偏好数据看起来像是一顿免费午餐 —— 直到你的产品开始悄无声息地听起来和你用来训练它的“老师”模型一模一样。这是一份关于如何识别、衡量和限制 RLHF 风格漂移的实战指南。
rlhf
fine-tuning
llm-training
ai-engineering
+1·tian
这个提示词去年还有意义:AI 系统中的机构知识衰减
当构建 AI 系统的工程师离职后,系统不会立即崩溃——它会缓慢腐烂。以下是如何通过提示词原理文件、评估来源日志和护栏理由注释来防止衰减。
insider
ai-engineering
prompt-engineering
documentation
+1