·tian
金丝雀群组:按 ID 哈希的分流如何将核心用户聚集到同一实验组
对不透明 ID 进行均匀哈希并不等同于对用户进行均匀抽样。当 ID 分配与参与度相关联时,基于哈希分桶的金丝雀发布可能会悄无声息地将所有核心用户分配到同一个实验组,并报告一个虚假的增长结果。
insider
experimentation
ab-testing
rollout
+2·tian
那个在东部时间凌晨 3 点采样生产流量的评估集
一个基于凌晨 3 点定时任务构建的离线评估集,悄然变成了针对深夜批量重试和亚太地区流量的调查——而排行榜无法告诉你那是谁的模型。
insider
llm-evals
sampling-bias
production-ml
+1·tian
免费层级流量才是你真实的评估集
针对付费用户队列的追踪记录来对 LLM 进行评分,实际上是在针对简单的分布进行评分。仍在犹豫是否升级的群体主要集中在免费层级 —— 而评估集往往忽略了这一点。
insider
evals
freemium
ai-product
+2