·tian
Shadow Replay 会惩罚那些本可以改变对话走向的模型
Shadow Replay 评估会悄悄地惩罚更好的模型,因为它根据旧模型引导下的用户对话记录来给新模型评分。本文将探讨其中的原因,以及影子回放仍然可以真实衡量哪些指标。
insider
llm-evals
offline-evaluation
shadow-testing
+2·tian
模型迁移指南:如何在不破坏生产环境的情况下更换基座模型
一份在生产环境中安全迁移基座模型的分步指南 —— 涵盖影子测试、嵌入向量重新索引、提示词适配、金丝雀发布,以及区分两周完成更换与两个月完成更换的组织协调工作。
insider
llm-migration
model-swap
shadow-testing
+2