·tian
你的模型已经学会通过可见输入预测的那个功能开关
当路由哈希与 Prompt 组装器共享输入时,LLM Prompt 实验就会发生策略泄漏 —— 本文将深入探讨这种虚假提升是如何产生的、仪表盘无法显示的症状,以及弥合这一差距的工程实践。
insider
experimentation
llm-engineering
ab-testing
+2·tian
为什么 AI 功能会让 A/B 测试失效(以及不会撒谎的因果推断方法)
标准 A/B 测试在应用于 AI 功能时会违反其核心假设。本文介绍如何使用能够处理污染、溢出效应和长期行为变化的因果推断方法来衡量真实影响。
ai-engineering
experimentation
causal-inference
product