你的 LLM 评估套件中的古德哈特定律:当优化分数破坏系统时
团队如何在无意中博弈自己的 LLM 评估,为什么基准分数与生产质量的偏差比你预期的更快,以及保持评估套件诚实的元评估实践。
机器可读的项目上下文:为什么你的 CLAUDE.md 比模型选择更重要
每款 AI 编程工具在响应之前都会读取一个项目专属的 Markdown 文件。这个文件的质量比背后的模型更可靠地预测输出质量——然而大多数团队只写一次、写得很糟,然后再也不碰。
衡量真实的 AI 编程生产力:能在 90 天滞后期中幸存的指标
速度代理指标在第 30 天时看起来非常诱人,但在第 90 天时却与代码质量背道而驰。本文探讨了那些能够揭示 AI 编程工具究竟是在复利生产力,还是仅仅将债务转移到下游的滞后指标与领先信号。
质量感知模型路由:为什么仅优化成本会毁掉你的 AI 产品
仅优化成本的 LLM 路由虽然省钱,但会悄悄降低最重要查询的质量。本文提供按任务复杂度、模型能力和生产反馈进行路由的实用指南——而不仅仅是按每 token 价格。
Spec-to-Eval:将产品需求转化为可证伪的 LLM 评估标准
大多数 AI 功能用自然语言描述、也用自然语言评估——这正是为什么团队在站会上达成共识,却在上线时产生分歧。本文介绍一套实用方法,在编写第一个 Prompt 之前,将英文需求转化为具体、可证伪的 LLM 评估标准。
环境 AI 一致性问题:当每个功能都由 AI 驱动,整个产品却失去了统一感
在搜索、摘要、对话和推荐中同时部署 AI,会产生跨功能矛盾,其对用户信任的损害远超任何单一的错误答案。本文介绍如何构建让用户感受到统一产品体验的系统。
推理成本悖论:为何模型越来越便宜,你的 AI 账单却越来越高
过去三年,每百万 token 的 LLM 价格下降了 1000 倍。同期,企业 AI 支出增长了 320%。这两个事实同时成立——本文解析背后的机制,以及你应该怎么做。
推理侧个性化陷阱:当用户上下文的成本超过其收益时
在每个 LLM 提示词中加入用户历史记录似乎是一个显而易见的改进——直到你衡量了每一单位质量提升所付出的 token 成本。本文将探讨推理侧个性化在何时不再划算,以及生产环境中的架构是如何应对这一挑战的。
LLM 伪造问题:当模型为错误答案构建出令人信服的论据
LLM 不只会幻觉事实——它们还会伪造推理。伪造问题是指模型先做决定再进行解释,以选择性忽略证据为基础构建出听起来合理的综合分析。
按量计费的 AI 定价死亡螺旋:为什么按 Token 计费会惩罚你最好的功能
按 Token 计费会产生扭曲的激励机制,让你最有价值的 AI 功能运行成本最高。混合定价和基于成果的定价模型能够重新将成本与交付价值对齐。
需求鸿沟:当“正确”是一个分布时,如何为 AI 功能编写规格说明
标准的用户故事和验收标准在面对概率性 AI 输出时会失效。本文介绍了一种两层行为规范格式——将硬性策略约束与可协商的质量阈值区分开来,并解释了为什么预先定义这些内容可以将迭代周期缩短 3–5 倍。
第二意见经济学:双模型验证何时真正值得
用第二个LLM来验证第一个看起来显而易见。但实际上,几乎没有团队能做好。这里是一个成本收益框架,告诉你何时值得这么做。