SFT、RLHF 与 DPO:垂直领域应用中的模型对齐方法决策矩阵
一个实用的决策框架,用于在垂直领域应用中对 LLM 进行对齐时,在有监督微调 (SFT)、RLHF 和 DPO 之间进行选择——包括如何诊断你的对齐差距是数据问题、奖励问题还是能力缺失。
TTFT 才是用户真正感知到的唯一延迟指标
你的基础设施团队优化的是端到端生成时间,而用户评判响应速度的标准是第一个 Token 何时出现。本文深入解析 TTFT——它的成因、测量方法,以及如何围绕它进行设计。
阿谀奉承是生产环境中的可靠性失效,而非性格缺陷
经 RLHF 训练的模型在用户反驳时会系统性地推翻正确答案——这不是因为它们感到困惑,而是因为“顺从”得到了奖励。本文将探讨这对生产系统意味着什么,以及如何防御这种现象。
委托悬崖:AI 代理可靠性为何在 7 步以上崩溃
AI 代理在演示中令人印象深刻,但在生产环境中的失败率却高得惊人。本文揭示了随着任务长度增加可靠性崩溃背后的数学原理,以及你实际上能做些什么。
Token 预算作为产品约束:围绕上下文限制进行设计,而不是假装它们不存在
大多数 AI 产品在处理上下文限制时会直接崩溃。本文将探讨如何围绕这些限制进行设计——包括渐进式截断、优雅降级,以及将上下文压力作为一等公民的 UI 信号进行展示。
AI 功能何时能构建护城河(何时不能)
数据网络效应在 LLM 产品中比传统 ML 更难复利。四个信号可以区分真正构建护城河与仅仅从 Anthropic 租用能力并添加 UI 界面。
Agent 测试金字塔:为什么 70/20/10 的分层对 Agentic AI 行不通
经典的单元/集成/端到端测试金字塔建立在廉价、快速、确定性单元的假设之上。而 LLM Agent 打破了所有这些假设。本文探讨真正可行的测试策略是什么样的。
为什么你的 AI 演示总是优于最终上线表现
AI 演示在精心挑选的输入下得分很高。而生产环境的流量更杂乱、更广泛,并且充满了团队从未预料到的边缘情况。本文将探讨这种差距产生的原因,并提供在发布前缩小差距的方法论。
LLM 流水线的背压模式:为何指数退避还不够
四种生产模式——令牌桶队列、优先级通道、感知令牌预算的熔断器和负载卸除——在指数退避让系统陷入持续过载振荡时,让 LLM 流水线保持稳定可靠。
行为契约:编写工程师真正能测试的 AI 需求
传统的验收标准在随机 AI 系统上会失效。四字段行为契约格式——输入类、期望行为、失败预算、测试预言机——为工程师提供了真正可衡量的依据。
大多数团队都会搞错的 LLM 基础设施“自研还是购买”决策
大多数团队在做 LLM 基础设施“自研还是购买”的决策时,都低估了双方的总拥有成本 (TCO)。本文将为你分析各个阶段的盈亏平衡计算,以及那些没人列入预算的隐藏成本。
闭合反馈回路:生产 AI 系统究竟如何持续改进
为什么大多数团队收集的反馈信号从未到达模型——以及将生产遥测转化为真正能力提升的架构决策。