AI 技术债的三座无声时钟
与代码债务不同,AI 特有的技术债——提示词漂移、评估侵蚀和嵌入陈旧——会以隐蔽的方式累积。本文将介绍如何在这些时钟耗尽之前检测它们。
无需标注的评估:在拥有标准答案前衡量 LLM 质量
一份在第一周 —— 即在你拥有标注数据之前 —— 衡量 LLM 输出质量的实用指南。涵盖了自我一致性、约束满足、行为不变性以及 LLM 作为裁判(LLM-as-judge),并探讨了每种方法的失效模式。
你从未闭合的反馈回路:将用户行为转化为 AI 真值
显式的点赞评分可能是表象。编辑率、重试模式和会话中断能更真实地反映 AI 的质量 —— 而且你可以在没有标注预算的情况下,将它们转化为评估数据集。
基准污染:为什么那个90% MMLU分数并不意味着你想象的那样
前沿模型在标准基准上表现亮眼,但污染——测试数据泄漏到预训练中——会显著虚高这些数字。本文揭示实际差距有多大,以及如何设计能给出诚实信号的评估。
为何"修改提示词"是根因谬误:为 AI 系统打造无责事后复盘
「修提示词」的反射动作正在取代 AI 事件复盘中真正的根因分析。本文解释为何如此,以及如何将无责 SRE 文化应用于非确定性系统。
AI 推理的突发容量规划:当黑色星期五遇上你的 KV Cache
AI 推理负载对流量峰值的响应与传统 API 截然不同——冷 KV Cache、长达数分钟的冷启动、受内存限制的并发,使得响应式自动扩缩容方案完全失效。本文介绍实用的容量规划计算方法、预热策略,以及真正有效的优雅降级模式。
能力激发差距:升级到更新模型为何会破坏你的产品
当你升级到更新的前沿模型时,你的产品所依赖的特定能力可能会悄然退化。以下是安全训练导致这一现象的原因、如何检测它,以及在无需微调的情况下恢复被抑制行为的技巧。
AI 工作负载的容量规划:当 Token 成为你的核心资源时,传统方法为何失效
传统供应模型在 LLM 工作负载下会失效。本文介绍了一套考虑 Token 突发性、KV 缓存压力的预测方法,并解释了为何 GPU 利用率是一个误导性信号。
认知负载倒置:为什么 AI 建议让你感觉有帮助却精疲力竭
实时 AI 建议通过将工作从生成转向验证,反而增加了认知负载。这里有相关研究和真正有效的设计模式。
复合 AI 系统:当你的流水线比任何单一模型都更智能
将检索器、重排序器、代码解释器、分类器和 LLM 组合成流水线,使其性能可靠地超越任何单一组件 —— 以及当你没有针对衔接处进行工程化处理时出现的涌现性故障模式。
上下文窗口悬崖:长对话的应用层管理策略
当 LLM 上下文在会话中途耗尽时究竟会发生什么,为什么大多数框架处理得很糟糕,以及能让长对话保持连贯的摘要、选择性保留和外部化模式。
AI 模型的持续部署:你的回滚信号是错误的
HTTP 错误率无法检测 LLM 升级中的行为退化。本文将介绍如何以行为差异作为真正的回滚信号,进行蓝绿部署和金丝雀部署。