平庸 AI 宣言:为什么单个提示词的表现优于你的自主智能体
80% 的 AI 项目以失败告终,而那些悄无声息地产生回报的项目往往是分类器、路由器和提取器——而非自主智能体。本文探讨了为什么团队总在构建错误的东西,并提供了一个将 AI 复杂度与实际业务价值相匹配的框架。
面向 Agent 与 RAG 的分块:为什么一套方案会同时拖累两者
RAG 检索与 Agent 执行对分块有着截然相反的需求。对两者使用同一种策略会悄无声息地降低性能。本文将揭示其背后的原理以及如何修复。
代码所有权衰减:当 AI 编写大部分提交时,团队知识会发生什么
当 AI 编写了你团队的大部分提交时,git blame 不再能回答那个真正关键的问题:为什么。本文探讨了代码所有权是如何默默衰减的,以及工程团队正在采取哪些措施来阻止这一趋势。
复合幻觉问题:多阶段 AI 流水线如何放大错误
在多阶段 AI 流水线中,幻觉不仅会持续存在,还会成倍增加。每个阶段都会将前一阶段的输出视为事实,从而将一个简单的错误事实演变成一个看似确凿却完全错误的最终答案。本文将探讨这一系统层面的问题及其解决方案。
上下文压缩失真:你的摘要中间件在悄悄丢失什么
上下文摘要是应对上下文限制的标准方案——但它会以不均匀的方式破坏信息。否定表达、精确数字、条件依赖关系和工具输出归因最先消失。以下是从业者需要了解的内容。
上下文窗口是一个 API 界面:像对待合约一样对待你的提示词结构
为什么将上下文窗口布局视为正式的 API 合约——通过命名槽位、版本控制和 Diff 友好结构——能使 LLM 系统更易于调试和维护。
数据飞轮假说:AI 功能是在产生复利,还是在堆积噪声?
大多数团队认为更多的交互数据会自动让他们的 AI 变得更好。事实并非如此。本文将探讨是什么让真正的复利飞轮区别于昂贵的日志文件。
数据敏感级别模型路由:管控哪个模型能看到哪些数据
大多数 AI 路由决策以成本和延迟为优化目标。但数据的隐私分类同样应当驱动路由——忽视这一点会埋下静默的合规违规,只有在审计时才会浮出水面。
端到端延迟并非你的 LLM 调用 P99:代理系统中无人衡量的隐藏乘数
为什么你的 LLM API 调用的 P99 延迟几乎无法反映用户在多步代理工作流中的真实体验 —— 以及填补这一差距的隐藏乘数。
评估债务棘轮:靠感觉发布 AI 功能的团队如何被技术欠账所困
在发布 AI 功能时跳过评估会产生复利式的债务,使团队陷入无法测试的行为困境。本文探讨棘轮效应的运作机制,以及如何在不暂停功能开发的前提下偿还这笔欠账。
评估疲劳周期:为何AI质量度量在上线后走向崩溃
大多数团队在上线时拥有完善的AI评估套件,却在六周内将其废弃。评估体系的崩溃在结构上几乎是必然的——本文揭示原因,并给出解决之道。
评估集拥挤问题:为什么更大的测试套件捕获的回归反而更少
扩大 AI 评估套件往往会降低其捕获真实回归的能力。本文将探讨评估套件为何会偏向于工程上方便处理的边缘情况,并介绍如何通过强制排序方法论保持其预测性。