AI 系统设计顾问:它能做对什么、会自信地做错什么,以及如何分辨
AI 在教科书式的架构权衡与模式探索上能给出真正有价值的输入——但当你的真实约束才是关键时,它会给出危险的过度自信建议。
副驾驶陷阱:为什么全自动驾驶交付更快但失败更惨
全自动化交付虽快,但其失败往往是系统性的。本文提供了一个决策框架,用于在自动化频谱上定位每个 AI 功能,并探讨了为什么“直接做成智能体”是错误的默认选择。
动态系统提示词组装:请求时可组合的 AI 行为
如何在请求时根据用户角色、功能开关和任务上下文,从模块化组件构建系统提示词——以及由此带来的安全风险。
复合 AI 系统:当你的流水线比任何单一模型都更智能
将检索器、重排序器、代码解释器、分类器和 LLM 组合成流水线,使其性能可靠地超越任何单一组件 —— 以及当你没有针对衔接处进行工程化处理时出现的涌现性故障模式。
为部分完成而设计:当你的智能体完成 70% 后停止
大多数智能体故障设计假设干净中止或干净成功。真实的智能体会在任务中途遭遇不确定性、授权限制和资源约束。以下是如何为实际发生的情况进行设计。
当代码胜过模型:用确定性逻辑替换 LLM 调用的决策框架
“直接用模型就好”的本能反应是 AI 系统中不必要复杂性的主要诱因。本文提供了一个决策框架,帮助你识别何时正则表达式、查找表或基于规则的分类器在准确性、延迟和成本方面优于 LLM 调用。
模型路由是系统设计问题,而非配置选项
将 LLM 的选择视为运行时分发决策而非部署常量,能够带来真实的成本节省。本文探讨如何思考路由信号、故障转移失效模式、影子路由,以及大多数团队忽略的成本核算方法。
选择性弃权问题:为何总给答案的 AI 系统是有缺陷的
大多数 AI 产品设计都在优化更好的答案。更难、更有价值的能力是有原则地拒绝回答——而几乎没有团队在刻意构建它。
AI Agent 的 CAP 定理:为何你的 Agent 在本该优雅降级时却彻底崩溃
大多数 AI Agent 在单个工具宕机时会彻底崩溃——这与分布式数据库几十年前已解决的一致性与可用性权衡如出一辙。本文探讨如何设计部分可用路径。
AI Agent 工作负载的缓存层级:多数团队止步于第二层的五层架构
生产级 AI Agent 需要五个缓存层 —— 提示词、语义、工具结果、计划和会话状态 —— 每个层级都有独特的 TTL 和失效策略。大多数团队只做了前两层,白白流失了一半的节省空间。
合并再调用:无需降低用户体验即可削减成本的 LLM 请求批处理模式
请求合并是一种分层架构——飞行中去重、精确缓存和语义批处理——可在不降低用户体验的情况下将 LLM 推理成本降低 40–60%。本文介绍如何实现以及在哪些地方会遇到问题。