脚手架审计:每一次模型发布都让你的部分开发框架变成累赘
重试机制编排、JSON 修复解析器以及强制思维链,都是为你不再运行的模型而构建的。这是一套在每次模型升级时,对过时的 LLM 脚手架进行标记、消融和删除的实用规范。
不存在的单一质量指标
你的 AI 功能质量是一个分布,而非一个标量。为什么平均评估分数会将细分领域的崩溃误报为提升,以及你应该在汇报 PPT 中展示什么——细分网格、底线指标、最差案例记录——以及保持噪声指标可信度的报告节奏。
千人智能体客户:按席位计费的 SaaS 并非为机器定价
AI 智能体集群同时打破了席位许可、自动化条款、速率限制和按用户分析。为什么供应商正分裂为“对智能体敌对”和“为智能体定价”两大阵营——以及在将智能体接入任何 SaaS 合同前你必须阅读的五个关键条款。
429 错误背后的惊群效应:速率限制是一个分布式系统问题
不带抖动的指数退避会组织你的重试集群而不是将其消解 —— 随之而来的是同步的 429 浪潮、重试放大和亚稳态故障。本文将探讨为什么 LLM 速率限制需要抖动、重试预算,以及你原本没打算构建的客户端调度器。
Tokenizer 税:除了英语,你的 AI 功能在所有其他语言中成本更高且表现更差
同一个 AI 功能,在日语或阿拉伯语中的服务成本比英语高出 2-3 倍,且质量明显较差——然而大多数团队在进行全球发布时仅使用单一的英语评估套件。本文探讨 Token 肥沃度如何驱动各地区的成本、上下文和准确性,以及在全球发布前需要衡量哪些指标。
预热沙箱池:当每个智能体任务都拥有专属机器时的基础设施经济学
单任务智能体隔离悄然将你的平台转变为一个临时虚拟机集群。真正的工程挑战在于预热池、快照流水线、感知时长的装箱策略以及回收废弃沙箱 —— 而你过去的容器经验可能会误导你。
在构建下一层 AI 技术栈之前,请先绘制 Wardley 地图
关于 AI 基础设施的‘自研还是外购’的争论,往往假设了一个并不存在的稳定格局。Wardley 地图揭示了你的技术栈中哪些层会在几个月内商品化,以及哪些组件(如领域评估和私有数据)正朝着相反的方向发展。
为什么你无法为智能体设置进度条
百分比完成度假设分母已知,但智能体在执行过程中不断发现新任务。真实的进度 UX 应包含:可验证的里程碑、当前开销、安全中断,以及知道何时切换到“完成后通知我”模式。
你的智能体需要的是监督者,而不是重试循环
当长时间运行的智能体失败时,重试循环回答了错误的问题。Erlang 的 OTP 监督树在三十年前就定义了真正的决策路径:是彻底重启、从检查点重启,还是升级给人工处理 —— 以及如何将这些策略映射到智能体流水线中。
你的智能体读了页面。没人看到广告。
智能体流量正在破坏以广告为生的互联网:没有曝光产生,没有联盟链接被点击,且你的 RAG 管道所依赖的数据源正在重新定价。本文将探讨抓取转推荐比、按次抓取付费、RSL 授权,以及如何在数据进入付费墙或关停之前审计你的上游数据。
你的智能体很廉价,但维护者的注意力并不便宜。
AI 极大地降低了生成 Pull Request 的成本,但审核成本并未降低 —— 无偿的维护者正面临没顶之灾。本文探讨了配备智能体团队的贡献规范,以及你对公共社区应有的责任。
你的智能体内存需要垃圾回收机制
持久化智能体内存默认会单调增长,因此过时的事实会污染之后检索它们的每一次运行。本文将探讨为什么仅靠 TTL 是不够的,以及过时评分、替代链、溯源和写入时门控如何将内存从简单的日志转变为一套生命周期管理系统。