博客
来自AI智能体经济的洞见、分析与更新。 按标签浏览.
Token 预留容量:被人们忽略的、尚未从云时代迁移过来的预留实例决策
预置吞吐量和承诺使用折扣让你能像以前预留 EC2 一样预留 LLM 推理资源 —— 但盈亏平衡点比你想象的要高,而且你的承诺可能会因为模型弃用而陷入困境。这里是移植过来的实战手册,以及其中一个危险的变数。
影子智能体:法务在事故复盘中才发现的 AI 功能
一个能够读取客户数据并采取行动的未经授权 AI 智能体,比任何违规的 SaaS 订阅都更令人震惊。本文探讨影子智能体是如何潜入生产环境的,为什么你现有的控制措施会失效,以及如何在数据泄露发生前发现它们的轻量级治理方案。
AI 路线图:押注于尚不存在的模型
围绕模型在六个月后的预期表现来界定功能,会使你的计划变成对供应商发布时间表的预测。本文将探讨如何区分合理的模型能力博弈与空想,以及如何进行设计,使得更强大的模型是锦上添花,而非维持生存的氧气。
无人负责的对话:问责制如何在智能体移交链中消散
在多智能体系统中,每个智能体都可以通过各自的测试,但整个对话却可能失败。本文探讨了为什么移交流程会分散所有权,以及重新建立问责制的原始原语。
评分了每一轮对话却错过了整个交流:聊聊多轮评估的陷阱
95% 的单轮准确率并不意味着 95% 的会话都能成功。本文将探讨为什么平均单轮得分会掩盖复合失败,以及如何转而对整个对话进行评估。
护栏税:当安全分类器让你的延迟和账单翻倍时
外挂式安全分类器堆叠在关键路径中,使延迟增加三倍并推高了你的推理账单。本文介绍如何根据爆炸半径调整护栏规模,并采用并发而非串行的方式运行它们。
测试无法察觉却破坏了一切的模型升级
你迁移到了更新的模型,所有评估都通过了,延迟也降低了,但支持工单却不断增加。本文将探讨这类能够绕过所有断言的回归问题,以及如何在用户发现之前捕捉到它们。
嘈杂邻居竟是你:当失控的 Agent 让共享账户中的其他人全都触发 429 错误
共享的模型账户拥有一个全组织范围的 Token 预算,任何未限速的批处理作业都可能让其他团队的生产流量陷入饥饿。本文将探讨为什么基于组织的限制会让 Agent 成为一种“共担命运”的资源,为什么仅靠退避机制会引发惊群效应,以及哪些隔离模式行之有效。
没有根本原因的事后分析
“五个为什么”事件回顾假设存在一个模型并不具备的确定性原因。本文将介绍如何编写一份真实的 LLM 事后分析报告,它建立在故障率增量和促成因素堆栈之上,而非寻找单一的根本原因。
Prompt 缓存悬崖:一次系统提示词修改如何重置你的整个集群成本
在系统提示词顶部进行的一行修改可能会瞬间导致所有缓存前缀失效,使你的缓存命中率降至零,并让推理账单在隔夜之间翻倍 —— 本文将探讨其背后的原因,以及如何构建提示词结构以防止这种情况发生。
没有预发布模型的预发布环境
托管模型是你无法建立忠实预发布副本的唯一依赖项。本文将探讨为什么 LLM 的预生产一致性会失效,以及版本固定、重放、黄金转录和影子流量如何分别只能填补部分差距。
两个模型厂商,一个功能:用冗余换来的连贯性噩梦
增加一个备选 LLM 厂商听起来像是教科书级的弹性设计,但两个模型并非两个副本。这里有没人预料到的隐藏的一致性与维护成本。