在你的智能体能够自我重试之前,精确一次性处理(Exactly-Once)曾是一件难事
幂等键(Idempotency keys)假设调用者会逐字节重复其请求。而智能体(Agent)在重试时可能会转述自己的请求,这打破了该假设。本文将介绍如何构建工具级的去重机制,使其在调用者是语言模型的情况下依然有效。
模型崩溃始于你自己的数据湖
记录的 LLM 输出悄然成为了下个季度的训练数据。本文探讨模型崩溃是如何在你自己的数据湖中发生的,以及如何通过溯源标记、隔离区和尾部评估(tail evals)来打破这一反馈循环。
当时钟成为工具:Agent、时区以及那个只在午夜发生的 Bug
LLM 没有内部时钟,因此 Agent 会自信地漂移到过时的时间上——这表现为错过的任务调度、错误的时区计算以及破坏缓存的时间戳。本文将介绍如何将当前时刻作为基础设施来提供。
零温度并非确定性:复现那些你无法重新运行的事故
将温度设置为零会强制执行贪婪解码,但这并不能使 LLM 推理具有可复现性。导致 Token 发生跳变的并不是采样器,而是与 Batch 相关的 GPU 数值计算 —— 本文将介绍如何为你无法重新运行的实例构建事故后分析。
双速路线图:当模型基准每季度都在移动时如何规划 AI 功能
前沿模型现在大约每四周发布一次,直接让你上季度开发的临时方案失效。你应该将路线图拆分为:哪些功能会随着模型改进而产生复利,哪些功能会被淘汰,并按照各自的速度进行规划。
你不是选择了一个模型,而是和它结婚了:无人预估的提示词级锁定
更换你的 LLM 端点只需要一行配置;但让你的提示词在新模型上生效则需要一个你未曾预料的季度。本文探讨提示词级锁定是如何累积的,以及在被迫支付代价之前,如何衡量真实的迁移成本。
你的 Token 夜宿何方:LLM API 调用的数据驻留
在欧盟地区托管 LLM 推理并不等同于让你的提示词脱离外国司法管辖。这是一份关于数据驻留、CLOUD 法案以及故障关闭型网关架构的实践指南。
Token 预算是变相的人员编制决策
关于 Prompt 消耗多少 Token 的每一个选择,本质上都是在工程师时间、支持压力和基础设施成本之间进行隐形博弈。本文提供了一个框架,旨在让这种权衡显性化,而非任其随时间累积。
你无法修改的产品策略:模型提供商的安全过滤器
你的 LLM 提供商的安全过滤器是由从未见过你用户的人编写的产品策略。过度拒绝、悄无声息的策略更新以及统一的审核标准正如何侵蚀专业领域的 AI 产品——以及你该如何通过工程手段夺回控制权。
自研还是采购的界限已然改变:当供应商原语吞噬你的基础设施时,如何抉择 AI 功能
供应商 API 正在不断吸收你曾经需要自建的检索、记忆和结构化输出层。本文提供了一个四象限框架,用于决定哪些该自研,哪些该租用,以及你真正的护城河究竟在哪里。
租赁智能:CFO 的 LLM 支出心理模型
Token 支出表现得更像销售成本(COGS)而非研发费用(R&D)——将随用量扩大的成本当做固定成本来定价,正是让财务团队措手不及的原因。本文提供了一个预测 LLM 支出、识别利润陷阱并决定何时“租赁智能”才划算的实用模型。
引用链接依然有效,但内容已不再是模型引用的原文
一个 RAG 引用虽然通过了链接检查,但在审计中依然失败了,因为可访问性并不等于保真度。本文将探讨如何对引用的内容片段进行快照、哈希和保留,从而使记录在原文档被修改后依然能够存续。