
Tian Pan
Software Engineer
你的 Prompt 拥有外键
重命名一个列,编译器能捕捉到每一个调用方,唯独漏掉了你的系统 Prompt。嵌入在 Prompt 中的 Schema、工具签名和 Few-shot 示例都是未声明的依赖项 —— 本文将介绍如何为它们提供清单、实现部署时生成以及 CI 强制的引用完整性。
你的机密管理器在上下文窗口开始的地方终结
一旦凭证进入 LLM 的上下文,泄露便不可逆 —— 在轮换机制运行之前,它就已经被复制到了追踪日志、提示词缓存、内存存储、评估固件以及模型提供商的日志中。本文将探讨为什么工具边界是唯一的真实瓶颈,以及短效凭证如何有效限制爆炸半径。
你的工具 Schema 验证的是类型,而非单位
一个接收“分”为单位的退款工具往往会收到以“元”为单位的数值,因为 JSON Schema 验证的是结构而非含义。本文探讨了单位混淆是如何绕过类型、Schema 和评估的,以及如何通过命名、边界断言和评估模式来防止产生 100 倍金额的账单。
模型停滞不前,用户却在持续偏移
在没有进行任何部署的情况下,质量指标在上线 6 周后开始下滑 —— 因为用户的适应速度超过了模型的更迭速度。本文将探讨如何监测输入偏移、对指标进行分群拆解,并根据用户习惯化的周期来更新评估集。
在你的智能体能够自我重试之前,精确一次性处理(Exactly-Once)曾是一件难事
幂等键(Idempotency keys)假设调用者会逐字节重复其请求。而智能体(Agent)在重试时可能会转述自己的请求,这打破了该假设。本文将介绍如何构建工具级的去重机制,使其在调用者是语言模型的情况下依然有效。
模型崩溃始于你自己的数据湖
记录的 LLM 输出悄然成为了下个季度的训练数据。本文探讨模型崩溃是如何在你自己的数据湖中发生的,以及如何通过溯源标记、隔离区和尾部评估(tail evals)来打破这一反馈循环。
当时钟成为工具:Agent、时区以及那个只在午夜发生的 Bug
LLM 没有内部时钟,因此 Agent 会自信地漂移到过时的时间上——这表现为错过的任务调度、错误的时区计算以及破坏缓存的时间戳。本文将介绍如何将当前时刻作为基础设施来提供。
康威定律正在影响你的智能体集群
你的多智能体拓扑默认会复制你的组织架构——包括信息孤岛、有损交接和中心瓶颈。本文将探讨这种耦合何时会变成缺陷,以及如何根据问题本身来划定智能体边界。
零温度并非确定性:复现那些你无法重新运行的事故
将温度设置为零会强制执行贪婪解码,但这并不能使 LLM 推理具有可复现性。导致 Token 发生跳变的并不是采样器,而是与 Batch 相关的 GPU 数值计算 —— 本文将介绍如何为你无法重新运行的实例构建事故后分析。
评估背后的隐藏运营组织:标注者经济学
每一个评估分数都继承了你未曾预算的人工标注流程质量。了解标注者经济学、吞吐量驱动的质量衰减以及 LLM 评审如何塑造你交付的各项指标。
赔偿缺口:当你的智能体执行了不可逆操作,谁的预算来买单?
一个自主智能体造成的损失可能比你的供应商责任上限高出许多倍,而 2026 年的保险除外条款正在关闭最后的防线。本文将介绍如何在事故发生前,将自主权转化为一项明码标价的支出决策。
当流式 Token 遇到屏幕阅读器:生成式 UI 的无障碍债
将流式 Token 注入 aria-live 区域是编写最简单的代码行,却是最难解决的无障碍缺陷。本文探讨了生成式 UI 是如何积累无障碍债的,以及如何通过架构设计来避免它。