
Tian Pan
Software Engineer
崩溃是承重性的:大语言模型 (LLM) 的容错性如何掩盖了破碎的数据契约
流水线曾通过崩溃来强制执行数据契约。然而,作为消费者的 LLM 却能应对畸形的输入,从而将明显的故障转变为无声的质量下降 —— 本文将介绍如何通过验证门和金丝雀断言来恢复告警机制。
工程师离职,Agent 记忆也将随之消失
离职工程师个人的 CLAUDE.md、自定义技能和 Agent 记忆文件编码了数月以来关于代码库的隐性知识——而在他们离职的那天,这些都将荡然无存。本文探讨了为什么 Agent 配置正成为新的“影子知识”,以及如何在这些知识随人走掉之前,将其提升到团队拥有的代码库中。
内部容量市场:在团队间分配稀缺的推理资源
当多个团队共享同一个推理池时,一个团队的评估扫描(Eval Sweep)可能会使另一个团队的生产环境对话系统陷入饥饿。借鉴大型机分时系统和 Borg 的优先级波段:本文将探讨优先级层级、抢占、费用回填,以及团队在何时应当获得专用容量。
真正关键的 LLM 合同条款:企业级 AI 采购者的谈判清单
模型弃用通知、零数据保留、版权赔偿排除条款以及合同规定的速率限制 —— 这些是真正能为企业级 AI 采购者转嫁风险的 LLM 合同条款,也是供应商真正愿意谈判的筹码。
合并队列成了新的瓶颈
编程代理让你的 PR 数量翻了一番,但合并过程仍像是在为人类打字速度设计的队列中缓慢爬行。本文将探讨合并队列拥堵背后的容量计算逻辑、为什么不稳定测试会在代理规模下产生连锁反应,以及分层预合并/合并后测试如何恢复吞吐量。
模型 API 现已成为 Tier 0 级别。在状态页变红之前,请先设计好降级模式
模型 API 位于请求路径中,与数据库同等重要,但大多数灾备 (DR) 计划仍将其视为“锦上添花”。这份实用指南涵盖了降级模式 —— 缓存、前置版本、队列和诚实的停机 —— 以及在下一次供应商故障发生前需要做出的业务决策。
模型已经在直接与你的客户对话了
AI 助手正在那些你永远看不到的对话中引用你过时的报价、推荐已废弃的端点,甚至还在推销竞争对手。了解如何像对待生产环境一样监控模型的回答,并交付机器可读的真实源数据。
晨间审查队列:如何分流处理 Agent 八小时无人值守的工作成果
通宵编程 Agent 交给你的不只是完成的代码,而是一个分流处理难题。本文将探讨信任层级、来源回执、批量决策以及双轮分流机制,如何防止晨间审查队列成为你团队最大的时间黑洞。
思维的 p99:当模型决定你的请求耗时多久
推理模型使响应时间成为问题难度的函数,导致 p99 延迟激增至 p50 的 3-5 倍,超时调整也演变为成本问题。通过针对更小模型的对冲请求、按路由设置的推理开销上限以及感知难度的 SLO,可以将尾部延迟控制在合理范围内。
你的智能体幻觉出的软件包现在已存在 —— 而且它是恶意的
LLM 会反复幻觉出相同的虚假软件包名称 —— 43% 的名称在每次重新运行时都会重复出现 —— 而攻击者正在注册这些名称。本文探讨了为什么拥有安装权限的智能体会将幻觉演变为供应链攻击,为什么 Diff 审查无法捕捉此类问题,以及能够防御此类威胁的 lockfile、白名单和冷却期防御机制。
真正的后端是电子表格 —— 而你的智能体刚刚获得了写入权限
Excel 和 Google Sheets 承载了大多数公司的业务运营逻辑 —— 无类型、未测试、且缺乏审查 —— 而 AI 智能体现在正以机器速度向其中写入数据。通过保护区域、命名区域、公式差异对比以及迁移式写入,可以防止因公式被误覆盖而导致的业务决策失误。
重写现在变得廉价,但做对依然很难。
AI 编程智能体极大地降低了翻译遗留代码库的成本——但未记录的行为、数据迁移以及集成切换的成本依然如故。本文提供了一个框架,分析在“廉价翻译”时代,哪些重写工作真正变得可行。