
Tian Pan
Software Engineer
你雇用的 ML 工程师并非你所需的 AI 工程师
从你的 ML 团队中抽调人手组建 AI 产品团队是今年最常见的组织架构错误。训练模型的技能与在他人模型之上构建可靠系统的技能几乎没有交集 —— 本文将揭示职级体系中尚未标明的角色分工,以及你真正需要筛选的能力。
你的 Token 夜宿何方:LLM API 调用的数据驻留
在欧盟地区托管 LLM 推理并不等同于让你的提示词脱离外国司法管辖。这是一份关于数据驻留、CLOUD 法案以及故障关闭型网关架构的实践指南。
3% 的回归不会让报警器响起:应对统计性故障的轮值工作
传统的轮值工作能够捕获系统崩溃和延迟激增。但真正损害 AI 产品的是那些悄无声息的 3% 质量下降,任何阈值都不会被触发。本文将介绍如何为统计性故障构建告警机制。
GPU 调度是一个排队问题,而不是资源配置问题
LLM 终端响应慢通常是排队失败,而非硬件短缺。了解连续批处理、KV 缓存限制以及 Prefill/Decode 调度如何决定你的尾部延迟 —— 以及为什么增加 GPU 无法解决此问题。
Token 预算是变相的人员编制决策
关于 Prompt 消耗多少 Token 的每一个选择,本质上都是在工程师时间、支持压力和基础设施成本之间进行隐形博弈。本文提供了一个框架,旨在让这种权衡显性化,而非任其随时间累积。
你的 AI 路线图需要一个“停用”列
只管发布的路线图会在 AI 系统中悄悄积累负债,因为模型、提示词和评估集会按照你无法控制的节奏腐化。请添加一个“停用”列,并将功能下线视为一等交付物。
你无法修改的产品策略:模型提供商的安全过滤器
你的 LLM 提供商的安全过滤器是由从未见过你用户的人编写的产品策略。过度拒绝、悄无声息的策略更新以及统一的审核标准正如何侵蚀专业领域的 AI 产品——以及你该如何通过工程手段夺回控制权。
自研还是采购的界限已然改变:当供应商原语吞噬你的基础设施时,如何抉择 AI 功能
供应商 API 正在不断吸收你曾经需要自建的检索、记忆和结构化输出层。本文提供了一个四象限框架,用于决定哪些该自研,哪些该租用,以及你真正的护城河究竟在哪里。
从 Demo 到生产环境的“税收”:原型隐藏了 90% 的 AI 开发工作
那个令全场惊叹的 AI demo 只完成了 10% 的工作。剩下的 90% —— 评估、护栏、可观测性、成本控制、回退路径 —— 正是导致 88% 的试点项目在上线前夭折的“税收”。
租赁智能:CFO 的 LLM 支出心理模型
Token 支出表现得更像销售成本(COGS)而非研发费用(R&D)——将随用量扩大的成本当做固定成本来定价,正是让财务团队措手不及的原因。本文提供了一个预测 LLM 支出、识别利润陷阱并决定何时“租赁智能”才划算的实用模型。
这场本该成为评测 (Eval) 的会议
“模型是否足够好?”的争论之所以反复出现且无法达成一致,是因为团队在依靠轶事案例进行争辩。本文将介绍如何将这种主观的发布争议转化为一套全团队共同遵守的常设离线指标。
资历倒置:为什么当 Agent 加速时,你的资深工程师反而变慢了
Agent 让代码生成变得廉价,却让审查变得昂贵。成本落在了唯一无法扩展的资源上:资深工程师的判断力。本文探讨了负载为何会向他们集中,以及如何重新平衡。