你的内部平台的新首要客户是 AI Agent
AI Agent 正在成为内部 API 的主要消费者,且它们出错的方式与人类完全不同。如何为那些无法阅读文档或提交工单的客户设计工具。
速度幻象:为什么 AI 团队提交了更多 PR,但价值交付却变慢了
AI 编程工具推高了 PR 数量和提交频率,但端到端的交付周期却停滞不前。本文将探讨为什么活动与结果会脱节,以及哪些指标能揭示这种减速。
双速路线图:当模型基准每季度都在移动时如何规划 AI 功能
前沿模型现在大约每四周发布一次,直接让你上季度开发的临时方案失效。你应该将路线图拆分为:哪些功能会随着模型改进而产生复利,哪些功能会被淘汰,并按照各自的速度进行规划。
你不是选择了一个模型,而是和它结婚了:无人预估的提示词级锁定
更换你的 LLM 端点只需要一行配置;但让你的提示词在新模型上生效则需要一个你未曾预料的季度。本文探讨提示词级锁定是如何累积的,以及在被迫支付代价之前,如何衡量真实的迁移成本。
GPU 调度是一个排队问题,而不是资源配置问题
LLM 终端响应慢通常是排队失败,而非硬件短缺。了解连续批处理、KV 缓存限制以及 Prefill/Decode 调度如何决定你的尾部延迟 —— 以及为什么增加 GPU 无法解决此问题。
你的 AI 路线图需要一个“停用”列
只管发布的路线图会在 AI 系统中悄悄积累负债,因为模型、提示词和评估集会按照你无法控制的节奏腐化。请添加一个“停用”列,并将功能下线视为一等交付物。
你无法修改的产品策略:模型提供商的安全过滤器
你的 LLM 提供商的安全过滤器是由从未见过你用户的人编写的产品策略。过度拒绝、悄无声息的策略更新以及统一的审核标准正如何侵蚀专业领域的 AI 产品——以及你该如何通过工程手段夺回控制权。
从 Demo 到生产环境的“税收”:原型隐藏了 90% 的 AI 开发工作
那个令全场惊叹的 AI demo 只完成了 10% 的工作。剩下的 90% —— 评估、护栏、可观测性、成本控制、回退路径 —— 正是导致 88% 的试点项目在上线前夭折的“税收”。
租赁智能:CFO 的 LLM 支出心理模型
Token 支出表现得更像销售成本(COGS)而非研发费用(R&D)——将随用量扩大的成本当做固定成本来定价,正是让财务团队措手不及的原因。本文提供了一个预测 LLM 支出、识别利润陷阱并决定何时“租赁智能”才划算的实用模型。
这场本该成为评测 (Eval) 的会议
“模型是否足够好?”的争论之所以反复出现且无法达成一致,是因为团队在依靠轶事案例进行争辩。本文将介绍如何将这种主观的发布争议转化为一套全团队共同遵守的常设离线指标。
资历倒置:为什么当 Agent 加速时,你的资深工程师反而变慢了
Agent 让代码生成变得廉价,却让审查变得昂贵。成本落在了唯一无法扩展的资源上:资深工程师的判断力。本文探讨了负载为何会向他们集中,以及如何重新平衡。
那个因冗长输出比更佳答案更能触发点击处理器的 A/B 测试赢家
为什么基于参与度指标的提示词实验往往会发布更长的变体,以及在满意度下降迫使人们重新审视之前,如何识别那些将回复形式与回复质量脱钩的模式。