对于你的 AI 功能,“自研还是购买” 是个错误的问题
一个 AI 功能是一个包含五个层级的技术栈,而不是一件可以简单制作或购买的单一事物。真正重要的决策是:哪个层级能累积你的差异化优势,而哪个层级又是竞争对手可以轻易买到的。
AI 功能规格说明书中无人提及的碳排放项
每一场 AI 功能评审都在争论延迟、Token 成本和准确率——却唯独没人讨论能耗。本文将介绍如何衡量单次请求的碳排放,并将其转化为团队需要负责的关键指标。
CFO 在电子表格上看不见的评测预算
评测投资像测试套件一样具有复利效应,但它在账面上表现为没有收入项的成本 —— 因此在与带有演示的新功能竞争优先级时总是落败。以下是如何让其反事实价值在财务部门眼中变得清晰可见。
为尚未建立职业阶梯的 AI 岗位招聘人才
“评估工程师”(eval engineer)这个头衔在两年前还不存在,因此没有职级标准,也没有完全匹配的简历。围绕真实的失败案例来定义岗位,筛选候选人的判断力而非工具使用能力,从 QA 和平台工程团队进行侧向招聘,并在发出录取通知前先写好职级阶梯。
故障复盘:根本原因竟是一个无人负责的提示词
一次生产事故追溯到了几周前修改的一个系统提示词(Prompt),由于当时没有 PR、没有审核人、也没有负责人。本文探讨了为什么提示词总是能绕过变更管理,以及如何在不降低迭代速度的前提下,将它们重新纳入审核流程。
Token 预算是产品决策,而非配置值
设置上下文窗口分配(历史记录 vs 检索结果 vs 工具输出)的那行代码,是隐藏在 f-string 中的产品决策。本文将介绍如何将其显性化、衡量它,并为其指定负责人。
你的语音智能体将每一个转录错误都视为事实
语音识别器返回的是猜测,但在移交给语言模型时,它们被重新标记为了事实。本文探讨如何保留 ASR 的不确定性,并设计在执行操作前进行确认的语音智能体。
你从未构建过的智能体反馈闭环
每一个点踩、每一次无声的放弃、每一次重新表述的问题,都是一个免费的带标签失败案例 —— 而大多数团队却将其丢弃。本文介绍如何构建从用户信号到分诊失败再到永久评估案例的流水线。
为什么你不能用单一数字来估算 AI 功能的预算
AI 智能体的单次请求成本是一个肥尾分布,而非一个固定数字。本文探讨了为什么平均单位成本会使预测和定价失效,以及你应该报告哪些指标 —— p50 、 p99 、 尾部支出和多租户成本归属。
当候选人使用智能体时,编程面试衡量的是什么
当每一位工程师都开始与智能体协作时,独立产出代码的能力已不再能预测其在职表现。本文将探讨编程面试应该衡量什么,以及为什么禁止或随意允许使用智能体都会破坏面试信号。
那些在悄无声息中重新排列你整个语料库的嵌入模型升级
将你的嵌入模型更换为基准测试更高的模型会使你存储的每一个向量失效。本文探讨了为什么升级会悄悄降低检索质量,以及如何像处理数据库 Schema 变更一样进行迁移。
那些在你没留意时变简单的评估集
一个全员通过的 LLM 评估套件已经失去了衡量意义。探讨为什么静态评估集会趋于饱和、如何识别这一现象,以及如何保持有效的评分梯度。