200 Token 的系统提示词如何击败你的 4000 Token 提示词
冗长的系统提示词因不断堆砌而增长,并通过注意力稀释、指令魔咒和逻辑矛盾悄然降低输出质量。本文介绍了如何通过压缩原则,让一个 200 Token 的提示词在评分上超越 4000 Token 的提示词。
AI 旁观者效应:为什么五支团队协作发布却交付了无人问津的评估套件
AI 功能的失败与旁观者未能拨打 911 的原因如出一辙 —— 并不是因为没人注意到,而是因为每个人都认为别人会负责。为什么指定唯一的输出质量负责人 (DRI) 是唯一可扩展的解决方案。
AI 功能的 Bug Bash:分布采样,而非猎捕缺陷
为什么传统的 Bug Bash 流程在具有随机性的 AI 功能上会失效,以及如何将其重新设计为一种产生评估(evals)而非轶闻的采样过程。
蒸馏是一个产品决策,而非研究产物
蒸馏是一个关于你牺牲哪些能力以解锁成本底线和延迟底线的产品决策 —— 而不是研究团队的优化。一个前沿模型功能及其蒸馏变体是两个产品,而不是一个产品的两种实现。
Eval-as-Code:当你的发布门禁只是某人笔记本电脑上的一个 Notebook
决定你的模型是否发布的数字竟然存在于某人笔记本电脑上的一个 Notebook 中。你应该像对待生产系统一样对待评测套件 —— 对其进行版本化、设置准入规则并提供 SLO。
人格叠加(Persona Overlays):当一个智能体需要为不同客户群提供多种声音时
为跨群组的客户群发布单一的智能体人格正在悄无声息地消耗你的续订率。解决方案是叠加(overlays)而非分支(forks)——以及能够捕捉到被聚合评分所掩盖的性能倒退的切片级评估。
AI 功能的 PRD:为什么你的旧模板会让你在悬崖边失足
确定性的 PRD 缺乏对模型错误、发布评估门槛或系统提示词所有权的定义。这四个章节将为你解决这些问题。
静默量化:为什么你今天付费的模型不再是上个季度购买的那个
随着推理经济效益的收紧,供应商在相同的模型名称下悄悄切换到了精度更低、成本更廉价的层级。本文将探讨为什么版本字符串不再是一份契约,以及用来替代它的探测集、路由层和 SLA 条款。
当你的模型具有随机性时,快照测试在撒谎
快照测试假设相同的输入加上相同的代码等于相同的输出。一旦 LLM 调用进入循环,这一契约就会失效,测试套件也会悄然变成一种走过场的“橡皮图章”。本文介绍了取代它的测试分类法。
为什么每周会话记录审查优于你的 AI 仪表板
每周花一小时阅读生产环境的会话记录,可以发现提示词漂移、未分类的意图以及被仪表板平均值掩盖的敷衍措辞。本文将介绍如何主持会议、参会人员、采样方法,以及使其可持续发展的隐私规范。
澄清预算:你的智能体何时应该询问而非猜测
大多数智能体要么过度询问让用户精疲力竭,要么过度猜测并失去信任。解决方法是建立基于任务的澄清预算,并增加一个模型在结构上无法独自承担的策略层。
将 Eval 作为 Pull Request 评论而非任务:在代码审查中嵌入 LLM 质量门禁
为什么只有当 LLM 评估(evals)存在于 diff 旁边的 PR 评论中时,才能有效捕捉回归。借鉴代码覆盖率如何从夜间任务迁移到内联审查界面的经验 —— 以及将“评估即任务”转变为“评估即合并门禁”的四个工程关键点。