我最近交流过的一个团队向一家财富 500 强公司的内部法务办公室出售了他们的法律 AI 产品,并在系统提示词中增加了一行:“每一个事实性陈述必须包含对检索源的内联引用。”产品路线图为这种新行为分配了 5% 的 Token 预算缓冲。在该受监管租户上线 60 天后,财务部门标记了每月推理支出激增了 34%。没有人搞坏产品。没有人发布新功能。这项促成交易的合规要求,也悄然改写了其背后的单位经济效益。
这就是检索引用税,几乎每个服务于受监管行业——法律、医疗、金融、有审计约束的企业——的 RAG 系统最终都要支付这笔费用。这笔税收是结构性的,而不是 Bug。它源于引用纪律迫使模型进入了一种不同的生成模式,而且它在客户签署的采购规范中无处可寻。
如果你只盯着每个 Token 的价格,你就会完全错过它。模型并没有变得更贵。提示词变贵了,输出变贵了,检索集也变贵了,这一切同时发生,因为要求“标明出处”并不是一个 UX 开关——它是推理管道中三个不同部分的乘数。
为什么“引用你的来源”是一种生成模式,而不是一条指令
当你告诉模型引用时,四个方面会同时发生变化,而只有第一个是显而易见的。
输出变得更长。 带引用的生成用改写替代了自信的总结。原本会写“该计划要求住院治疗需预先授权”的模型,现在会写“根据计划文档第 4.2 节 [doc-127:p14],住院治疗需要预先授权,在 §4.2.1 中被定义为超过 23 小时的留宿 [doc-127:p15]。”事实内容相同,大约是输出 Token 的 2.4 倍。这是所有人首先看到的成本项,因为输出 Token 通常按最高费率计费。
检索到的分块实际上出现了两次。 一次出现在提示词的检索块中,另一次——经过改写——出现在响应中。模型无法在不引用或近乎引用的情况下引用一个分块,因为引用必须在下游是可验证的。因此,检索到的上下文变成了输出的部分模板,而不仅仅是背景依据。在强制引用模式下的生产系统 Token 经济学研究表明,这种重复开销占总响应长度的 15–25%。
检索数量 K 值上升。 没有引用时,你可以追求精确度:检索 5 个分块,希望前两个能回答问题。有了引用,遗漏一个相关的分块意味着模型要么引用错误的来源,要么对自己无法证实的陈述含糊其辞,而审计审查员会标记这一点。因此,团队会悄悄将 K 从 5 提高到 10 甚至 15,使检索块增加一倍或两倍。检索账单(向量数据库、重排序 pass、检索分块本身的提示词输入 Token)随 K 扩展,而不是随答案。
注意力变得分散。 随着检索集变大,模型的注意力必须在每个陈述上覆盖更多范围。一些团队通过在系统提示词中增加“彻底引用每一个陈述”的强化要求来补偿,这进一步拉长了响应。Anthropic 和 Contextual AI 在过去两年的落地性 (groundedness) 研究表明,这是一种真实的权衡:更严格的落地约束使知识密集型任务的响应长度增加 20–40%,这甚至还没算上显式的引用标记。
将这些累加起来,你得到的不是 5% 的开销。你会得到输入 Token 的乘数(更大的 K)、输出 Token 更大的乘数(改写 + 规避 + 引用标记),以及推理前工作的微小但真实的增长。25–40% 的生产账单跳升是典型的落地情况。在某些受监管的工作负载中——如案例法研究、医疗索赔裁定、审计追踪重建——一旦你开启了采购要求的严格落地模式下的引用功能,费用会增加 50% 甚至更多。
无人定价的引用质量问题
这里的关键在于,引用税是结构性的,而不是通过提示词工程就能解决的:引用本身往往是错误的,而发现错误又需要另一轮推理成本。
过去一年对法律和医疗 RAG 的研究收敛到了一个令人不安的数字——大约 50% 到 90% 的 LLM 生成的引用并不能完全支持它们所附带的陈述。LegalBench-RAG 是法律领域最常被引用的评估基准,它显示商业平台表现挣扎:Westlaw AI 的引用准确率为 58%,Lexis+ AI 为 64%,即使是专门构建的研究助手,最高也只能达到 80% 左右。引用错误的陈述比没有引用更糟糕,因为引用创造了一种可验证的假象,未经核对的用户会信任它。
因此,要求引用的合规计划也要求引用精度的评估,这意味着需要重新运行模型(通常是一个更强大的模型)作为评判者,以验证每个引用是否真的支持其陈述。那是每个响应的又一次推理过程,而且在评判者不同意的 20–40% 的响应中,还要加上一次重新生成的 pass。“可验证答案”的 SLA 实际上为你每次高风险响应开出了三次模型调用的账单:生成、验证、修复。
将引用定价为系统提示词附加项的团队会在生产环境中发现这一点。而将其定价为结构性成本的团队,从第一天起就将其构建在产品层级中。
当团队认真对待这项纪律时,它是怎样的 我所见过的那些成功度过受监管租户转型期且没有耗尽利润空间的团队,在四个方面做得与众不同。
他们衡量的是“单次经核实的回答的引用成本”,而不是“单次调用的成本”。 有趣的 SLI(服务水平指标)不是“一次响应的成本”,而是“一次能通过审计审查的响应的成本”。这个数字包括了验证环节、被标记响应的重新生成率,以及人工审核的抽样开销。一旦掌握了这个数字,正确的成本削减杠杆就会变得显而易见:并不总是切换到更小的模型。有时是更优的检索器 (retriever),有时是更紧凑的分块 (chunking) 策略,有时是二次处理的引用附加器 (citation appender)(下文详述)。
他们运行一个包含三个分支的引用模式 A/B 测试。 开启引用、关闭引用和轻量引用(仅针对高风险主张提供引用,由关键词分类器或底层断言的置信度阈值定义)。第三分支通常是单体经济效益 (unit-economics) 的赢家,因为典型受监管响应中的大多数内容实际上并不需要来源归属——比如样板化的解释、过渡句或对用户问题的复述。我合作过的一个团队通过对主张类型进行分类,并仅对与审计相关的主张进行引用,将引用强制产生的 token 减少了 38%,且合规团队的接受度评分没有出现可衡量的下降。
他们将引用精准率 (precision) 和召回率 (recall) 指标扩展到评估集 (eval set) 中。 引用精准率是指“在模型生成的引用中,有多少真正支持了该主张”。引用召回率是指“在需要引用的主张中,有多少得到了引用”。大多数团队这两者都不衡量,最终只优化了事实准确性(回答是否说了真话),而引用纪律却在无声无息地腐烂。这种评估扩展是一次性投资,具有永久性的杠杆作用——一旦评估集中有了引用精准率,你就可以在对受监管买家真正重要的维度上,比较提示词变体、检索器和重排序器 (reranker)。
他们在价格模型中明确地将引用划分为不同的等级。 合规租户的 SKU(库存单位)包含引用纪律,单次查询成本更高,并作为不同的产品销售。非受监管租户的 SKU 默认为关闭引用,并享受更低的价格。试图将成本差异隐藏在单一 SKU 中,会让非受监管租户为他们并不看重的合规开销买单,同时向受监管租户收取的费用低于该功能的实际运行成本。
能挽回大部分成本的两阶段策略 最有趣的架构举措是将回答与引用解耦。大多数 RAG 系统都在一个环节中完成:检索、生成带引用的内容、返回。这会将回答质量与引用纪律耦合在一起,导致两者都变差。
两阶段设计首先生成一个干净、精简的回答(没有引用开销),然后运行一个更小、更廉价的第二阶段,接收回答和检索到的块 (chunks),并生成引用映射 (citation map)——即哪些句子引用了哪些块。第一阶段优化回答质量。第二阶段优化引用精准率。它们使用不同的模型、不同的提示词和不同的评估标准。
成本结构随之改变。不再是对每个响应增加 30% 的固定乘数,而是获得一个干净的基准,加上一个有边界的引用附加步骤,你可以将其路由到 Haiku 级别的模型。在我见过的部署中,这在不损失引用精准率的情况下,将引用强制产生的开销从 30% 左右降低到了 8–12% 的范围。这个提升是实实在在的,但它要求团队不再把“引用你的来源”仅仅看作是一个系统提示词,而是将其作为一个拥有独立评估体系的单独流水线阶段。
还有一种值得了解的流式变体——token 级的引用流,其中第二阶段的引用映射与回答流同时发出,以便 UI 可以逐步渲染引用链接。这增加了追踪模式 (trace schema) 的复杂性(你现在有两个需要在可观测性工具中对齐的输出流),但它保留了单阶段生成的延迟特性,而这正是大多数产品团队反对两阶段方案的实际理由。
财务部门忽略的成本框架 如果你从这篇文章中只记住一件事,那就是:引用纪律不是一个功能开关 (feature flag)。它是推理流水线的结构性变化,必须计入受监管租户 SKU 的单体经济中,独立于模型的费率卡 (rate card)。
促成你受监管交易的采购对话可能是这样的:“我们需要对每个主张进行引用、检索的审计追踪,以及在低置信度回答时拒绝回答。”你的销售团队答应了,因为模型可以做到这一切。模型确实可以。但它随后发出的账单并不是费率卡上的金额。它是费率卡乘以一个结构性系数,该系数取决于 K 值、输出长度分布、验证环节频率,以及客户评审人员对“每个主张”解读的严苛程度。
那些按 token 费率和检索数据库成本来为 RAG 定价的架构师,是在为便宜的部分定价。而那些按最高合规等级的“单次经核实的回答的成本”来定价的架构师,则是在为决定合同是否盈利的部分定价。这两个数字之间的差距——通常是 2 到 3 倍——就是以美元形式表现的“引用税”。那些仅通过添加系统提示词来交付引用的团队,会在受监管产品发布两个季度后的损益 (P&L) 审查中发现这个缺口,且除了重新设计流水线外,没有明显的补救杠杆。
未来的做法是将“出示你的来源”视为一项具有承重作用的架构承诺,拥有自己的路线图、评估套件和成本模型中的独立条目。做到这一点的团队,明年仍能以稳健的利润率向医疗和法律行业销售产品。而没做到的团队,虽然会继续拿到受监管的订单,却只能用业务的其他部分来默默提供补贴。
会员专享
余下内容仅对会员开放。 会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
— 完整文章,包含未公开存档的部分 — 可落地的工作框架,附带权衡与决策依据 — 新文章抢先看,先于公开发布 登录以继续阅读→ 随时取消 · 一次订阅,畅读全部