每场关于 AI 功能的规划会议最终都会陷入同样的二元对立。一方想“直接套个 API”并在下个冲刺阶段发布。另一方则想“掌握模型”,以便公司掌控自己的命运。这种争论听起来很有战略意义,但实际上是一个分类错误。
“自研还是购买”将你的 AI 功能视为一个不可分割的整体,要么自研,要么购买。但 AI 功能并不是单一的事物。它是一个由至少五个不同层级组成的堆栈,每一层都有其自身的答案。如果团队将决策简化为一次掷硬币,几乎总是会掌握错误的层级并租用错误的层级,因为他们提出的问题无法区分这些层级之间的差异。
更好的问题不是“我们能做出来吗?”大多数东西你都能做出来。真正的问题是:如果竞争对手明天购买了完全相同的东西,哪一层会破坏我们的差异化? 这个问题会为你梳理出堆栈的优先级。
AI 功能的五个层级
拆解任何一个 AI 功能,你都会发现其底层大致相同的解剖结构:
模型 (The model) —— 进行推理的基础模型。GPT、Claude、Gemini,你托管的开源权重模型,或者是其中之一的微调版本。
检索 (Retrieval) —— 你在运行时输入给模型的数据:向量索引、知识库、支撑回答的文档和记录。
编排 (Orchestration) —— 控制流。提示词组装、工具调用、重试、多步智能体循环、模型间的路由。
评估 (Evals) —— 告诉你变更让产品变好还是变坏的测试套件:黄金数据集、评分细则、回归检查。
用户体验 (UX) —— 用户接触的界面。该功能如何收集意图、展示不确定性、允许用户纠正。
“构建 AI 功能”或“购买 AI 功能”是一个跨越所有五个层级的句子。这就像数据库团队在不说明是指存储引擎、模式(schema)、查询层还是仪表盘的情况下,争论“自研还是购买”一样毫无意义。只有当你针对每一层做出决策时,决策才变得可行 —— 而每一层得到的答案并不相同。
掌握模型很少能构建护城河
掌握模型的直觉最强烈,但也最常出错。这感觉像是最深的一层,因此也是最具防御性的一层。事实恰恰相反。
基础模型是堆栈中商品化速度最快的组件。多个实验室在重叠的时间线上发布前沿模型,价格每年大约下降一个数量级,而开源权重模型落后前沿模型的时间仅以月计,而非以年计。如果你的差异化在于“我们使用了一个好模型”,竞争对手只需看一眼定价页面就能抹平差距。投资人视角的测试很直白:如果前沿实验室明天发布了一个好 10 倍的模型,你的公司还有存在的理由吗?如果诚实的答案是否定的,那么模型从来都不是你的护城河。
微调是学习代价最高昂的地方。微调感觉像是私有的 —— 它是 你 的权重,基于 你 的数据训练。但微调是一个快照。它相对于起始的基础模型是冻结的。18 个月后,基础模型已经更新了两代,而你的微调现在变成了你独自维护的分支,在实验室免费改进的移动前沿之后缓慢漂移。你并没有建立护城河。你建立了一个维护负担,并将其称为护城河。
掌握模型在少数情况下是有意义的:严格的数据驻留或监管约束、API 确实无法满足的延迟或成本包络,或者领域与训练分布相距甚远,以至于没有通用模型能接近。除此之外,掌握模型意味着你要与每年投入数十亿美元的实验室赛跑。那不是护城河,那是跑步机。
掌握评估集和数据几乎总能构建护城河
现在看看每个人都视为“基础架构”的层级。你的评估集(eval set)是整个堆栈中最具防御性的资产,但大多数团队看不到它,因为它从未以功能的形式出现。
评估集是对你的特定产品而言什么是“好”的硬编码、可执行的定义。它是你在生产环境中发现的每一个边缘案例、客户遇到的每一个失败模式、你的领域专家做出的每一个微妙的质量判断并被转化为评分测试的积累。竞争对手可以在一个下午抄袭你的 UI,并调用和你一样的模型 API。但他们无法抄袭评估集,因为评估集是他们尚未遇到的问题的沉淀。
评估集也是让你 安全租用模型 的关键。当新模型发布时,没有评估集的团队会花两周时间凭感觉检查(vibe-checking)并争论不休。拥有真实评估集的团队会运行测试套件,读取评分差异,并在午餐前做出决定。掌握评估集能将商品化的模型层从风险转化为免费升级 —— 每一个前沿版本的发布都成为你可以放心采用的候选对象。
私有数据是评估集的双胞胎。持久的版本不是你授权过一次的静态转储;它是一个数据飞轮 (data flywheel) —— 一个闭环,在这个闭环中,使用产品会产生结构化的、私有的数据,这些数据会改进产品,从而吸引更多的使用。每个客户都以竞争对手无法购买的方式让下一个客户的体验变得更好,因为这些数据在你的用户于你的工作流中创建它们之前并不存在。静态数据是任何人都可以获取的库存。飞轮是速率,而速率具有复利效应。
因此,这种模式颠覆了直觉。感觉最深的层级 —— 模型 —— 应该是租用的。感觉像是开销的层级 —— 评估和私有数据循环 —— 才是应该双手掌握的。
租用是一场赌注,而非投降 选择租用某一层的团队通常表现得好像决策已经结束了。其实不然。租用模型是一场动态的赌注,而且这个赌注非常具体:前沿模型的进步速度将超过我们团队改进自有版本的能力。
对于 2026 年的模型层来说,这笔赌注几乎是稳赚不赔的买卖。各大实验室投入的资本是你永远无法企及的,而你只需修改配置中的一个字符串,就能收获所有的改进。你不是在投降 —— 你是在订阅别人的研发预算。
但“租用它”并不等同于“草率地租用”。你租用的方式决定了你是否还能改变主意。厂商依赖 (你可以通过可控的努力切换掉)与锁定 (切换成本或风险高到让你实际上无法切换)之间存在本质区别。租用模型应该让你产生依赖。但它往往会演变成锁定,而团队甚至没有意识到自己何时越过了那条界线。
防御措施在架构上是廉价的,只要你尽早实施。保持一个模型抽象层 :一个表达你所需能力的稳定内部接口 —— 如“总结这段文字”、“提取这些字段”、“决定下一步操作” —— 而不依赖于具体的供应商。当你想要评估替代方案或进行迁移时,你改变的是底层的线路,而不是接口。跳过这一步的团队会将原始的厂商 SDK 调用和特定供应商的提示词技巧散布在数百个文件中,一个六个月前的“租用”决策就这样悄无声息地硬化成了没人投票支持的“自研”决策。
其实,真正让人痛苦的锁定很少发生在模型 API 上。它通常发生在编排层 —— 即积累的智能体记忆、工具配置、升级路径以及无法通过更换端点来迁移的组织上下文。这就是为什么编排层也需要一个深思熟虑的答案:大胆租用模型,但在让供应商拥有包裹模型的有状态控制流之前,请三思。
一个真正能理清技术栈的决策框架 用这三个问题取代“自研还是购买”的硬币投掷,逐层提问:
1. 如果竞争对手明天买了同样的东西,会发生什么损失? 如果没有任何损失 —— 他们仍然无法赶上你 —— 那么这一层就是通用品。租用它,并租用最好的版本。这几乎总是模型层。如果你的差异化 被打破了,那么这一层就是你的护城河。自研它,为它配备人员,并将其视为核心。这几乎总是评估系统 (Evals) 加上私有数据闭环。
2. 这一层的商品化速度是否快于我们的改进速度? 如果外部投资让这一层变得更强、更快,超过了你团队的能力,那么租用就是一种进取的策略 —— 你正在利用别人的投入产生复利。如果这一层只有在你 改进它时才会变好,那么拥有它就是让它变强的唯一途径。
3. 如果我们租用这个,退出时是产生依赖还是锁定? 一个你可以在一个迭代周期 (Sprint) 内离开的层级是可以安全租用的。一个需要两个季度才能离开的层级,实际上就是你在“构建”的东西 —— 所以要么现在就通过抽象边界规划好退出路径,要么有意识地做出自研决策,而不是等到以后才发现。
将一个典型的 AI 功能代入这个框架,技术栈就会被清晰地梳理出来。模型:租用,置于抽象层之后。检索基础设施:租用向量数据库,拥有语料库和分块决策。编排:谨慎租用框架,拥有控制逻辑和状态。评估系统:始终自研。用户体验 (UX) 和私有数据闭环:自研,因为那是护城河真正存在的地方。
注意发生了什么。并没有一个单一的“自研还是购买”的答案,因为从来就没有单一的事情需要决定。原始的问题并不难 —— 它是定义错了。你不是在自研或 购买一个 AI 功能。你自研那两个会产生复利的层级,租用那三个会走向商品化的层级,并在它们之间保持足够的架构接缝,以便明年的前沿模型能像升级一样接入,而不是一场痛苦的迁移。以这种方式构建决策,它就不再是一场争论,而变成了一份清单。
会员专享
余下内容仅对会员开放。 会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
— 完整文章,包含未公开存档的部分 — 可落地的工作框架,附带权衡与决策依据 — 新文章抢先看,先于公开发布 登录以继续阅读→ 随时取消 · 一次订阅,畅读全部