在某处,此时此刻,一个 AI 助手正在向潜在客户解释你的产品。它引用的价格是你 18 个月前修改过的,推荐的集成是你上个季度停止支持的,并建议一个返回 410 Gone 的 API 端点。你永远不会看到这段对话。没有分析事件被触发。没有会话录像。潜在客户要么相信了错误答案并提交了一份困惑的支持工单,要么相信了错误答案,转而悄悄购买了模型随口提到的竞争对手的产品。
这不是一个假设的未来问题。AI 推荐已经占据了可观的流量 —— 对于某些技术和电子商务网站,这一比例高达 5–8% —— 而这些推荐背后的答案,是模型在任何时候吸收的关于你的任何信息生成的。你的营销团队花了十年时间学习如何监控品牌搜索、评论网站和社交媒体提及。几乎没有人正在监控增长最快的表面:当有人询问关于你的信息时,模型是怎么说的。
令人不安的框架是:模型是一个你从未雇用、从未培训且无法解雇的销售代表和支持代理。它在每个时区工作,即时回答,并且以十足的信心说话。你唯一拥有的杠杆就是它阅读的内容。
没人配置的分销渠道
这种规模悄然而至。ChatGPT 的网页流量在 2024 年 9 月至 2026 年 3 月期间增长了 84%,Gemini 增长了大约九倍,引流组合迅速碎片化 —— ChatGPT 在可衡量的 B2B AI 推荐流量中的占比从 89% 下降到约 63%,Claude、Gemini 和 Perplexity 瓜分了其余部分。在 2026 年 5 月,ChatGPT 开始直接在回答中显示可点击的品牌链接,对于许多品牌来说,来自 AI 的首页推荐几乎在一夜之间成为了其 AI 流量的大部分。
与 Google 相比,流量数字看起来仍然很小 —— 对于大多数网站,AI 推荐约占总流量的 0.1% 到 2.8%。但有两个特性使其变得异常重要。首先,这些流量的转化率异常之高,因为从 AI 答案而来的用户已经被“推销”过了:模型在用户点击之前就已经总结了你的功能,将你与替代方案进行了对比,并给出了建议。其次,更重要的是,推荐是一个巨大的隐形主体中可见的尾部。对于每一个点击进入的用户,还有更多人只是接受了模型的总结,根本没有访问网站。答案就是 交互。
这第二个特性才是你应该担心的。当模型错误地描述你的定价时,没有跳出率可以观察,没有会话可以重放。错误分布在数百万次私密对话中,浮出水面的唯一症状都在下游,且难以归因:支持工单引用了你没有的功能,潜在客户拿你从未公布过的价格进行谈判,开发者针对你多年前弃用的端点提交 Bug。
错误答案非常具体,有些甚至很危险
人们很容易将其归类为通用的“幻觉”(hallucination)忧虑。但现实更加具体。失败模式呈现出特定的模式,其中一些具有安全后果。
最常见的类别是将过时信息当作事实呈现 。模型是在快照上训练的。你当前的定价页面、重新命名的产品层级、新的速率限制 —— 在重新训练过程或检索步骤获取之前,基础权重中都不存在这些。模型不会说“截至我上次更新”;它会将 2024 年的价格陈述为当前价格。
第二个类别是看似合理的伪造 。USENIX Security 2025 发表的研究测试了 16 个模型在 576,000 个代码示例中的表现,发现幻觉产生的包名遵循可预测的模式:约 38% 是将两个真实事物混淆在一起,13% 是拼写变体,一半是纯粹的伪造。创造 express-mongoose 的相同生成习惯也会在你的 API 上创造出一个看起来完全符合你命名规范的端点。开发者信任它,因为它在风格上 是正确的。
第三个类别则开始变得充满敌意。攻击者注意到模型会持续产生幻觉,而一致性是可以利用的。Slopsquatting —— 注册模型倾向于发明的包名,然后加载凭据窃取程序 —— 是一种活跃的攻击模式。安全研究人员在域名上也记录了同样的技术:模型为真实品牌生成虚假但看似合理的 Web 门户和 API 主机名,而攻击者注册了这些域名。你的品牌产生的幻觉表面积现在是你攻击面的一部分,而你并没有划定那个边界。
在这一切之下,法律底线也正在形成。当 Air Canada 自己的聊天机器人发明了一项丧假退款政策时,不列颠哥伦比亚省的一个法庭拒绝了航空公司关于机器人是独立实体的辩解,并判定公司对其言论负责。这一先例涵盖了你的第一方机器人。第三方助手则更加模糊 —— 你不对 ChatGPT 关于你的言论负法律责任 —— 但商业损害并不在乎责任归属。一笔丢掉的交易无论如何都是丢了,而且对于第三方模型,你甚至没有修复机器人的选项。你只能修复它阅读的内容。
将模型回答视为受监控的表面
运营层面的做法是,将“模型如何评价我们”视作与品牌搜索排名或状态页可用率(uptime)完全一样的存在:一个拥有负责人、基准线和警报机制的监控面。
方法论上的陷阱是将单一的回答视为真相。模型的回答是非确定性的——同一个提示词在不同的会话、表述方式和日期下会产生不同的响应。此外,针对 AI 引用的研究发现,模型引用的来源中有 40–60% 每月都会发生变化。ChatGPT 弄错你产品价格的一张截图只是个案。你真正需要的是分布数据。
在实践中,一个可行的监控闭环如下:
构建提示词集(Prompt Panel)。 准备 100–200 个真实用户会问的问题——“X 的价格是多少”、“X 对比 Y”、“如何调用 X 的 API 进行身份验证”、“X 是否支持 SSO”。这个提示词集是你计算每个指标的分母,因此要根据真实的工单和销售电话来设计,而不是根据你希望人们问的问题来设计。
进行抽样,而非随机抽查。 每周在对你的市场有重要影响的助手(Assistant)上运行该提示词集,每个提示词运行多次采样。将结果视为带有误差棒(error bars)的分布,而非最终定论。
针对正确性评分,而不仅仅是存在感。 面向营销的“AI 品牌声量”工具大多只衡量你是否被提及。而在工程领域,相关的指标是模型所说的是否为 真 :价格是否正确、功能列表是否属实、没有失效的端点(endpoints)、没有在你的命名空间下臆造出包(packages)。
与基准事实(Ground Truth)比对并针对回归发告警。 你已经知道该怎么做了——这就是一个回归测试套件,只是被测系统变成了外部世界对你产品的模型认知。当提示词集中关于价格问题的错误率飙升时,这就是一次事故,需要配合相应的运维手册(runbook):找到模型正在读取的内容,并从上游进行修正。
最后一点是至关重要的心态转变。你无法为模型打补丁。每一次修复都是间接的——你改变数据源,然后等待检索或重新训练来察觉这些变化。这使得延迟成为了系统设计的一部分:你今天发布的修正可能需要数周时间才能传播到回答中,这正是为什么你需要持续的测量,而不是在客户把一个错误的回答粘贴到工单里之后才手忙脚乱地应对。
发布机器可理解的基准事实 如果唯一的杠杆是模型读取的内容,那么显而易见的问题就是发布什么以及如何发布。截至 2026 年中期,诚实的答案是分层处理,因为生态系统非常混乱。
从 llms.txt 开始——在你的域名根目录下放一个 Markdown 文件,为模型提供一份经过策划的高价值页面地图,以及一份简短的权威摘要。它的采用率是真实存在的,但仍属少数(在一次对 30 万个域名的抓取中,大约每 10 个站点中就有 1 个采用了它)。这里有一个诚实的警告:目前还没有主流 AI 平台承诺将其作为一级输入,也没有衡量证据表明它能提高 ChatGPT 或 Perplexity 当前回答界面中的引用率。它能产生显著效果的地方是编程智能体——当指向一个文档网站时,Cursor、Claude Code、Copilot 及其同行都会寻找 /llms.txt 和 /llms-full.txt。如果开发者是你的核心受众,那么投入一小时的工作就能获得真实的回报。只需将其视为一个层级,而非万能方案。
更重要的层级是文档本身的结构。模型提取答案,而提取过程奖励特定的形态:
答案优先。 在标题后的前 40–60 个单词中给出实际答案,然后再进行详细说明。模型在组织回答时会抓取开头;如果你的开头全是寒暄或废话,模型就会从更糟糕的地方摘抄内容。
统一的术语表。 模型产生困惑的地方与人类完全一致——即同一个功能在你的网站上有三个不同的名字。你自己文档中不一致的术语,会变成模型口中不一致的断言。
彻底关停页面,而非置之不理。 被弃用的端点应该有明确的、机器可解析的弃用通知——“此端点已在 v3 中移除;请使用 /v3/sessions”——而不是静默删除。删除一个页面会导致旧的训练数据成为唯一的来源。而一个声音响亮的“墓碑页面”则能为检索提供可引用的最新内容。
发布那些被错误引用的事实。 无论你的提示词集显示模型在哪些方面犯了错——价格、限制、支持的地区——这些正是值得拥有一个干净、结构化、可抓取页面的内容。你正在将修正案写入模型读取的记录中。
这背后还有一个更隐秘的工作流:审计当模型的信息来源 不是 你的官方网站时,它们是从哪里获取信息的。检索增强(RAG)的回答会引用第三方资源——对比帖子、Stack Overflow 线程、旧的 Reddit 讨论。如果关于“你产品价格”的最高频引用来源是一篇 2023 年的博文,那么再怎么润色 llms.txt 也无法修正回答。有时,杠杆率最高的修正工作是更新那个过时的第三方页面,或者在搜索排名上超越它。
你的文档团队现在正为两类受众写作 所有这一切都给文档团队带来了角色上的真正转变,而不仅仅是增加了一个清单项目。文档平台报告称,现在近一半的文档流量来自 AI 智能体,而非人类读者。文档不再仅仅是人类查阅的手册;它们是基准事实 API,每个助手、智能体和问答引擎都会针对你的产品对其进行查询。
事实证明,为这两类受众写作并不像听起来那么矛盾——精确性、一致的命名、明确的版本控制和答案优先的结构同样能造福人类读者。矛盾体现在优先级上。一个叙述优美的教程对模型错误引用你的频率限制毫无帮助;而一个枯燥的、结构化的频率限制页面却能奏效。文档团队现在需要来自提示词集的错误报告,就像他们一直处理读者的 bug 报告一样,“模型说错了话”需要被纳入文档积压工作中,并标注严重程度。
这个反馈闭环是值得内化的部分。今天的网页就是明天的训练数据。每一个月你任由错误答案不被修正,它就会在更多的对话中被引用,被抓取到更多的衍生内容中,并被更多的检索管线引用——其中每一项都会让错误答案在下一代模型中变得更加顽固。那些将模型回答视为受监控、受管控表面的团队正在积累准确性。而那些不这样做的团队,则是在积累别人对自己产品的盲目猜测。
本周就运行你自己的提示词集吧——用 20 个真实的客户问题去测试三个助手,只需一个下午。在你读完转录内容之前,你就能发布一项文档修复。
会员专享
余下内容仅对会员开放。 会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
— 完整文章,包含未公开存档的部分 — 可落地的工作框架,附带权衡与决策依据 — 新文章抢先看,先于公开发布 登录以继续阅读→ 随时取消 · 一次订阅,畅读全部