跳到主要内容

你的智能体读了页面。没人看到广告。

· 阅读需 11 分钟
Tian Pan
Software Engineer

互联网经济建立在一个极其古老以至于无人明说的假设之上:加载页面的那个东西长着眼睛。当人类到来,广告曝光触发,联盟营销 Cookie 植入,分析事件记录访问——这一连串微小的变现事件支撑着内容的产出。现在,这条链条的每一个环节都在同时断裂,因为你网站的读者中,机器人的比例正日益增长。它们是 Agent,而 Agent 是看不见广告的。它提取答案,将其交给别处的用户,除了日志行之外什么也没留下。

这并非一个你可以作为工程师在旁观望的遥远出版商问题。如果你正在构建任何基于检索(Retrieval)的东西——无论是 RAG 管道、浏览网页的 Agent,还是总结网络内容的产品——你正处于一个市场的需求侧,而该市场的供给侧刚刚发现自己一直在免费赠送库存。修正正在进行中,它背后有基础设施和标准支撑,并且它将作为一项新的成本支出和新的失败模式降临在你的架构上:上个季度还免费开放的上游资源,这个季度就变得需要付费、授权或直接关闭了。

汇率崩塌了

搜索抓取一直具有榨取性,但它附带一种返利:流量。爬虫读取你的页面几次,作为交换,搜索引擎会为你送来访问者,他们会看到你的广告并点击你的联盟链接。抓取推荐比(Crawl-to-refer ratio)——即每推荐一名访问者所抓取的页面数——是开放网络隐含的“汇率”,而在传统搜索时代,这个比例接近持平。

对于 AI 平台来说,那个汇率已经崩塌了三到五个数量级。Cloudflare 2025 年中期的网络数据显示,Anthropic 的爬虫每推荐一次访问,大约会抓取 70,900 次页面;OpenAI 的比例则在 1,000 比 1 左右。这些并不是噪点图中的异常值——它们是一个系统的结构性特征,该系统消费内容是为了合成答案,而不是为了路由访问者。

人类这一方的账本也正在以同样的速度流失:

  • 自动化请求在 2026 年占据了 Cloudflare 网络中 HTML 流量的 57% 以上——这是互联网历史上机器读者首次超过人类。
  • Google 的 AI Overviews 在汇总数据中导致出版商推荐流量下降了约 25%,而在随机实验中,当 AI 回答出现时,流出的有机点击减少了约 40%。
  • 出版商报告的流量损失在 20% 到 90% 之间,具体取决于他们对搜索的依赖程度,小型出版商受灾最重。

注意这对单位经济效益的影响。出版商的成本(托管、写作、编辑)没有改变。出版商的收入事件(曝光、点击、转化)需要人类留在页面上。Agent 流量驱动了成本,却产生了零收入。没有任何一家企业能在大多数需求都处于负毛利的情况下生存,这就是为什么供给侧现在正在做唯一理性的事情:重新定价。

Web 正在长出一层支付层

两年以来,出版商的反应一直是二元的——屏蔽或容忍。在新闻网站中,针对 AI 爬虫的 robots.txt 拒绝率已攀升至 80% 以上,而在被测量的域名中,近 89% 现在都拒绝 GPTBot。但 robots.txt 只是一个请求,而不是强制执行机制,大量流量会忽略它或不带标签地到达。因此,强制执行手段向下移动到了堆栈的 CDN 和 WAF 层,一旦你在网络层进行强制执行,你就可以做一些比屏蔽更有趣的事情:你可以收费。

这套机制分三波到来:

  • 按次抓取付费 (2025)。 Cloudflare 将 HTTP 402 ——自 20 世纪 90 年代以来预留给“需要付费”但从未被认真使用过的状态码——变成了一个工作的收费站。出版商设定每次抓取的单价;爬虫出示支付凭证,否则将被拦截。新域名的默认设置已从开放转向关闭。
  • 机器可读的授权 (2025 年底)。 简单授权协议(Really Simple Licensing, RSL)标准为出版商提供了一套 XML 词汇表,供 Agent 解析条款:署名后免费、按次抓取付费、按推理次数付费。一个仿照音乐界 ASCAP 模式建立的集体权利组织整合了小型出版商,使他们能够像大型出版商一样进行谈判。Reddit、Yahoo、Medium、Quora 和 O'Reilly 均在早期签约。
  • 按使用付费 (2026)。 最新的转变将补偿从抓取转移到了回答:当出版商的内容真正出现在 AI 回复中时,他们会获得报酬,并能获得关于哪些查询触发了内容以及使用了哪些片段的报告。从 2026 年 9 月 15 日开始,Cloudflare 的默认设置会拦截针对任何显示广告页面的训练和 Agent 爬虫——其逻辑简单粗暴但合理:广告是一个机器可读的信号,表明该页面是为人类的眼睛定价的。

在这些基础设施之上是直接授权市场。新闻集团(News Corp)与 OpenAI 的交易金额约为五年 2.5 亿美元。Reddit 每年分别从 Google 和 OpenAI 收取约 6,000 万至 7,000 万美元,且其新协议正趋向于基于使用量的动态定价,而非固定费用。已披露的出版商交易平均每年约为 2,400 万美元。在 2023 年还是免费抓取的内容,到 2026 年已变成了价值九位数的合同。

趋势已不可阻挡:Web 正在变得对机器按量计费。这不会是全球统一的,也不会一蹴而就,并且会有大量的执行漏洞——但默认规则正在从“除非被拦截否则开放”转向“除非获得授权否则计费”。

加载中…
References:Let's stay in touch and Follow me for more thoughts and updates