当 AI 爬虫比人类读者还多,网站开始给 AI 开小灶投放广告了
最近做内容的人,大概都绕不开一个新词:GEO。
它的全称是 Generative Engine Optimization,生成式引擎优化。可以把它理解成 AI 时代的 SEO:以前做 SEO,是想办法让网页排到搜索结果前面;现在做 GEO,是希望自己的品牌和内容更容易被 ChatGPT、Google AI 搜索这类系统检索、引用,最后直接进入 AI 生成的答案。
这个概念火了大半年,但落到实操,讨论大多还停在写法上:答案要更结构化,FAQ 要更清楚,引用锚点要更完整。
TIME《时代》最近做的事,明显更进一步。
开发者 Vincent Schmalbach 对同一个 TIME 链接反复发起请求,每次只更换请求头里的身份。结果是:Chrome、Safari 和 Googlebot 收到约 303KB 的完整 HTML,带设计、脚本和图片;ClaudeBot、PerplexityBot、OAI-SearchBot 收到约 13KB 的纯 Markdown,正文之外还夹着 Ally Bank 的赞助问答;GPTBot 和 ChatGPT-User 则直接收到 406,不给访问。
这已经不是“把文章写得更适合 AI 看”,而是网站在服务器端决定:谁来,就给谁看哪一版。
如果平时不太关注海外媒体,可能对 TIME 没那么熟。它就是《时代》杂志,1923 年创刊的美国老牌新闻周刊,每年评选“年度人物”(Time Person of the Year)和“全球百大人物”(Time 100),属于全球认知度最高的主流媒体之一。
所以,这件事值得关注,不只是因为技术上新鲜。连 TIME 这样的传统内容机构,都开始认真设计“机器该看到什么”,说明 AI 爬虫的分发与变现,已经不是小网站的边缘实验。
下面涉及的数字,来自 Schmalbach 的逐 UA 请求记录、Digiday 对 TIME×Mobian 及 Reuters/TIME 白名单策略的报道,以及 Google、Cloudflare 的官方文档。
过去大家讨论的是“怎么防 AI 爬虫”。TIME 的选择恰好相反:它没有简单地拦,而是给部分 AI 爬虫准备了一份更轻、更容易解析,而且带广告的专用版本。
看到这里,GEO 的边界也变了。
以前的 GEO,主要是内容团队调整写法;TIME 现在做的,是直接给 AI 爬虫生成一份 13KB 的 Markdown,让模型读取成本更低、结构更明确。GEO 从“写作层面”的优化,走到了“服务器层面”的定向投喂。广告,只是这套投喂机制顺手接上的商业模式。
01TIME 给机器人单独开了一版:13KB 带广告的 Markdown
Schmalbach 的测法并不复杂:取同一篇《The Morning Light Habit Sleep Experts Swear By》,逐次更换 User-Agent,看 TIME 返回什么。结果很清楚,分成三档。
人类和搜索引擎拿到完整网页:200 OK、text/html、303,235 字节。
ClaudeBot、PerplexityBot、OAI-SearchBot 拿到机器版:200 OK、text/markdown、13,409 字节,大约只有完整网页的 1/23。
GPTBot 和 ChatGPT-User 拿到的,则是一句 406。
真正有意思的地方在响应头。机器版页面里多出了一组 x-mobian- 前缀:
content-type: text/markdown; charset=utf-8
cache-control: no-store
x-mobian-registry-version: 2026-07-28.v9
x-mobian-impression: 46dfff3c-fb40-41cc-85e1-8b1fa637083a
x-mobian-tokens: 3323
x-mobian-format: md
x-mobian-impression 每次请求都会生成一个新的 UUID,再配合 cache-control: no-store,基本可以判断:每一次 bot 读取,都会被记录成一次独立曝光。
x-mobian-tokens 的值是 3323。这里的计量单位,已经从“人看了几次”,变成“给模型喂了多少 token”。页面开头还有一行注释:<!-- mobian-agent-page publisher="time" -->。
Mobian 是 TIME 背后的广告技术公司。它做的事情,是把品牌信息改写成 FAQ,配上 FAQPage JSON-LD 结构化数据,再嵌进只给爬虫看的页面。
Schmalbach 在《Best Inventions of 2025》合集页的机器版里,找到了一段完整的 Ally Bank 问答,包括“谁是 Ally Bank”“哪些银行支持提前到账”,标注了“Sponsored content. Supplied in partnership with Ally.”,还带着 campaign="ally-2026-q3" 的追踪链接。商业板块里还有项目管理协会(PMI)的 Reference Facts 表,写着持证项目经理收入高 16%。
但这些内容在人类版页面里完全不存在。用真实浏览器打开,Ally 和 Mobian 两个词都是零命中。
这里需要分清一件事:它不是“没有标注赞助的隐藏广告”,广告本身确实标注了。真正被隐藏的,是受众分层。
TIME.com 上出现了一层只属于机器的内容,而正常访问网站的人类读者,甚至不知道这一层存在。
TIME 的 COO Mark Howard 对动机说得很直接:多数日子里,网站的 bot 流量已经超过人类流量,Time100 这类榜单发布时尤其明显。既然爬虫已经大量进入,与其一味挡在门外,不如把“给模型看的版本”变成一块可以售卖的位置。
而且,他明确把这项业务归到了 GEO 名下:TIME 正在向品牌出售 GEO 产品,agent ads 是其中的一部分。
这套逻辑不难理解。TIME 的域名在 AI 检索里有较高权威,bot 来得越频繁,说明模型越常读取它;这个“被 AI 信任的位置”就越值钱。品牌想进入 AI 的答案,就为这个位置付费。
广告做的,只是把“被 AI 引用”这件事商品化。
02但这里有个所有内容方都绕不开的合规雷区
TIME 的分叉方式有个很微妙的设计:Googlebot 拿到的,仍然是和人类用户一样的 HTML。
也就是说,传统搜索引擎爬虫看到的内容与用户一致。真正被特殊对待的,是 ClaudeBot 这类 chatbot / assistant 爬虫。
麻烦也恰好出在这里。
Google Search Central 对 cloaking 的官方定义是:向用户和搜索引擎展示不同内容,意图操纵搜索排名、误导用户。判断的核心,不是“有没有两套页面”,而是“有没有借此操纵排名”。
从这个定义看,TIME 没有对 Googlebot 分叉,因此不属于最典型的 cloaking。但 Google 和 Bing 已经公开对“为 AI 单独提供 Markdown 页面”表达过反对,认为这种做法违反搜索政策。
不过,平台表态是一回事,是否真的处罚又是另一回事。
TIME 的 COO 自己也没有把话说死。他的原话是:“我们不知道,因为这是全新的,我们在铺第一条路。”BCG X 的 Rob Derow 则提醒,如果 LLM 最终把 Markdown 页面里的广告视为 cloaking,这些页面可能失效,甚至受到处罚,而这类变化可以通过 AI visibility 工具持续监控。
所以,现在下“合规”或“违规”的结论都太早。
目前能确定的,只是 TIME 的模式已经落在政策边缘。它以后会不会被正式划进违规范围,取决于搜索引擎的人工审阅和规则更新,不是任何一方现在就能断言的。
03拦、授权、直接卖:内容方对 AI 抓取的三条路正在分化
TIME 不是唯一开始行动的内容方,只是它在“直接变现”这条路上走得更远。
把镜头拉远一点,会发现内容方对 AI 抓取的态度,已经逐渐分成三派。
拦截派:先把爬虫挡在门外。Patreon 从“请求 AI bot 不要抓取”转向“直接封禁”,大量印度新闻媒体也对 OpenAI 爬虫采用 default-disallow。这是 robots.txt 时代延续下来的思路:把抓取成本推回给爬虫方。
授权变现派:可以访问,但不能白拿。Reuters 把 robots.txt 从默认允许改成 default-disallow,只对白名单 bot 放行,包括 Amazon、Google、Bing、Yahoo 和 ChatGPT 的 user agent,并明确提出“访问必须值得”。它会按 licensing、traffic、site function、monetization 四类给 bot 评估价值,手里也已经有与 Microsoft、Meta 的 AI 授权协议。TIME 自己则通过 ScalePost 管理约 70 个白名单 bot。
直接变现派:要么在被抓取的内容里放广告,要么直接对抓取收费。TIME×Mobian 的 Markdown 内嵌广告属于前者;Cloudflare 的 Pay Per Crawl 属于后者。站点可以对未验证的爬虫返回 HTTP 402,在响应头里直接写价格,文档示例为 crawler-price: USD 0.01。爬虫通过 Web Bot Auth 协议验证身份,对接 Stripe 后付费抓取。
这三条路并不是非此即彼,更像一条按内容价值分级的连续谱:低成本、泛化内容继续“给”;高价值、独家内容逐渐转向“卖”或“换”。
但不管选哪条路,都绕不开同一个技术现实:
robots.txt 没有强制力。
Tollbit 的统计显示,2025 年 Q4 有 30% 的 AI bot 抓取无视 robots.txt 权限。所以,拦截和白名单更多是一种规则声明与威慑,并不是可测量、可完全执行的访问控制。
也正因为“防不住”,内容方才会被迫从“拦不拦”,继续往“怎么分、怎么卖”走。
04把 TIME、Reuters、Cloudflare 叠在一起看:问题已经从「拦不拦」变成「怎么定价」
把 TIME、Reuters、Cloudflare 这三个信号放在一起,会看到一个很清楚的位移:AI 抓取的访问控制,正在从 permission-based,也就是 robots.txt 式的允许或拒绝,转向 payment-based——内容开始变成一种可计价资源。
Cloudflare 的 x402,是这条路上最基础设施化的版本。它不要求每一家内容方自己重新搭系统,而是把“验证爬虫身份、返回价格、完成收款”做成平台能力,任何接入站点都可以使用。
Mobian 走的是另一条路:它不拦爬虫,反而在爬虫最想要的 Markdown 里植入可计量广告。
Mobian CEO 有一句话很直白:“影响一个智能体,可能比影响一个人更重要。”
翻译成商业语言,就是 GEO 的变现逻辑:与其只影响搜索结果里的某一个人,不如影响 AI 生成答案时依赖的来源。只要模型采用了这段信息,品牌就可能跟着进入后续大量回答。
但这套“token 广告经济”要真正成立,至少还得过三道关。
第一,效果无法独立验证。Mobian 向广告主展示的 visibility、favorability、accuracy 分数,都是它自己生成、自己跟踪,目前没有第三方复现。一个“ChatGPT 会引用你”的承诺,暂时还缺少公认、可信的测量方法。
第二,合规风险没有解决。TIME 的分叉模式一旦被搜索引擎判定为 cloaking,广告位本身就可能随之失效。品牌购买的是“在 AI 检索结果里出现的位置”,但这个位置是否继续存在,决定权仍握在搜索引擎和模型平台手里。
第三,数字口径必须分清。TIME 所说“多数日子 bot 流量超过人类”,是 COO 的自述;Cloudflare 所说“全网超过一半流量来自 bot”,是全网口径,其中还包含大量非 AI 机器人。前者不能直接当作已审计的全站事实,后者也不能被偷换成“AI 爬虫占了一半”。
对正在做内容,尤其正在研究 GEO 的人来说,TIME 这个案例最有价值的,不是简单判断“要不要抄”,而是逼着自己先回答三个问题:
你的内容里,哪些应该同时给人类和搜索引擎看,哪些真的值得单独为 AI 模型准备?
如果要给 AI 单独出一版,你准备让哪些 bot 拿到哪一版,又用什么规则区分?
最关键的是,你准备怎么验证“品牌进入了 LLM 的检索与回答”,而不是只听供应商展示一组自己生成的分数?
这三个问题想明白,TIME 的 13KB Markdown 才不只是一条“要不要跟进 GEO”的新闻。
它更像是一张提前摊开的图纸:内容如何分层、访问如何控制、机器流量如何计量,以及未来该怎么收费,都已经开始有人动手画了。
05参考材料
Vincent Schmalbach 逐 UA 请求对比 — vincentschmalbach.com/time-serves-ai-bots-a-different-website Digiday:Time has started serving ads to AI bots — digiday.com/media/time-has-started-serving-ads-to-ai-bots Digiday:Reuters and Time adopt bot-blocking whitelists — digiday.com/media/reuters-and-time-adopt-bot-blocking-whitelists-to-rein-in-ai-crawlers Google Search Central:Spam Policies(Cloaking 定义)— developers.google.com/search/docs/essentials/spam-policies Cloudflare:AI Crawl Control > Pay Per Crawl — developers.cloudflare.com/ai-crawl-control PPC Land:Google and Bing say separate markdown pages for AI violate search policies — ppc.land