← 返回博客/博客·2026 · 06 · 28·7 min

GEO 实战:如何让你的站被 AI 答案引擎和搜索引擎"读到、收录、引用"

一篇从 0 到 1 的实操记录——在 Cloudflare 放行 AI 答案引擎爬虫、用 robots.txt 发出正确的内容信号、把站点提交给 Google / Bing / 百度。GEO 时代,先被"读到",才谈得上被"引用"。

引见 GEO 团队
生成式引擎优化 · 引见 YinJen

一句话结论:被 AI「引用」前,先得被 AI「读到」——在 Cloudflare 放行 AI 答案引擎爬虫、用 robots.txt 的 Content-Signal 明确允许(search / ai-input / ai-train 三项全开,对正文内容零 Disallow,只挡 /login、/api、/admin),再把 sitemap 提交给 Google、Bing、百度。没被收录,引用无从谈起。

为什么"被收录"是 GEO 的起跑线

GEO(Generative Engine Optimization,生成式引擎优化)的目标,是让你的内容出现在 ChatGPT、Claude、Gemini、Perplexity、豆包等 AI 的答案里、被它们引用。但很多人忽略了一个前提:AI 引擎得先能"读到"你的站,才谈得上"引用"你

如果你的网站把 AI 爬虫挡在门外,或者搜索引擎压根没收录你的页面,那再好的内容也进不了 AI 的视野。所以 GEO 的第一公里,其实是两件朴素的事:放行该放行的爬虫 + 让搜索/答案引擎收录你

下面是我们给一个真实站点做的完整实操,五步走,可直接照搬。

第一步:在 Cloudflare 放行 AI 答案引擎爬虫

很多站点(尤其挂了 Cloudflare 的)默认对 AI 爬虫是"一刀切拦截"。Cloudflare 有一个托管开关「阻止 AI 训练自动程序」,打开后会把 ClaudeBot、GPTBot、Google-Extended、Amazonbot 等一并拦在门外——这里面既有训练爬虫,也有给 AI 答案做实时检索的爬虫。

我们做的:

  • 把这个总开关从「在所有页面阻止」改成「不阻止」,让 AI Crawl Control 的逐爬虫开关重新可控;
  • 确认 Bot Fight Mode、AI 迷宫(AI Labyrinth)都没在拦这些已验证的爬虫。

一句话:先把网络层的门打开,否则下面 robots.txt 怎么写都没用。

第二步:用 robots.txt 发出正确的"内容信号"

打开网络层之后,真正决定"哪个爬虫能进、能做什么"的,是 robots.txt。这里有两个层面:

1)别再 `Disallow: /` 答案引擎。 ClaudeBot、GPTBot、Google-Extended 这些都是遵守 robots.txt 的——只要 robots.txt 里写了 Disallow: /,它们哪怕网络层放开了也不会抓。所以要把这些拦截行删掉。

2)用"内容信号"(Content Signal)正向表态。 这是一个新兴标准(contentsignals.org),用一行声明你允许爬虫拿你的内容做什么:

  • search=yes:允许做搜索索引;
  • ai-input=yes:允许把内容用作 AI 答案的输入(RAG、grounding、AI 概览引用)——这正是 GEO 想要的;
  • ai-train=yes/no:是否允许用于训练模型(看你自己的取舍)。

一份理想的根 robots.txt 大致长这样:

User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=yes
Disallow: /login
Disallow: /api/
Disallow: /admin/

Sitemap: https://你的域名/sitemap.xml

注意三点:① 只挡 login/api/admin 这类不该被收录的工具页,正文全放;② 显式给了 ai-input=yes 这个 GEO 加分项;③ 带上 Sitemap: 行——这一行能让所有爬虫(包括下文里没法走配额提交的百度)自动发现你的站点地图。

第三步:Google Search Console 收录

  • 在 GSC 添加一个 Domain 属性(整个域名),用 DNS TXT 验证。Domain 属性一次性覆盖根域、www、子域和子路径,比 URL 前缀属性省事;
  • 提交 sitemap——状态显示「成功 · 发现 N 个网页」就对了;
  • 对核心页(首页、功能、定价、下载)用「网址检查 → 请求编入索引」,把它们推进优先抓取队列。

一个坑:如果你是从老子域迁到新子路径,别用 GSC 的"地址变更"工具——它只支持子域→子域,不支持迁到子路径。靠 301 重定向 + 保留老属性即可。

第四步:Bing 收录

Bing Webmaster Tools 支持用 Google 账号直接登录(省去注册微软账号)。加站点后,验证方式可以选 CNAME(在 DNS 加一条指向 verify.bing.com 的记录,记得设为「仅 DNS / 不代理」),然后提交同一个 sitemap。Bing 里还有个 IndexNow,可以做即时收录推送,值得一开。

第五步:百度收录(以及 ICP 备案这道坎)

百度对中文站很重要,但有它自己的规矩:

  • 加站点后做站点验证(文件 / HTML 标签 / CNAME);
  • sitemap 提交需要 ICP 备案——没备案的站,sitemap 配额是 0,连 API 推送都直接返回 over quota;
  • 没备案前,可以用「手动提交」每天推少量核心 URL,先让 Baiduspider 抓起来;
  • robots.txt 里那行 Sitemap: 同样能帮 Baiduspider 自动发现站点地图。

所以中文站做 GEO/SEO,ICP 备案越早办越好——它是百度这条线的总闸。

复盘:几个关键认知

  1. "放行"是分层的:网络层(WAF)放行 ≠ robots.txt 放行。两层都要开,缺一不可——好爬虫遵守 robots.txt,坏配置会把它们挡在门外。
  2. robots.txt 是 GEO 的表态窗口:它不只是"禁止什么",更是用 Content Signal 正向声明"欢迎你用我的内容做答案"。
  3. `Sitemap:` 一行抵千言:它让所有引擎自动发现你的内容地图,尤其对那些不方便手动提交的引擎。
  4. 被收录 ≠ 被引用,但它是前提:这一切只是把门打开。真正决定你能不能进 AI 答案的,是内容本身的结构化与可被引用程度——那才是 GEO 的下半场。

把门打开,只是开始。引见(YinJen)做的,正是帮你走完之后的下半场:让你的内容真正被 AI 答案引擎读懂、选中、引用。

延伸阅读:被读到、被收录只是开局——被引用之后如何度量真实转化,见 GEO 也要埋点:从「被 AI 引用」到「带来真实转化」的闭环度量;想把这条链路一站做完,了解 引见 · YinJen

关于作者
引见 GEO 团队

引见(YinJen)的生成式引擎优化(GEO)研究与实战团队,长期监测内容在 ChatGPT、Claude、Gemini、Perplexity、豆包、DeepSeek 等主流 AI 引擎中的引用与可见度。本系列均为一手实操记录。

了解引见如何帮你做 GEO →