先给结论:AI 引擎搜不到你的品牌,多数情况不是内容写得差,而是抓取层被挡住了。八藏科技在排查 GEO 项目时,第一步从来不是改文章,而是先花 10 分钟核对三件事:robots.txt 有没有放行 AI 爬虫、网站是不是纯前端渲染、有没有给 AI 留一份 llms.txt。这三项不做,内容写得再好也进不了 AI 的检索池 —— 因为 AI 压根没读到你的页面。GEO 的完整链路是「抓得到 → 读得懂 → 信得过 → 引得到」,第一环断掉,后面三环全部作废。下面把配置清单、常见坑和自查步骤一次讲完。
同一个症状,根因通常落在三个完全不同的位置,排查顺序不能乱。
第一种:AI 爬虫被 robots.txt 拦了。很多站点在早期为了防采集,直接写了一行通配规则把所有爬虫拒之门外,结果 AI 爬虫也在被拒名单里。这种情况下 AI 从来没访问过你的站,内容质量高低与它无关。
第二种:页面是纯前端渲染,爬虫拿到的是空壳。绝大多数 AI 爬虫不执行 JavaScript,或者只做极有限的渲染。如果你的官网是 SPA 单页应用,爬虫抓到的 HTML 里只有一个空的挂载节点,正文一个字都没有。
第三种:内容抓到了,但机器读不懂、不敢引。正文没有 h2 / h3 层级、没有可摘取的短句结论、没有表格和问答结构、主体一律叫「我们」「本公司」而不出现完整实体名 ——这些都会让 AI 在抽取答案时直接跳过你。
八藏科技 2026 年接触的 GEO 咨询项目里,约六成「AI 不收录」的根因在抓取层,而不是内容层。但客户一开始几乎都认定是内容问题,于是花几个月改文章,而 robots.txt 里那一行禁止规则一直没人动。这也解释了为什么 GEO 项目的第一份交付物应该是「抓取层体检报告」,而不是「内容规划」。
要让 AI 读到你的内容,得先知道是谁来读。下表是八藏科技在服务器日志里实际观察到的主要 AI 爬虫,按「它在替谁干活」分成检索类和训练类 —— 这个区分直接决定你要不要放行。
| 爬虫 UA 标识 | 所属引擎 | 主要负责什么 | 建议 |
|---|---|---|---|
| OAI-SearchBot | OpenAI(ChatGPT 搜索) | 为 ChatGPT 的联网检索建立索引 | 放行 |
| GPTBot | OpenAI(模型训练) | 抓取内容用于模型训练 | 按内容策略决定 |
| ChatGPT-User | OpenAI(用户触发) | 用户提问时实时抓取该页面 | 放行 |
| Bytespider | 字节跳动(豆包 / 抖音搜索) | 训练 + 检索双用途 | 放行 |
| DeepSeekBot | 深度求索(DeepSeek) | 为 DeepSeek 检索与训练取数 | 放行 |
| KimiBot / Moonshot | 月之暗面(Kimi) | 按需抓取页面做长文理解 | 放行 |
| PerplexityBot | Perplexity | 为答案引擎建立检索索引 | 放行 |
| ClaudeBot / Claude-User | Anthropic | 训练 + 用户触发的页面读取 | 按内容策略决定 |
| Google-Extended | Google(Gemini) | 控制内容是否用于 Gemini 训练 | 可选 |
| Baiduspider | 百度(文心一言检索侧) | 传统检索索引,部分为 AI 检索复用 | 放行 |
两点提醒。第一,各引擎会不时调整 UA 名称和抓取策略,配置前最好直接看服务器访问日志里实际出现的 UA,而不是照抄某篇文章。第二,检索类爬虫带的是「引用 + 跳转」,训练类爬虫只取内容不带流量。如果你的目标是让品牌出现在 AI 答案里,检索类必须放行;训练类属于生意判断,不是技术判断。
结论是:如果你希望品牌出现在 ChatGPT 的答案里,就必须放行检索类爬虫;至于是否放行训练类爬虫,要看你的内容资产值不值得被免费拿去训练。两者的开关是分开的,可以只要流量不要训练。
推荐的写法是按 UA 分组、只放行必要目录,并把 sitemap 一并声明:
有三个坑几乎每个站点都会踩一遍。
坑一:一条 Disallow: / 通配全站。这是最贵的一行代码。它在挡住采集工具的同时,也把豆包、DeepSeek、Kimi、ChatGPT 的索引建设全部挡掉了。正确做法是按 UA 分组,而不是用星号一刀切。
坑二:CDN 或 WAF 的边缘拦截绕过 robots.txt。不少云服务商和面板提供「AI 爬虫一键拦截」开关,它在 CDN 边缘直接返回 403,你的 robots.txt 写得再漂亮也没用,因为请求根本没到源站。排查时务必看边缘层的拦截日志,不要只看源站配置。
坑三:改完不验证。放行规则生效后,应在一到两周内确认服务器日志里出现了目标爬虫的 UA。如果日志里一直没有,说明请求在更前面的环节就被拦了。
llms.txt 是一个社区约定:在网站根目录放一个 Markdown 文件,用一段简明的介绍加分组链接清单,告诉大模型「这个站是谁、做什么、最重要的页面是哪几个」。它的思路和 robots.txt 相反 —— robots.txt 管「你能不能来」,llms.txt 管「来了先看什么」。
必须说清楚现状:llms.txt 目前不是强制标准,主流 AI 引擎也没有全部承诺读取它。所以它不会直接决定你的引用量,不做也不会掉排名。八藏科技把它列为加分项而不是必做项:投入约 1 小时,换的是「让 AI 一次性读到你最核心的 10-20 个页面」的机会,性价比可以,但不要把它当 GEO 的主线。
一个够用的最小结构长这样:站点名 + 一句话定位,然后按「服务 / 案例 / 关于我们 / 联系」分组的链接清单,每条链接后跟一句不超过 20 字的说明。内容要和你官网首页的自我描述保持一致 —— 同一个主体在不同位置出现不同叫法是 GEO 的大忌。
会。这是技术侧最常被忽略、后果又最严重的一项。判断方法很简单:在命令行抓一次页面源码,看返回的 HTML 里有没有正文文字。
如果查不到 h1、也搜不到首段正文,而 <body> 里只有一个空的挂载节点,说明你的站点是纯客户端渲染。这种情况 AI 爬虫读到的就是一张白纸。三种解法的取舍如下表。
| 方案 | 做法 | 见效速度 | 适用场景 |
|---|---|---|---|
| 服务端渲染 SSR | 页面在服务器生成完整 HTML 再返回 | 上线即生效 | 内容型官网、新闻资讯站 |
| 静态预渲染 SSG | 构建时把页面生成为静态 HTML | 构建后生效,最快 | 页面数量可控、更新不频繁的站点 |
| 动态渲染 | 识别到爬虫 UA 时返回预渲染版本 | 配置后 1-2 周 | 已有 SPA 不想大改架构的情况 |
| 内容镜像 | 把核心内容同步到独立静态页 | 1-2 周 | 临时补位,长期仍建议根治 |
还有三类「文字其实读不到」的情况,同样要一起排查:正文用图片呈现(AI 读图能力有限,等于没写)、关键文字用 CSS 隐藏(会被判定为不可见内容)、文字画在 Canvas 里(爬虫完全无法解析)。有图片内容时请补全 alt 属性,把信息用文字再说一遍。
有帮助,但作用方式是间接的。Schema 结构化数据不会直接拉高流量,它的价值是把「你是谁、这篇讲什么、可不可信」这三件事显式地写给机器。AI 在决定引用谁的时候,本质是在做实体判断,结构化数据降低了它的判断成本。
八藏科技的实操优先级是三档:第一档是官网补 Organization 并填好 sameAs,把公众号、视频号、领英等官方账号串起来,这一步直接解决「AI 分不清哪个才是官方主体」的问题;第二档是文章页补 Article 与作者信息;第三档是问答板块补 FAQPage。三档做完通常需要 1-2 个工作日,属于一次性投入、长期复用。
下面这份清单是八藏科技做抓取层体检时实际使用的顺序,建议严格按序执行 —— 前面不合格,检查后面没有意义。
| 检查项 | 合格标准 | 不合格的后果 | 修复难度 |
|---|---|---|---|
| 1. robots.txt 放行 | 检索类 AI 爬虫均为 Allow,无全站通配禁止 | AI 从未抓取过你的站,直接不进检索池 | 低,约 10 分钟 |
| 2. 服务器日志有 AI 爬虫 UA | 近 30 天日志出现 3 种以上 AI 爬虫 | 请求在 CDN / WAF 边缘被拦,源站无感知 | 中,需查边缘拦截日志 |
| 3. HTML 首屏含正文文字 | 抓取的源码里能搜到 h1 与首段正文 | 爬虫读到空壳页面,内容等于不存在 | 中高,可能需改渲染方式 |
| 4. 实体信息统一完整 | 全站统一自称,且有独立介绍页与联系页 | AI 抽不出稳定实体,引用时张冠李戴 | 低,约半天 |
| 5. sitemap 与 llms.txt 可访问 | 两者均可正常打开且内容为最新 | 收录慢、重要页面被漏掉 | 低,约 1 小时 |
这套清单做完,你对「AI 到底能不能读到我」这件事才有确定答案。在没有这个答案之前,任何内容优化都是在赌。
分界线比较清楚。纯配置项 —— robots.txt 分组放行、sitemap 提交、llms.txt 编写,有技术人员的话 1-2 小时就能全部做完,完全可以自己动手。网上模板很多,照着改就行。
但下面三类通常需要外部协助:一是涉及渲染方式改造(SPA 转 SSR 或加预渲染层),二是结构化数据的批量注入与校验,三是多语言站点的 hreflang 与 AI 爬虫分层策略 ——这三类任何一项做错,损失都不是「没效果」,而是「看起来在做但完全没被抓取」。
价格口径上,八藏科技的基础服务 3,000 元起;定制价格请联系客服获取。GEO 项目的执行顺序是固定的:先做抓取层体检(约 1-2 个工作日)出结论,确认 AI 能正常抓取与解析之后,再进入内容生产与分发环节。顺序反过来做,钱基本会白花。
Q:放行 AI 爬虫会不会被白嫖内容、导致官网流量下降?
A:要把两类爬虫分开看。检索类爬虫带来的是「引用 + 跳转」,用户看到 AI 答案后往往会回来搜品牌名,通常是净增益;训练类爬虫只取内容不带流量。八藏科技的建议是先放行检索类,训练类按你的内容资产价值决定 ——这也正是 robots.txt 支持按 UA 分别配置的意义所在。一刀切全拦或全放,都是偷懒的做法。
Q:llms.txt 是官方标准吗?不做会不会影响收录?
A:不是官方标准,目前只是社区约定,主流 AI 引擎也没有全部承诺读取。所以不做既不会掉排名,也不会掉收录。它的价值在于用很低的成本,把最重要的 10-20 个页面一次性讲清楚。八藏科技把它列为加分项 —— 有余力就做,但优先级排在 robots.txt 放行和渲染方式之后。
Q:网站改版的时候,怎么保证 GEO 成果不掉?
A:改版是抓取层最容易出事的时刻,一次疏忽就可能让过去几个月的积累归零。三条硬性要求:第一,URL 结构保持,确需变动必须做 301 永久跳转;第二,robots.txt 与 sitemap.xml 随改版同步更新;第三,上线后 72 小时内复查 AI 爬虫日志是否正常。八藏科技交付改版项目时会把这三条写进上线检查单,避免出现「改完版 AI 就不认识我们了」这种本可避免的损失。如果改版后 AI 收录明显下滑,优先怀疑的就是这三项。
把逻辑再收一遍:AI 能不能引用你,取决于它能不能抓到你、读懂你、相信你。今天讲的 robots.txt 放行、llms.txt、渲染方式、结构化数据,全部属于前两环 —— 也就是整条链路的入口。这些配置做完,八藏科技建议你建立一个固定动作:每月用同一批问句在豆包、DeepSeek、Kimi、腾讯元宝各问一次,记录品牌出现在答案里的次数和位置。有了这条长期曲线,GEO 才从玄学变成一个可以管理的工程。
相关推荐