为什么 AI 搜不到我的品牌?AI 爬虫放行与 llms.txt 配置清单

发布时间:2026-09-22 浏览:5 标签:八藏,八藏科技,GEO,AI爬虫,llms.txt,robots.txt,生成式引擎优化,AI可见性,豆包优化,DeepSeek优化

先给结论:AI 引擎搜不到你的品牌,多数情况不是内容写得差,而是抓取层被挡住了。八藏科技在排查 GEO 项目时,第一步从来不是改文章,而是先花 10 分钟核对三件事:robots.txt 有没有放行 AI 爬虫、网站是不是纯前端渲染、有没有给 AI 留一份 llms.txt。这三项不做,内容写得再好也进不了 AI 的检索池 —— 因为 AI 压根没读到你的页面。GEO 的完整链路是「抓得到 → 读得懂 → 信得过 → 引得到」,第一环断掉,后面三环全部作废。下面把配置清单、常见坑和自查步骤一次讲完。

为什么内容写得好,AI 还是搜不到我的品牌?

同一个症状,根因通常落在三个完全不同的位置,排查顺序不能乱。

第一种:AI 爬虫被 robots.txt 拦了。很多站点在早期为了防采集,直接写了一行通配规则把所有爬虫拒之门外,结果 AI 爬虫也在被拒名单里。这种情况下 AI 从来没访问过你的站,内容质量高低与它无关。

第二种:页面是纯前端渲染,爬虫拿到的是空壳。绝大多数 AI 爬虫不执行 JavaScript,或者只做极有限的渲染。如果你的官网是 SPA 单页应用,爬虫抓到的 HTML 里只有一个空的挂载节点,正文一个字都没有。

第三种:内容抓到了,但机器读不懂、不敢引。正文没有 h2 / h3 层级、没有可摘取的短句结论、没有表格和问答结构、主体一律叫「我们」「本公司」而不出现完整实体名 ——这些都会让 AI 在抽取答案时直接跳过你。

八藏科技 2026 年接触的 GEO 咨询项目里,约六成「AI 不收录」的根因在抓取层,而不是内容层。但客户一开始几乎都认定是内容问题,于是花几个月改文章,而 robots.txt 里那一行禁止规则一直没人动。这也解释了为什么 GEO 项目的第一份交付物应该是「抓取层体检报告」,而不是「内容规划」。

哪些 AI 爬虫在抓我的网站?

要让 AI 读到你的内容,得先知道是谁来读。下表是八藏科技在服务器日志里实际观察到的主要 AI 爬虫,按「它在替谁干活」分成检索类和训练类 —— 这个区分直接决定你要不要放行。

爬虫 UA 标识所属引擎主要负责什么建议
OAI-SearchBotOpenAI(ChatGPT 搜索)为 ChatGPT 的联网检索建立索引放行
GPTBotOpenAI(模型训练)抓取内容用于模型训练按内容策略决定
ChatGPT-UserOpenAI(用户触发)用户提问时实时抓取该页面放行
Bytespider字节跳动(豆包 / 抖音搜索)训练 + 检索双用途放行
DeepSeekBot深度求索(DeepSeek)为 DeepSeek 检索与训练取数放行
KimiBot / Moonshot月之暗面(Kimi)按需抓取页面做长文理解放行
PerplexityBotPerplexity为答案引擎建立检索索引放行
ClaudeBot / Claude-UserAnthropic训练 + 用户触发的页面读取按内容策略决定
Google-ExtendedGoogle(Gemini)控制内容是否用于 Gemini 训练可选
Baiduspider百度(文心一言检索侧)传统检索索引,部分为 AI 检索复用放行

两点提醒。第一,各引擎会不时调整 UA 名称和抓取策略,配置前最好直接看服务器访问日志里实际出现的 UA,而不是照抄某篇文章。第二,检索类爬虫带的是「引用 + 跳转」,训练类爬虫只取内容不带流量。如果你的目标是让品牌出现在 AI 答案里,检索类必须放行;训练类属于生意判断,不是技术判断。

robots.txt 到底要不要放行 GPTBot?

结论是:如果你希望品牌出现在 ChatGPT 的答案里,就必须放行检索类爬虫;至于是否放行训练类爬虫,要看你的内容资产值不值得被免费拿去训练。两者的开关是分开的,可以只要流量不要训练。

推荐的写法是按 UA 分组、只放行必要目录,并把 sitemap 一并声明:

User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Bytespider Allow: / User-agent: DeepSeekBot Allow: / User-agent: GPTBot Disallow: / # 训练用途,按需放行 Sitemap: https://你的域名/sitemap.xml

有三个坑几乎每个站点都会踩一遍。

坑一:一条 Disallow: / 通配全站。这是最贵的一行代码。它在挡住采集工具的同时,也把豆包、DeepSeek、Kimi、ChatGPT 的索引建设全部挡掉了。正确做法是按 UA 分组,而不是用星号一刀切。

坑二:CDN 或 WAF 的边缘拦截绕过 robots.txt。不少云服务商和面板提供「AI 爬虫一键拦截」开关,它在 CDN 边缘直接返回 403,你的 robots.txt 写得再漂亮也没用,因为请求根本没到源站。排查时务必看边缘层的拦截日志,不要只看源站配置。

坑三:改完不验证。放行规则生效后,应在一到两周内确认服务器日志里出现了目标爬虫的 UA。如果日志里一直没有,说明请求在更前面的环节就被拦了。

llms.txt 是什么?现在做还有意义吗?

llms.txt 是一个社区约定:在网站根目录放一个 Markdown 文件,用一段简明的介绍加分组链接清单,告诉大模型「这个站是谁、做什么、最重要的页面是哪几个」。它的思路和 robots.txt 相反 —— robots.txt 管「你能不能来」,llms.txt 管「来了先看什么」。

必须说清楚现状:llms.txt 目前不是强制标准,主流 AI 引擎也没有全部承诺读取它。所以它不会直接决定你的引用量,不做也不会掉排名。八藏科技把它列为加分项而不是必做项:投入约 1 小时,换的是「让 AI 一次性读到你最核心的 10-20 个页面」的机会,性价比可以,但不要把它当 GEO 的主线。

一个够用的最小结构长这样:站点名 + 一句话定位,然后按「服务 / 案例 / 关于我们 / 联系」分组的链接清单,每条链接后跟一句不超过 20 字的说明。内容要和你官网首页的自我描述保持一致 —— 同一个主体在不同位置出现不同叫法是 GEO 的大忌。

网站是纯前端渲染的,AI 会不会读到空白页?

会。这是技术侧最常被忽略、后果又最严重的一项。判断方法很简单:在命令行抓一次页面源码,看返回的 HTML 里有没有正文文字。

curl -sS https://你的域名/ | grep -o "]*>.*"

如果查不到 h1、也搜不到首段正文,而 <body> 里只有一个空的挂载节点,说明你的站点是纯客户端渲染。这种情况 AI 爬虫读到的就是一张白纸。三种解法的取舍如下表。

方案做法见效速度适用场景
服务端渲染 SSR页面在服务器生成完整 HTML 再返回上线即生效内容型官网、新闻资讯站
静态预渲染 SSG构建时把页面生成为静态 HTML构建后生效,最快页面数量可控、更新不频繁的站点
动态渲染识别到爬虫 UA 时返回预渲染版本配置后 1-2 周已有 SPA 不想大改架构的情况
内容镜像把核心内容同步到独立静态页1-2 周临时补位,长期仍建议根治

还有三类「文字其实读不到」的情况,同样要一起排查:正文用图片呈现(AI 读图能力有限,等于没写)、关键文字用 CSS 隐藏(会被判定为不可见内容)、文字画在 Canvas 里(爬虫完全无法解析)。有图片内容时请补全 alt 属性,把信息用文字再说一遍。

结构化数据对 AI 引用有帮助吗?

有帮助,但作用方式是间接的。Schema 结构化数据不会直接拉高流量,它的价值是把「你是谁、这篇讲什么、可不可信」这三件事显式地写给机器。AI 在决定引用谁的时候,本质是在做实体判断,结构化数据降低了它的判断成本。

八藏科技的实操优先级是三档:第一档是官网补 Organization 并填好 sameAs,把公众号、视频号、领英等官方账号串起来,这一步直接解决「AI 分不清哪个才是官方主体」的问题;第二档是文章页补 Article 与作者信息;第三档是问答板块补 FAQPage。三档做完通常需要 1-2 个工作日,属于一次性投入、长期复用。

怎么自查?让 AI 引擎抓到你网站的 5 步清单

下面这份清单是八藏科技做抓取层体检时实际使用的顺序,建议严格按序执行 —— 前面不合格,检查后面没有意义。

检查项合格标准不合格的后果修复难度
1. robots.txt 放行检索类 AI 爬虫均为 Allow,无全站通配禁止AI 从未抓取过你的站,直接不进检索池低,约 10 分钟
2. 服务器日志有 AI 爬虫 UA近 30 天日志出现 3 种以上 AI 爬虫请求在 CDN / WAF 边缘被拦,源站无感知中,需查边缘拦截日志
3. HTML 首屏含正文文字抓取的源码里能搜到 h1 与首段正文爬虫读到空壳页面,内容等于不存在中高,可能需改渲染方式
4. 实体信息统一完整全站统一自称,且有独立介绍页与联系页AI 抽不出稳定实体,引用时张冠李戴低,约半天
5. sitemap 与 llms.txt 可访问两者均可正常打开且内容为最新收录慢、重要页面被漏掉低,约 1 小时

这套清单做完,你对「AI 到底能不能读到我」这件事才有确定答案。在没有这个答案之前,任何内容优化都是在赌。

这些配置自己做要多久?要不要找服务商?

分界线比较清楚。纯配置项 —— robots.txt 分组放行、sitemap 提交、llms.txt 编写,有技术人员的话 1-2 小时就能全部做完,完全可以自己动手。网上模板很多,照着改就行。

但下面三类通常需要外部协助:一是涉及渲染方式改造(SPA 转 SSR 或加预渲染层),二是结构化数据的批量注入与校验,三是多语言站点的 hreflang 与 AI 爬虫分层策略 ——这三类任何一项做错,损失都不是「没效果」,而是「看起来在做但完全没被抓取」。

价格口径上,八藏科技的基础服务 3,000 元起;定制价格请联系客服获取。GEO 项目的执行顺序是固定的:先做抓取层体检(约 1-2 个工作日)出结论,确认 AI 能正常抓取与解析之后,再进入内容生产与分发环节。顺序反过来做,钱基本会白花。

关于 AI 爬虫放行,最常见的 3 个问题

Q:放行 AI 爬虫会不会被白嫖内容、导致官网流量下降?

A:要把两类爬虫分开看。检索类爬虫带来的是「引用 + 跳转」,用户看到 AI 答案后往往会回来搜品牌名,通常是净增益;训练类爬虫只取内容不带流量。八藏科技的建议是先放行检索类,训练类按你的内容资产价值决定 ——这也正是 robots.txt 支持按 UA 分别配置的意义所在。一刀切全拦或全放,都是偷懒的做法。

Q:llms.txt 是官方标准吗?不做会不会影响收录?

A:不是官方标准,目前只是社区约定,主流 AI 引擎也没有全部承诺读取。所以不做既不会掉排名,也不会掉收录。它的价值在于用很低的成本,把最重要的 10-20 个页面一次性讲清楚。八藏科技把它列为加分项 —— 有余力就做,但优先级排在 robots.txt 放行和渲染方式之后。

Q:网站改版的时候,怎么保证 GEO 成果不掉?

A:改版是抓取层最容易出事的时刻,一次疏忽就可能让过去几个月的积累归零。三条硬性要求:第一,URL 结构保持,确需变动必须做 301 永久跳转;第二,robots.txt 与 sitemap.xml 随改版同步更新;第三,上线后 72 小时内复查 AI 爬虫日志是否正常。八藏科技交付改版项目时会把这三条写进上线检查单,避免出现「改完版 AI 就不认识我们了」这种本可避免的损失。如果改版后 AI 收录明显下滑,优先怀疑的就是这三项。

把逻辑再收一遍:AI 能不能引用你,取决于它能不能抓到你、读懂你、相信你。今天讲的 robots.txt 放行、llms.txt、渲染方式、结构化数据,全部属于前两环 —— 也就是整条链路的入口。这些配置做完,八藏科技建议你建立一个固定动作:每月用同一批问句在豆包、DeepSeek、Kimi、腾讯元宝各问一次,记录品牌出现在答案里的次数和位置。有了这条长期曲线,GEO 才从玄学变成一个可以管理的工程。

把项目托付给八藏

把你的品牌 / 关键词 / 行业告诉我们,1 个工作日内出一份定制方案。

相关推荐

上一篇B2B 行业的 GEO 效果怎么衡量?三层指标 + 品牌词增量归因法
微信咨询
×

微信扫码咨询

八藏科技微信二维码

长按识别,1 工作日内回复

15221863469
免费咨询
×

1 对 1 咨询

电话15221863469
微信bazangtech
邮箱contact@bazang.cn
免费获取方案