网站需要做 llms.txt 吗:先分清 Google AI 搜索、AI 爬虫与内容可见性
llms.txt 不是 Google AI 搜索的必需配置,也不能代替 robots.txt、noindex、可抓取页面或清楚内容。网站应先分清搜索发现、答案引用、模型训练和用户代理访问,再按平台建立可验证的爬虫策略。

网站不必为了 Google AI 搜索创建 llms.txt。先保证页面可抓取、可索引、内容清楚,再分别设置各平台的搜索爬虫、训练爬虫与 noindex。
“给 AI 看见”其实是四个不同问题
团队常把这些目标写成一句话:希望 AI 看见内容。但它至少包含四件不同的事:页面能否被普通搜索索引,能否在 AI 搜索答案中作为来源,能否被用于潜在模型训练,以及用户主动让智能体访问页面时能否完成任务。
如果不先拆开目标,一份网上复制的 robots.txt 很容易产生相反结果。例如品牌希望出现在 ChatGPT 搜索,却同时屏蔽 OAI-SearchBot;或者只想拒绝训练,却把 Googlebot 一并禁止,连传统自然搜索也受影响。新增一个 llms.txt 并不能修正这些冲突。
- 业务目标:出现在 Google 搜索与 AI 功能;主要检查对象:Googlebot、索引资格、摘要控制;llms.txt 能否代替:不能
- 业务目标:内容可被 ChatGPT 搜索发现与引用;主要检查对象:OAI-SearchBot、公开页面、noindex;llms.txt 能否代替:不能
- 业务目标:限制 Google 其他 AI 系统的训练或 grounding;主要检查对象:Google-Extended;llms.txt 能否代替:不能
- 业务目标:排除 OpenAI 潜在训练用途;主要检查对象:GPTBot;llms.txt 能否代替:不能
- 业务目标:不让页面出现在搜索结果;主要检查对象:`noindex` 或访问控制;llms.txt 能否代替:不能
这张表不是永久的通用名单。平台会更新产品、爬虫和控制方式,实施前应回到对应平台的官方说明,并记录核对日期。
Google 已明确说明不会使用 llms.txt
Google 的生成式 AI 搜索优化指南明确说明,Google Search 不使用 llms.txt;创建或维护它不会提升也不会损害网站在 Google 搜索中的可见性或排名。Google 的AI 功能与网站说明也指出,出现在 AI Overviews 或 AI Mode 没有额外技术要求:页面仍要能被 Google 索引,并有资格在搜索中显示摘要。
因此,若目标是 Google AI 搜索,优先级仍是普通但可验证的工作:重要页面可由内部链接找到;Googlebot 没有被 robots.txt、CDN 或防火墙误挡;核心内容以文本存在;canonical、noindex 和结构化数据不互相冲突;商品和商家资料保持更新。
Google Search 中 AI 功能的访问控制仍跟随 Googlebot 与搜索摘要指令;如果目标是限制 Google 一些其他 AI 系统的训练或 grounding,Google 官方要求另行查看 `Google-Extended`。这两个目标不应混成一条全站屏蔽规则。
这不代表“AI 搜索什么都不用做”。团队仍应建设有原始经验、明确结论和可核对证据的页面,并用 Search Console 看收录与表现。但把同一篇内容切成许多机械问答、添加特殊 AI 标记,或批量改写同义页面,都不是 Google 要求的捷径。
OpenAI 的搜索爬虫与训练爬虫不是同一个开关
OpenAI 当前的发布者与开发者说明把用途分开:若希望内容可进入 ChatGPT 搜索的摘要和片段,不应屏蔽 `OAI-SearchBot`;若希望将网页排除在潜在训练用途之外,应针对 `GPTBot` 设置规则。允许前者、拒绝后者,是一个有明确业务含义的组合,并不矛盾。
还要理解 robots.txt 与 `noindex` 的差别。禁止抓取表示指定爬虫不应读取页面;`noindex` 是爬虫读取页面后看到的索引指令。如果既禁止抓取又期待爬虫读取 `noindex`,控制链本身就断了。OpenAI 的说明也提醒,即使不允许爬取,平台仍可能从第三方来源得知 URL 并只显示标题和链接;不希望出现时,要按其当前指南处理 `noindex`,并确保爬虫能够读取该指令。
对于登录后文档、客户资料、测试站和未发布报价,首选身份验证与访问控制,不要把 robots.txt 当保密机制。它是一份公开的爬虫规则文件,不会阻止普通访问者直接打开 URL。
llms.txt 可以是自愿维护项,但必须有消费者
如果某个合作系统、内部智能体或已确认的平台明确读取 llms.txt,团队可以把它作为机器导航清单维护。此时应先回答:谁会读取;读取失败有什么影响;内容由谁更新;是否暴露本来不应公开的路径;是否和 canonical、sitemap 或站内导航重复。
最差的做法不是文件存在,而是把它当作“做过 GEO”的证明。页面已经下架,llms.txt 还保留旧链接;多语言版本指向错误市场;文件列出完整文档,却没有访问权限边界。这样的清单增加维护面,却没有可衡量目标。
若暂时没有明确消费者,不创建也不会让 Google AI 搜索失去资格。把时间用在修复抓取、内容、产品资料、作者与更新时间、内部链接和真实用户体验上,通常更可验证。
建立一张按平台和用途管理的控制矩阵
不要让 SEO、法务、安全和开发各自编辑 robots.txt。用一张表记录平台、user-agent、允许路径、禁止路径、业务理由、负责人和最后核对日期。每次变更先在测试环境检查语法,再从公开网络读取最终文件,确认 CDN 没有返回旧版本或挑战页。
一次最小自检可以这样做:
- 选首页、重要内容页、登录页和一条不应索引的页面作为样本。
- 检查 HTTP 状态、canonical、robots meta 和响应头是否符合各自目标。
- 使用 Search Console URL 检查确认 Google 看到的实时页面与渲染内容。
- 对照 OpenAI 最新官方说明,检查 OAI-SearchBot 与 GPTBot 是否被分别处理。
- 若使用 Google-Extended,确认它没有被误当成 Google Search 的收录开关。
- 查看服务器或 CDN 日志中的 user-agent、状态码和请求路径,但不要把任何自报名称都自动当作可信爬虫。
- 记录变更前后的自然搜索、AI 搜索引荐和关键转化,不以一次提问是否出现引用作为唯一验收。
AI 答案会因问题、地区、时间和系统选择而变化;配置正确也不保证某一页面被抓取、索引或引用。可交付的目标应是“访问规则与业务意图一致、重要内容可验证、敏感内容有真正访问控制”,而不是承诺一个固定引用结果。
李李出海在 SEO / GEO 与海外网站维护中,可以协助梳理爬虫策略、索引控制、页面证据与分析口径。真正有用的 AI 可见性工作,不是追逐每个新文件名,而是团队知道每个开关控制什么、怎样验证,以及平台规则变化后由谁复核。
Article feedback
这篇文章对你有帮助吗?
你的反馈会帮助我持续改进内容
About the author
李李出海
独立网站设计师与全栈开发者
李李出海(LiLi Abroad)专注海外英文网站、Shopify 与 WordPress 独立站开发,以及 Google SEO、GEO 内容优化和长期技术维护。
查看作者
Discussion
评论
还没有公开评论,欢迎留下第一个有价值的问题或补充。