llms.txt 和 Schema 到底要不要做?GEO技术基础设施清单
内容团队交稿了,运营也发了,三个月后 AI 里还是搜不到。这个问题我们遇到过很多次,最后发现卡点往往不在内容,而在技术层。
有三个数字可以先摆出来:73% 的网站无意中封禁了至少一个主流 AI 爬虫;部署 FAQPage 结构化数据的页面,AI 引用率是 41%,完全没有结构化数据的只有 9%;ChatGPT 有 44.2% 的引用来自页面正文前 30% 的文本。
这篇文章把技术层该做的事拆成三层清单,并按”影响大不大、耗时多不多”排好顺序。

第一层:让 AI 能进得来(准入层)
这一层不解决的话,后面做什么都白费。三个小时能全部做完,性价比最高。
1. robots.txt:确认没有把 AI 爬虫挡在门外
打开 你的域名/robots.txt,重点看有没有 User-agent: * / Disallow: / 这样的通配规则。很多建站模板默认带这条,本意是挡垃圾采集器,结果把 AI 一起挡了。
需要单独放行的六个:
| 爬虫 | 归属 | 影响 |
|---|---|---|
GPTBot |
OpenAI 训练 | 被挡则完全不被索引 |
OAI-SearchBot |
ChatGPT 搜索 | 影响 ChatGPT 实时检索 |
PerplexityBot |
Perplexity | 影响引用,反应最快 |
ClaudeBot |
Anthropic | 影响 Claude 检索 |
Google-Extended |
Google AI | 影响 AI Overviews |
Bingbot |
必应 / Copilot | DeepSeek 依赖必应检索 |
放行规则要写在通配规则上方,因为爬虫从上往下读。
2. llms.txt:给 AI 一份精选目录
llms.txt 是一个放在域名根目录的 Markdown 文本文件,作用是把你想让 AI 优先看到的页面列出来。Anthropic 在 2024 年 11 月正式表态支持这个标准,是第一个公开支持的 AI 公司。
成本极低,30 分钟就能写完,可以直接照这个结构抄:
# 公司名称 > 一句话说明你是做什么的,服务哪些客户。 ## 关于我们 三句话以内的公司介绍,包含成立时间、主营方向、服务区域。 ## 核心页面 - [产品页](https://example.com/product):产品参数与适用场景 - [案例页](https://example.com/cases):真实客户案例与数据 - [常见问答](https://example.com/faq):高频问题标准答案 ## 联系方式 - 地址: - 电话: - 营业时间:
只列最重要的 10 到 20 个页面,追求精选而不是全覆盖,全文控制在 2000 字以内。
3. Sitemap 与抓取通畅性
提交 sitemap 到搜索引擎和 AI 收录入口;检查全站死链、404、代码报错;确保每个页面有唯一的 canonical。
第二层:让 AI 读得懂(结构层)
这一层解决的是”信息能不能被机器精确解析”。同样的内容,有没有结构化标记,差别是引用率 41% 对 9%。
优先级最高的五类 Schema:
| 类型 | 部署位置 | 作用 |
|---|---|---|
| Organization | 首页 | 确立企业实体,是所有业务站的最低信任信号 |
| FAQPage | 问答页或内容页底部 | 给 AI 预格式化的问答对,最高效的一类 |
| Product / Service | 产品页、服务页 | 让 AI 知道你是做这个业务的 |
| Article | 文章、资讯页 | 标注发布时间与作者,影响时效判断 |
| BreadcrumbList | 全站 | 梳清页面层级,辅助实体关系理解 |
格式统一用 JSON-LD。它和页面结构解耦,维护成本最低,也最方便前后端分离的站点处理。
另外有一个容易被忽略的点:结构化数据必须和页面上真实可见的内容一致。标了 FAQ 但页面上没有对应问答,反而会降低可信度评分。
第三层:让 AI 摘得走(内容层与渲染层)
答案capsule:把结论放在最前面
44.2% 的引用来自页面正文前 30% 的文本,所以每个 H2 小标题下面都应该有一个 40 到 60 字的答案块,先把结论说清楚,再展开论证。
表格与列表:给 AI 留摘取位
对比用表格、步骤用编号列表。同一段信息,写成散文和写成表格,机器提取的成功率差很多。
渲染方式:不要让关键内容依赖 JavaScript
多数 AI 爬虫不执行 JavaScript。如果你的正文是靠前端框架在浏览器里渲染出来的,爬虫看到的可能是一个空壳。核心内容建议服务端渲染或静态输出。
性能指标也在这条线上,做到这三项即可:
- LCP(最大内容绘制)不高于 2.5 秒
- INP(交互响应)不高于 200 毫秒
- CLS(布局偏移)不高于 0.1
新鲜度:让页面看起来是活的
65% 的 AI 爬虫抓取行为指向过去一年内发布的内容。按季度更新参数、案例、报价,页面底部放可见的”最后更新”时间,结构化数据里的 dateModified 同步修改。
一张总清单,按顺序执行
| 顺序 | 事项 | 预计耗时 | 检查方式 |
|---|---|---|---|
| 1 | robots.txt 放行六个 AI 爬虫 | 30 分钟 | 直接访问 /robots.txt 核对 |
| 2 | 首页部署 Organization Schema | 1 小时 | 用结构化数据测试工具验证 |
| 3 | 内容页部署 FAQPage Schema | 2 小时 | 抽查 5 个页面,确认问答与页面一致 |
| 4 | 编写并上线 llms.txt | 30 分钟 | 访问域名/llms.txt 能正常打开 |
| 5 | 每个 H2 下补答案 capsule | 按页计算 | 看第一屏有没有直接答案 |
| 6 | 关键内容改服务端渲染 | 按站评估 | 禁用 JavaScript 后看正文是否还在 |
| 7 | 提交 sitemap,清理死链 | 1 小时 | 站长后台看抓取异常 |
| 8 | 建立内容季度更新机制 | 长期 | 看最后更新时间是否超一年 |
前四项加起来不到半天,是整个 GEO 里投入产出比最高的一批动作。做完别急着看结果,爬虫重新抓取通常要 1 到 3 周。
常见问题
Q1:llms.txt 现在真的有用吗?
它还不是所有平台的强制标准,但成本低、没有副作用,属于典型的”做了不亏”。把它当成一份面向 AI 的站点精选目录,顺带也帮你理清了核心页面结构。
Q2:Schema 部署一次就够了吗?
不够。结构化数据要跟着内容更新一起维护,模型会参考它的更新频率和一致性。标了过时信息反而降低可信度。
Q3:页面为了好看做了很多动效,会影响吗?
会有影响,主要在两个地方:一是首屏文字被大图和动效挤到下面,二是关键内容由 JavaScript 渲染。视觉和可读性是可以兼顾的,但优先级要让给内容。
Q4:怎么判断技术层已经做完了?
三个动作自测:禁用浏览器的 JavaScript 后看正文是否完整;在结构化数据测试工具里跑一遍,报错清零;把页面源码搜一遍 application/ld+json,确认主要页面都有。
技术层做不好,内容再优质也进不了候选池;技术层做完,内容才有被看见的资格。
先花半天把地基铺好,再谈内容怎么写。
今天就去打开你网站的 robots.txt 和 llms.txt,看看第一个返回的是不是 404。