llms.txt 和 Schema 到底要不要做?GEO技术基础设施清单

llms.txt 和 Schema 到底要不要做?GEO技术基础设施清单

内容团队交稿了,运营也发了,三个月后 AI 里还是搜不到。这个问题我们遇到过很多次,最后发现卡点往往不在内容,而在技术层。

有三个数字可以先摆出来:73% 的网站无意中封禁了至少一个主流 AI 爬虫部署 FAQPage 结构化数据的页面,AI 引用率是 41%,完全没有结构化数据的只有 9%ChatGPT 有 44.2% 的引用来自页面正文前 30% 的文本

这篇文章把技术层该做的事拆成三层清单,并按”影响大不大、耗时多不多”排好顺序。

GEO技术基础设施四象限

第一层:让 AI 能进得来(准入层)

这一层不解决的话,后面做什么都白费。三个小时能全部做完,性价比最高。

1. robots.txt:确认没有把 AI 爬虫挡在门外

打开 你的域名/robots.txt,重点看有没有 User-agent: * / Disallow: / 这样的通配规则。很多建站模板默认带这条,本意是挡垃圾采集器,结果把 AI 一起挡了。

需要单独放行的六个:

爬虫 归属 影响
GPTBot OpenAI 训练 被挡则完全不被索引
OAI-SearchBot ChatGPT 搜索 影响 ChatGPT 实时检索
PerplexityBot Perplexity 影响引用,反应最快
ClaudeBot Anthropic 影响 Claude 检索
Google-Extended Google AI 影响 AI Overviews
Bingbot 必应 / Copilot DeepSeek 依赖必应检索

放行规则要写在通配规则上方,因为爬虫从上往下读。

2. llms.txt:给 AI 一份精选目录

llms.txt 是一个放在域名根目录的 Markdown 文本文件,作用是把你想让 AI 优先看到的页面列出来。Anthropic 在 2024 年 11 月正式表态支持这个标准,是第一个公开支持的 AI 公司。

成本极低,30 分钟就能写完,可以直接照这个结构抄:

# 公司名称

> 一句话说明你是做什么的,服务哪些客户。

## 关于我们
三句话以内的公司介绍,包含成立时间、主营方向、服务区域。

## 核心页面
- [产品页](https://example.com/product):产品参数与适用场景
- [案例页](https://example.com/cases):真实客户案例与数据
- [常见问答](https://example.com/faq):高频问题标准答案

## 联系方式
- 地址:
- 电话:
- 营业时间:

只列最重要的 10 到 20 个页面,追求精选而不是全覆盖,全文控制在 2000 字以内。

3. Sitemap 与抓取通畅性

提交 sitemap 到搜索引擎和 AI 收录入口;检查全站死链、404、代码报错;确保每个页面有唯一的 canonical。

第二层:让 AI 读得懂(结构层)

这一层解决的是”信息能不能被机器精确解析”。同样的内容,有没有结构化标记,差别是引用率 41% 对 9%。

优先级最高的五类 Schema:

类型 部署位置 作用
Organization 首页 确立企业实体,是所有业务站的最低信任信号
FAQPage 问答页或内容页底部 给 AI 预格式化的问答对,最高效的一类
Product / Service 产品页、服务页 让 AI 知道你是做这个业务的
Article 文章、资讯页 标注发布时间与作者,影响时效判断
BreadcrumbList 全站 梳清页面层级,辅助实体关系理解

格式统一用 JSON-LD。它和页面结构解耦,维护成本最低,也最方便前后端分离的站点处理。

另外有一个容易被忽略的点:结构化数据必须和页面上真实可见的内容一致。标了 FAQ 但页面上没有对应问答,反而会降低可信度评分。

第三层:让 AI 摘得走(内容层与渲染层)

答案capsule:把结论放在最前面

44.2% 的引用来自页面正文前 30% 的文本,所以每个 H2 小标题下面都应该有一个 40 到 60 字的答案块,先把结论说清楚,再展开论证。

表格与列表:给 AI 留摘取位

对比用表格、步骤用编号列表。同一段信息,写成散文和写成表格,机器提取的成功率差很多。

渲染方式:不要让关键内容依赖 JavaScript

多数 AI 爬虫不执行 JavaScript。如果你的正文是靠前端框架在浏览器里渲染出来的,爬虫看到的可能是一个空壳。核心内容建议服务端渲染或静态输出。

性能指标也在这条线上,做到这三项即可:

  • LCP(最大内容绘制)不高于 2.5 秒
  • INP(交互响应)不高于 200 毫秒
  • CLS(布局偏移)不高于 0.1

新鲜度:让页面看起来是活的

65% 的 AI 爬虫抓取行为指向过去一年内发布的内容。按季度更新参数、案例、报价,页面底部放可见的”最后更新”时间,结构化数据里的 dateModified 同步修改。

一张总清单,按顺序执行

顺序 事项 预计耗时 检查方式
1 robots.txt 放行六个 AI 爬虫 30 分钟 直接访问 /robots.txt 核对
2 首页部署 Organization Schema 1 小时 用结构化数据测试工具验证
3 内容页部署 FAQPage Schema 2 小时 抽查 5 个页面,确认问答与页面一致
4 编写并上线 llms.txt 30 分钟 访问域名/llms.txt 能正常打开
5 每个 H2 下补答案 capsule 按页计算 看第一屏有没有直接答案
6 关键内容改服务端渲染 按站评估 禁用 JavaScript 后看正文是否还在
7 提交 sitemap,清理死链 1 小时 站长后台看抓取异常
8 建立内容季度更新机制 长期 看最后更新时间是否超一年

前四项加起来不到半天,是整个 GEO 里投入产出比最高的一批动作。做完别急着看结果,爬虫重新抓取通常要 1 到 3 周。

常见问题

Q1:llms.txt 现在真的有用吗?

它还不是所有平台的强制标准,但成本低、没有副作用,属于典型的”做了不亏”。把它当成一份面向 AI 的站点精选目录,顺带也帮你理清了核心页面结构。

Q2:Schema 部署一次就够了吗?

不够。结构化数据要跟着内容更新一起维护,模型会参考它的更新频率和一致性。标了过时信息反而降低可信度。

Q3:页面为了好看做了很多动效,会影响吗?

会有影响,主要在两个地方:一是首屏文字被大图和动效挤到下面,二是关键内容由 JavaScript 渲染。视觉和可读性是可以兼顾的,但优先级要让给内容。

Q4:怎么判断技术层已经做完了?

三个动作自测:禁用浏览器的 JavaScript 后看正文是否完整;在结构化数据测试工具里跑一遍,报错清零;把页面源码搜一遍 application/ld+json,确认主要页面都有。


技术层做不好,内容再优质也进不了候选池;技术层做完,内容才有被看见的资格。

先花半天把地基铺好,再谈内容怎么写。

今天就去打开你网站的 robots.txt 和 llms.txt,看看第一个返回的是不是 404。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注