CH.01

llms.txt 概述与规范

什么是 llms.txt,为什么需要它

llms.txt 是一种放置在网站根目录的纯文本文件,专门为 AI 大模型(LLM)提供关于网站的简洁摘要信息。它的核心作用是帮助 AI 模型在检索网页内容之前,快速了解网站的核心定位、主要内容和关键页面,从而提高信息检索和引用的效率与准确性。

在 RAG(检索增强生成)流程中,AI 模型需要从海量网页中筛选出最相关的内容。如果网站没有 llms.txt,AI 模型只能逐页爬取和分析,效率低且容易遗漏关键信息。有了 llms.txt,AI 模型可以在检索阶段就获得网站的"名片"——了解你是谁、你提供什么、哪些页面最重要,从而更精准地匹配用户查询。

💡 核心价值

llms.txt 的本质是为 AI 模型提供一份结构化的网站索引。它不替代 robots.txt(控制爬取权限)或 sitemap.xml(列出所有URL),而是补充了一个语义层——告诉 AI "这个网站的核心价值是什么,哪些页面最值得关注"。

llms.txt vs robots.txt vs sitemap.xml 对比

对比维度 llms.txt robots.txt sitemap.xml
核心用途 为 AI 模型提供网站语义摘要 控制爬虫访问权限 列出网站所有URL
面向对象 AI 大模型 / LLM 所有爬虫(含搜索引擎) 搜索引擎爬虫
内容形式 Markdown 格式文本 指令式规则文本 XML 结构化数据
信息粒度 语义摘要 + 关键页面推荐 允许/禁止路径规则 URL列表 + 更新频率
GEO 作用 直接提升 AI 理解与引用效率 控制 AI 爬虫的访问范围 辅助搜索引擎发现页面
是否必须 强烈推荐(新兴标准) 强烈推荐 推荐

llms.txt 社区规范(llmstxt.org)核心要点

llms.txt 规范由 llmstxt.org 社区维护,定义了文件的标准格式和最佳实践。以下是核心规范要点:

  • 文件位置:必须放置在网站根目录,路径为 /llms.txt,可通过 https://example.com/llms.txt 直接访问
  • 文件格式:纯文本,使用 Markdown 语法,编码为 UTF-8
  • 首行标题:文件必须以一级标题(# )开头,作为网站名称
  • 摘要段落:标题后紧跟一段简短的网站描述,概括核心定位与价值
  • Pages 列表:使用 ## Pages 标记关键页面列表,每行一个链接 + 描述
  • 可选扩展:支持 ## Optional 区域放置补充信息
  • 简洁原则:整个文件建议控制在 500 行以内,信息密度优先

完整的 llms.txt 文件示例

https://example.com/llms.txt Markdown
# ExampleCorp - AI驱动的企业级数据分析平台

> ExampleCorp 提供基于大语言模型的企业级数据分析与智能决策平台,
> 帮助企业从海量数据中提取洞察、生成报告并辅助决策。
> 成立于2020年,服务超过2000家企业客户,覆盖金融、零售、制造等行业。

## 核心能力

- 智能数据分析:自然语言驱动的数据查询与可视化
- AI报告生成:自动化生成结构化分析报告
- 预测性洞察:基于机器模型的趋势预测与异常检测
- 数据安全合规:SOC 2 Type II 认证,端到端加密

## Pages

- [产品功能](https://example.com/features):平台核心功能详解与演示
- [定价方案](https://example.com/pricing):免费版、专业版与企业版定价
- [API文档](https://example.com/docs/api):RESTful API 完整参考手册
- [集成指南](https://example.com/docs/integrations):与主流数据源的接入方式
- [客户案例](https://example.com/customers):行业标杆客户的实践案例
- [关于我们](https://example.com/about):公司介绍、团队与愿景

## Optional

- [博客](https://example.com/blog):数据分析与AI行业洞察
- [更新日志](https://example.com/changelog):产品版本更新记录
- [状态页面](https://status.example.com):服务可用性实时监控
CH.02

llms.txt 编写实战

必填字段与可选字段

字段 是否必填 说明 优化建议
# 标题 必填 网站/品牌名称 包含核心关键词,简洁有力
> 摘要 必填 网站核心描述 3-5行,覆盖核心业务与差异化
## Pages 必填 关键页面列表 控制在 5-15 个,按重要性排序
## Optional 可选 补充信息区域 博客、更新日志等辅助页面
自定义章节 可选 核心能力、特色功能等 使用 ## 二级标题,增强语义结构

Pages 列表的最佳组织方式

Pages 列表是 llms.txt 中最关键的部分,它直接决定 AI 模型在检索时会优先访问哪些页面。以下是组织原则:

01

按重要性降序排列

将最核心的页面(产品/服务介绍页)放在最前面,AI 模型对列表靠前的项目权重更高。

02

每个链接附带简短描述

使用 - [页面名](URL):描述 格式,描述控制在 15 字以内,聚焦该页面的核心价值。

03

区分核心与辅助页面

核心页面(产品、定价、API文档)放在 ## Pages 下;辅助页面(博客、更新日志)放在 ## Optional 下。

04

控制总量

Pages 列表建议 5-15 个链接,Optional 建议 3-8 个。过多的链接会稀释语义焦点,降低 AI 的检索效率。

Description 的语义优化技巧

llms.txt 的摘要描述(> 引用块部分)是 AI 模型理解网站的第一入口,优化技巧如下:

  • 首句定义核心身份:用一句话说清楚"你是谁、做什么",例如"ExampleCorp 是一家提供 AI 数据分析的 SaaS 公司"
  • 第二句补充差异化:说明与竞品的关键区别,例如"业内唯一支持自然语言查询的企业级平台"
  • 第三句量化可信度:提供具体的数字支撑,例如"服务 2000+ 企业客户,年处理数据量超 50PB"
  • 使用行业术语:AI 模型在语义匹配时更倾向于专业术语(如"RAG"而非"AI 先查资料再回答")
  • 避免营销语言:去掉"领先的"、"最好的"等主观评价,AI 模型对客观事实的采信度远高于营销话术

多语言站点的 llms.txt 策略

对于多语言站点,llms.txt 规范支持通过不同的文件名提供多语言版本。策略如下:

  • 默认版本:/llms.txt 使用网站的主要语言(通常是英语)
  • 语言变体:/llms-fr.txt(法语)、/llms-zh.txt(中文)等
  • 语言代码遵循 RFC 5646:例如 zh-CNjako
  • 内容本地化而非直译:每个语言版本应根据当地用户的需求调整 Pages 列表和描述重点
多语言文件命名示例 Text
# 英文(默认)
https://example.com/llms.txt

# 中文简体
https://example.com/llms-zh.txt

# 日语
https://example.com/llms-ja.txt

# 法语
https://example.com/llms-fr.txt

三个不同行业的 llms.txt 模板

电商行业模板

侧重商品分类、促销页面、物流政策与售后服务。核心页面包括热销品类、优惠活动、退换货政策。

SaaS 行业模板

侧重产品功能、定价方案、API 文档与客户案例。核心页面包括功能对比、集成指南、开发者资源。

媒体行业模板

侧重内容分类、热门专题、作者团队与订阅服务。核心页面包括内容导航、热门文章、RSS 订阅。

电商行业 llms.txt 模板 Markdown
# ShopMall - 全品类品质电商平台

> ShopMall 是面向中国消费者的全品类品质电商平台,覆盖数码、家居、服饰、美妆等 50+ 品类。
> 自营仓储覆盖全国 30 个省市,平均配送时效 1.5 天,支持 7 天无理由退换。
> 日活用户超过 800 万,SKU 超过 2000 万。

## 热门品类

- 数码电子:手机、电脑、智能穿戴、摄影器材
- 家居生活:家具、厨具、家纺、收纳整理
- 美妆个护:护肤品、彩妆、个人护理、香水

## Pages

- [今日特卖](https://shop.com/deals):每日限时折扣与优惠券
- [全部分类](https://shop.com/categories):50+ 品类导航
- [退换货政策](https://shop.com/returns):7天无理由退换流程
- [配送说明](https://shop.com/shipping):配送范围、时效与费用
- [品牌入驻](https://shop.com/merchants):商家入驻申请与合作
SaaS 行业 llms.txt 模板 Markdown
# CloudFlow - 企业级工作流自动化平台

> CloudFlow 提供无代码工作流自动化解决方案,帮助企业实现业务流程的数字化与智能化。
> 支持 200+ 第三方应用集成,拖拽式流程编排,平均为客户节省 60% 的重复性工作。
> 获 SOC 2 Type II 和 ISO 27001 认证,服务 5000+ 企业客户。

## 核心能力

- 无代码流程编排:拖拽式设计器,零代码构建自动化流程
- 200+ 应用集成:覆盖 CRM、ERP、邮件、通讯等主流系统
- AI 智能决策:基于大模型的条件判断与异常处理

## Pages

- [产品功能](https://cloudflow.io/features):核心功能与使用场景
- [定价方案](https://cloudflow.io/pricing):免费版、专业版与企业版
- [集成列表](https://cloudflow.io/integrations):200+ 支持的第三方应用
- [API 文档](https://docs.cloudflow.io):REST API 参考手册
- [客户案例](https://cloudflow.io/customers):行业标杆客户实践
媒体行业 llms.txt 模板 Markdown
# TechPulse - 前沿科技深度媒体

> TechPulse 是专注于 AI、云计算、半导体等前沿科技领域的深度媒体平台。
> 拥有 50+ 资深科技记者与分析师团队,日均产出 30+ 篇原创深度报道。
> 月均独立访客超过 500 万,覆盖技术开发者、产品经理与科技投资者群体。

## 内容领域

- 人工智能:大模型、AI 应用、算力基础设施
- 云计算:云原生、多云架构、SaaS 生态
- 半导体:芯片设计、制造工艺、产业链分析

## Pages

- [AI 专题](https://techpulse.com/ai):人工智能领域深度报道
- [深度分析](https://techpulse.com/analysis):行业趋势与技术研判
- [作者团队](https://techpulse.com/authors):资深记者与分析师介绍
- [RSS 订阅](https://techpulse.com/rss):全站与分类 RSS 源
- [投稿指南](https://techpulse.com/contribute):作者投稿与转载规范
CH.03

llms.txt 部署与验证

部署位置:网站根目录

llms.txt 必须部署在网站的根目录下,确保通过以下 URL 可直接访问:

部署路径 Text
# 正确的部署位置
https://example.com/llms.txt

# 对应的文件系统路径
/var/www/html/llms.txt          # Apache / Nginx 默认
/public/llms.txt                # Vercel / Netlify
/docs/llms.txt                 # GitHub Pages
/static/llms.txt                # Django / Flask

服务器配置注意事项

01

设置正确的 Content-Type

确保服务器返回 text/plain; charset=utf-8。大多数服务器对 .txt 文件会自动设置,但需验证。

02

确保无访问限制

llms.txt 不能被 robots.txt 禁止访问,不能需要认证,不能被防火墙拦截。AI 爬虫需要能直接获取此文件。

03

配置 CORS 头

添加 Access-Control-Allow-Origin: *,确保前端工具和 AI 代理可以跨域获取 llms.txt。

04

设置缓存策略

建议 Cache-Control: max-age=86400(24小时),平衡及时更新与服务器负载。更新后可通过 CDN 缓存刷新立即生效。

验证工具与验证方法

手动验证

在浏览器中直接访问 https://yoursite.com/llms.txt,确认内容正确加载,无 404 错误。

curl 验证

使用 curl -I https://yoursite.com/llms.txt 检查 Content-Type 和 HTTP 状态码是否正确。

结构验证

使用 llmstxt.org 提供的在线验证工具,检查文件格式是否符合规范,包括标题、摘要、Pages 列表等。

AI 实测

在 ChatGPT 或 Perplexity 中询问与网站相关的问题,观察 AI 是否能正确引用网站信息。

常见部署错误与排查

错误现象 可能原因 排查方法
404 Not Found 文件未放置在根目录,或路径错误 检查文件是否在 Web 根目录下,确认文件名全小写
内容乱码 编码非 UTF-8 或 Content-Type 未设置 charset 确认文件保存为 UTF-8,检查服务器响应头
AI 仍未引用 robots.txt 禁止了 AI 爬虫访问 检查 robots.txt 是否允许 GPTBot、PerplexityBot 等
格式解析失败 未使用 Markdown 格式或缺少必填字段 验证是否以 # 标题开头,是否有 > 摘要和 ## Pages
更新后 AI 仍使用旧信息 缓存未刷新或 AI 尚未重新爬取 刷新 CDN 缓存,等待 AI 爬虫下次访问
CH.04

JSON-LD 概述与 Schema.org

什么是 JSON-LD,为什么对 GEO 至关重要

JSON-LD(JavaScript Object Notation for Linked Data)是一种基于 JSON 的结构化数据格式,用于在网页中嵌入语义化的机器可读信息。它通过 <script type="application/ld+json"> 标签嵌入 HTML 页面,让 AI 模型和搜索引擎能够精确理解页面内容的语义——这不仅仅是"这是关于什么",更是"这个实体有哪些属性、与其他实体有什么关系"。

对 GEO 而言,JSON-LD 的价值在于:它为 AI 模型提供了结构化、标准化、可验证的事实性信息。当 AI 模型通过 RAG 机制检索到你的页面时,JSON-LD 标记的数据比正文文本更易被提取和采信,因为它是机器可读的结构化数据,不存在自然语言理解的歧义问题。

🔗 JSON-LD 对 GEO 的三重价值
  • 语义明确性:消除自然语言的歧义,让 AI 精确理解"这是 Organization 类型、名称是 X、提供 Y 服务"
  • 关系可追溯性:通过 @id 和 sameAs 等字段,建立实体间的语义链接,构建知识图谱
  • 跨平台互操作性:Schema.org 是 Google、Bing、百度等搜索引擎共同认可的标准,AI 模型天然适配

Schema.org 类型体系概览

Schema.org 是由 Google、Microsoft、Yahoo 和 Yandex 共同创建的结构化数据词汇表,定义了数百种实体类型和数千个属性。以下是与 GEO 最相关的核心类型:

Schema 类型 用途 GEO 价值
Organization 描述组织/公司信息 建立品牌实体,提升 AI 对品牌认知的准确度
FAQPage 标记 FAQ 问答内容 直接被 AI 引用为答案来源,引用率提升显著
Product 描述产品信息 让 AI 精确推荐产品,包含价格、评分等
Service 描述服务信息 帮助 AI 理解服务范围、区域与特征
Article 标记文章/博客内容 提升内容在 AI 搜索中的引用可信度
LocalBusiness 描述本地商家信息 本地搜索场景下的 AI 推荐优化
Person 描述个人/专家信息 建立人物权威性,E-E-A-T 信号增强
HowTo 标记步骤化教程 AI 在回答"如何做"类问题时优先引用

JSON-LD vs Microdata vs RDFa 对比

对比维度 JSON-LD Microdata RDFa
语法形式 独立的 JSON 脚本块 HTML 属性嵌套 HTML 属性嵌套
与 HTML 耦合度 低(独立于 HTML 结构) 高(必须嵌入 HTML 标签) 高(必须嵌入 HTML 标签)
维护难度 低,修改不影响页面结构 高,修改需同步 HTML 高,修改需同步 HTML
Google 推荐度 首选推荐 支持但不推荐 支持但不推荐
AI 可解析性 极高,JSON 天然结构化 中,需解析 HTML 属性 中,需解析 HTML 属性
多类型共存 支持,多个 script 标签 有限,嵌套复杂 有限,嵌套复杂

AI 搜索引擎对 JSON-LD 的支持情况

目前主流 AI 搜索引擎和平台对 JSON-LD 的支持程度各不相同,但整体趋势是越来越重视:

  • Google AI Overview:深度依赖 JSON-LD 数据,FAQPage 和 Product 标记的页面在 AI 概览中被引用的概率显著更高
  • Perplexity:在生成引用时会参考页面中的 JSON-LD 结构化数据,优先引用信息完整的标记
  • Bing(Copilot):同样依赖 Schema.org 标记来理解页面内容并生成 AI 回答
  • ChatGPT(Browse):浏览模式下会解析 JSON-LD 获取结构化信息
  • 百度 AI 搜索:对 Organization 和 FAQPage 等常见类型有较好的识别能力
✅ 最佳实践

无论 AI 平台当前对 JSON-LD 的解析深度如何,部署 JSON-LD 都是一项高回报、低风险的 GEO 投入。它不仅服务于当前的 AI 搜索引擎,更是面向未来所有 AI 代理和 RAG 系统的基础设施。

CH.05

Organization 类型标记详解

Organization 是 JSON-LD 中最基础也最重要的类型之一。它为你的品牌/公司在 AI 的知识库中建立一个精确的实体画像——名称、描述、官网、联系方式、社交媒体、地址等。当用户在 AI 搜索中询问关于你的品牌时,完善的 Organization 标记能大幅提升 AI 回答的准确性和完整性。

完整的 Organization 标记代码示例

organization-schema.html JSON-LD
<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "Organization",
  "@id": "https://example.com/#organization",
  "name": "ExampleCorp",
  "alternateName": ["示例科技", "Example Corp"],
  "url": "https://example.com",
  "logo": {
    "@type": "ImageObject",
    "url": "https://example.com/logo.png",
    "width": 512,
    "height": 512
  },
  "description": "ExampleCorp 是一家提供 AI 驱动企业级数据分析平台的科技公司,帮助超过 2000 家企业客户实现数据驱动的智能决策。",
  "foundingDate": "2020",
  "founder": {
    "@type": "Person",
    "name": "张三"
  },
  "address": {
    "@type": "PostalAddress",
    "streetAddress": "天河路385号太古汇一座38层",
    "addressLocality": "广州市",
    "addressRegion": "广东省",
    "postalCode": "510620",
    "addressCountry": "CN"
  },
  "geo": {
    "@type": "GeoCoordinates",
    "latitude": 23.1365,
    "longitude": 113.3284
  },
  "contactPoint": {
    "@type": "ContactPoint",
    "telephone": "+86-400-888-9999",
    "contactType": "customer service",
    "availableLanguage": ["Chinese", "English"]
  },
  "sameAs": [
    "https://weibo.com/examplecorp",
    "https://www.zhihu.com/org/examplecorp",
    "https://github.com/examplecorp",
    "https://www.linkedin.com/company/examplecorp",
    "https://twitter.com/examplecorp"
  ],
  "knowsAbout": ["企业级数据分析", "AI 智能决策", "数据可视化"]
}
</script>

关键字段说明与优化建议

字段 重要性 说明与优化建议
@id 关键 为实体提供唯一标识符,便于其他标记引用此实体。格式:网站URL/#organization
name 关键 使用品牌官方名称,与工商注册和社交媒体保持一致
alternateName 推荐 包含品牌别名、缩写、中文名等,帮助 AI 匹配不同查询方式
description 关键 3-5 句话概括核心业务与差异化,使用精确数据和行业术语
foundingDate 推荐 使用 ISO 8601 格式(YYYY 或 YYYY-MM-DD),增强可信度
knowsAbout GEO 增强字段 非 Schema.org 标准字段,但部分 AI 模型会参考,标注核心能力领域

sameAs 字段的权威链接策略

sameAs 字段是 Organization 标记中最具 GEO 价值的字段之一。它告诉 AI 模型"这些外部页面也是关于同一个实体的",帮助 AI 在知识图谱中建立跨平台的实体一致性。策略如下:

  • 优先添加权威平台链接:维基百科、LinkedIn、GitHub(技术公司)、知乎机构号等
  • 确保链接指向的是关于你的页面:而不是你自己发布的内容页面
  • 覆盖多个平台:至少包含 3-5 个不同平台的链接,形成多源验证
  • 避免低质量链接:不要添加个人社交媒体、论坛帖子等非权威链接
  • 保持一致性:所有 sameAs 链接中关于你的描述应与 Organization 标记一致

address 与 geo 字段的优化

对于有线下业务的公司,address 和 geo 字段能帮助 AI 在"附近推荐"和"本地搜索"场景中更精准地推荐你的业务:

  • address 字段:填写完整的邮政地址,包含省市区、街道门牌号和邮编
  • geo 字段:提供精确的经纬度坐标,AI 在计算距离和推荐附近商家时依赖此字段
  • 多办公地点:如有多个办公地点,使用 address 数组或在每个地点页面使用 LocalBusiness 标记
CH.06

FAQPage 类型标记详解

FAQPage 标记对 AI 引用的显著提升效果

FAQPage 是 GEO 投入产出比最高的 Schema 类型之一。其核心优势在于:AI 模型在回答用户问题时,天然偏好引用"问答对"格式的内容——因为 FAQ 的 Question/Answer 结构与用户的查询-回答模式完全吻合。

实践数据显示,部署了 FAQPage 标记的页面,在 AI 生成回答中的引用率比纯文本 FAQ 页面高出 3-5 倍。原因很简单:JSON-LD 中的 Question 和 Answer 是结构化数据,AI 模型无需理解自然语言的上下文就能直接提取——这大幅降低了信息提取的成本和出错率。

📈 引用率提升的逻辑

FAQPage 标记 = 结构化问答对 = AI 零成本提取 = 高概率引用。自然语言 FAQ = 需要理解上下文 = 提取成本高 = 低概率引用。这就是结构化标记对 GEO 的核心价值。

完整代码示例

faq-schema.html JSON-LD
<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "name": "GEO 和传统 SEO 有什么区别?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "GEO(生成式引擎优化)面向 AI 大模型搜索场景,核心目标是让内容被 AI 引用和推荐;传统 SEO 面向搜索引擎排名,核心目标是获取点击流量。GEO 侧重语义清晰度、结构化数据和权威信源建设,SEO 侧重关键词密度、外链权重和页面排名。"
      }
    },
    {
      "@type": "Question",
      "name": "部署 llms.txt 需要多长时间?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "编写和部署 llms.txt 通常只需 1-2 小时。编写文件约 30 分钟,部署到服务器约 15 分钟,验证和调试约 30 分钟。这是一项高 ROI 的 GEO 投入。"
      }
    },
    {
      "@type": "Question",
      "name": "JSON-LD 会影响页面加载速度吗?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "JSON-LD 对页面加载速度的影响极小。一段典型的 JSON-LD 标记大小在 1-5KB 之间,远小于一张图片。浏览器不会执行 ld+json 类型的 script 标签,因此不会阻塞渲染。"
      }
    }
  ]
}
</script>

Question 与 Answer 的优化写法

01

Question 写用户真实会问的问题

使用用户在 AI 搜索中的真实查询语句,而非品牌视角的描述。例如"GEO 和 SEO 有什么区别"比"关于我们的 GEO 服务"更有效。

02

Answer 直接给结论,再补充说明

答案的第一句话就给出核心结论,后续再展开细节。AI 模型在引用时通常会截取答案的前 1-2 句,首句决定了引用质量。

03

Answer 中包含精确数据

尽量在答案中包含具体的数字、时间、比例等事实性信息。AI 模型对精确数据的采信度远高于模糊描述。

04

覆盖长尾查询场景

FAQ 中的问题应覆盖不同层次的查询:基础概念(是什么)、操作指导(怎么做)、对比分析(与X的区别)、数据事实(多少/多久)。

多 FAQ 页面的组织策略

对于内容丰富的网站,一个 FAQ 页面可能无法覆盖所有关键问题。多 FAQ 页面的组织策略:

  • 按主题分组:将 FAQ 按产品功能、价格方案、技术支持、公司信息等主题分组,每组一个页面
  • 每个页面独立标记:每个 FAQ 页面都有自己独立的 FAQPage JSON-LD 标记
  • 控制每页问题数量:建议每个 FAQ 页面包含 5-15 个问题,过多会降低每个问题被引用的概率
  • 在 llms.txt 中列出所有 FAQ 页面:确保 AI 模型能发现和访问每个 FAQ 页面
  • 定期更新:根据 AI 搜索中的实际查询数据,持续补充新的高频问题
CH.07

Product 与 Service 类型标记

当用户在 AI 搜索中询问产品推荐或服务对比时,ProductService 标记能让 AI 模型获取精确的结构化信息——产品名称、价格、评分、服务范围等,从而在回答中给出更准确的推荐。

Product 标记代码示例

product-schema.html JSON-LD
<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "Product",
  "name": "CloudFlow 专业版",
  "description": "企业级工作流自动化平台专业版,支持无代码流程编排、200+ 应用集成与 AI 智能决策。",
  "brand": {
    "@type": "Brand",
    "name": "CloudFlow"
  },
  "category": "工作流自动化软件",
  "image": "https://cloudflow.io/images/pro-plan.png",
  "offers": {
    "@type": "Offer",
    "url": "https://cloudflow.io/pricing",
    "priceCurrency": "CNY",
    "price": 2999,
    "priceValidUntil": "2026-12-31",
    "availability": "https://schema.org/InStock",
    "eligibleForQuantity": 1
  },
  "aggregateRating": {
    "@type": "AggregateRating",
    "ratingValue": 4.7,
    "bestRating": 5,
    "worstRating": 1,
    "ratingCount": 1286,
    "reviewCount": 843
  },
  "review": [
    {
      "@type": "Review",
      "author": { "@type": "Person", "name": "王经理" },
      "datePublished": "2026-03-15",
      "reviewRating": {
        "@type": "Rating",
        "ratingValue": 5,
        "bestRating": 5
      },
      "reviewBody": "使用 CloudFlow 后,我们团队的重复性工作减少了 70%,流程执行效率提升了 3 倍。"
    }
  ]
}
</script>

Service 标记代码示例

service-schema.html JSON-LD
<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "Service",
  "serviceType": "AI 数据分析咨询",
  "name": "ExampleCorp AI 数据分析服务",
  "description": "提供基于大语言模型的企业级数据分析咨询服务,包括数据架构设计、AI 模型选型、业务场景落地等。服务周期 4-12 周,已交付 200+ 项目。",
  "provider": {
    "@type": "Organization",
    "@id": "https://example.com/#organization",
    "name": "ExampleCorp"
  },
  "areaServed": {
    "@type": "Country",
    "name": "中国"
  },
  "hasOfferCatalog": {
    "@type": "OfferCatalog",
    "name": "数据分析服务套餐",
    "itemListElement": [
      {
        "@type": "Offer",
        "itemOffered": {
          "@type": "Service",
          "name": "数据架构评估",
          "description": "4周交付,评估现有数据架构并给出优化建议"
        }
      },
      {
        "@type": "Offer",
        "itemOffered": {
          "@type": "Service",
          "name": "AI 落地全案",
          "description": "12周交付,从场景梳理到模型部署的全流程服务"
        }
      }
    ]
  },
  "aggregateRating": {
    "@type": "AggregateRating",
    "ratingValue": 4.8,
    "reviewCount": 156
  }
}
</script>

review 与 aggregateRating 字段

用户评价是 AI 推荐产品时的重要参考信号。review 和 aggregateRating 字段的优化要点:

  • aggregateRating 必填:包含 ratingValue、ratingCount 或 reviewCount,缺少这些字段 AI 无法判断产品口碑
  • 评分需真实:不要伪造评分数据,AI 模型和搜索引擎都会检测异常评分模式
  • 精选 review:不必列出所有评价,选择 3-5 条最有代表性的评价(包含具体数据和使用效果)
  • review 中的 reviewBody:应包含具体的事实性信息(如"效率提升 3 倍"),而非纯情感表达(如"很好用")
  • 日期标注:每条 review 附带 datePublished,AI 模型更倾向于引用近期的评价

offers 与 price 字段优化

价格信息是 AI 在推荐产品时的重要决策因素,优化要点:

  • price 必须为数字:不要包含货币符号或文字,使用 priceCurrency 字段指定货币
  • priceValidUntil:标注价格有效期,过期价格可能导致 AI 给出错误推荐
  • availability:使用 Schema.org 标准值(InStock、OutOfStock、PreOrder 等),AI 可能不会推荐缺货产品
  • 多规格定价:如果产品有多个版本,每个版本应有独立的 Product 标记和 Offer
  • 定期更新价格:价格变更后及时更新 JSON-LD,确保 AI 获取到最新信息
CH.08

robots.txt 大模型爬虫适配

robots.txt 是控制爬虫访问权限的基础文件。在 GEO 场景下,你需要确保 AI 大模型的爬虫能够访问你的关键内容,同时合理控制爬取频率和范围。本章节详解主流 AI 爬虫的 User-Agent 及其适配策略。

主流 AI 爬虫 User-Agent 清单

AI 平台 User-Agent 用途说明 建议策略
OpenAI / ChatGPT GPTBot OpenAI 的通用网络爬虫,用于训练和检索 允许核心内容
ChatGPT 浏览 ChatGPT-User ChatGPT Browse 模式的实时检索爬虫 允许所有内容
Google AI Google-Extended Google 用于 AI 训练数据采集的爬虫 允许核心内容
Perplexity PerplexityBot Perplexity AI 搜索的索引爬虫 允许所有内容
百度 AI ByteSparrowBot 百度 AI 搜索的爬虫 允许核心内容
字节跳动 Bytespider 字节跳动通用爬虫(含 AI 训练数据采集) 按需控制
Common Crawl CCBot 开放网络爬虫,数据被多个 AI 模型使用 允许核心内容
Anthropic ClaudeBot Anthropic Claude 的网络爬虫 允许核心内容
Meta AI FacebookBot Meta 的 AI 训练数据采集爬虫 按需控制
Apple Applebot-Extended Apple 用于 AI/ML 训练的爬虫 允许核心内容

允许/禁止爬取的规则配置

建议允许爬取

产品介绍页、定价页面、FAQ 页面、博客文章、API 文档、关于我们、客户案例等核心内容页面。

建议禁止爬取

用户后台、支付页面、内部管理系统、用户隐私数据页面、临时测试页面、搜索结果页等。

针对不同爬虫的差异化策略

不同 AI 爬虫的用途不同,可以制定差异化策略:

  • 实时检索型爬虫(ChatGPT-User、PerplexityBot):这些爬虫是用户实时提问时触发的检索,应全面开放,因为它们直接决定 AI 在回答时能否引用你的内容
  • 训练数据型爬虫(GPTBot、Google-Extended、CCBot):这些爬虫采集数据用于模型训练,应开放核心内容但可适当限制爬取频率
  • 通用型爬虫(Bytespider、FacebookBot):这些爬虫用途较广,可根据自身需求选择性开放

完整的 robots.txt 示例代码

robots.txt Text
# GEO 优化的 robots.txt 配置示例
# 确保关键内容对 AI 爬虫可见

# === 通用规则 ===
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /account/
Disallow: /checkout/
Disallow: /search?
Disallow: /api/internal/
Disallow: /tmp/
Sitemap: https://example.com/sitemap.xml

# === OpenAI 爬虫(GPTBot)===
# 允许访问核心内容,禁止内部页面
User-agent: GPTBot
Allow: /products/
Allow: /features/
Allow: /pricing/
Allow: /about/
Allow: /blog/
Allow: /docs/
Allow: /faq/
Allow: /customers/
Allow: /llms.txt
Disallow: /admin/
Disallow: /account/
Disallow: /api/internal/

# === ChatGPT 浏览模式 ===
# 实时检索爬虫,全面开放核心内容
User-agent: ChatGPT-User
Allow: /
Disallow: /admin/
Disallow: /account/

# === Google AI 训练数据爬虫 ===
User-agent: Google-Extended
Allow: /products/
Allow: /features/
Allow: /pricing/
Allow: /about/
Allow: /blog/
Allow: /docs/
Allow: /faq/
Allow: /llms.txt
Disallow: /admin/
Disallow: /account/

# === Perplexity AI 搜索 ===
# 实时检索型爬虫,全面开放
User-agent: PerplexityBot
Allow: /
Disallow: /admin/

# === 百度 AI 爬虫 ===
User-agent: ByteSparrowBot
Allow: /
Disallow: /admin/
Disallow: /account/

# === Common Crawl ===
# 开放核心内容用于训练数据
User-agent: CCBot
Allow: /products/
Allow: /features/
Allow: /blog/
Allow: /docs/
Allow: /llms.txt
Disallow: /admin/

# === Anthropic Claude ===
User-agent: ClaudeBot
Allow: /
Disallow: /admin/
Disallow: /account/

# === 字节跳动通用爬虫 ===
# 按需控制:开放核心内容,限制爬取频率
User-agent: Bytespider
Allow: /products/
Allow: /features/
Allow: /blog/
Allow: /docs/
Disallow: /admin/
Disallow: /account/
Disallow: /api/

# === Apple AI 训练爬虫 ===
User-agent: Applebot-Extended
Allow: /products/
Allow: /features/
Allow: /blog/
Allow: /docs/
Allow: /llms.txt
Disallow: /admin/
⚠️ 重要提示

robots.txt 中的规则按从上到下的顺序匹配,第一个匹配的规则生效。当为特定 User-Agent 设置了独立规则后,通用规则(User-agent: *)将不再适用于该爬虫。因此,如果你为某个爬虫设置了 Allow 规则,务必同时包含需要 Disallow 的路径,否则该爬虫可能会访问到不应该公开的页面。

CH.09

部署效果追踪与优化迭代

部署 llms.txt、JSON-LD 和 robots.txt 只是 GEO 工作的起点,持续的追踪和迭代才是关键。本章节介绍如何建立完整的效果追踪体系,并基于数据不断优化。

部署后的验证清单

01
llms.txt 可访问性验证
访问 https://yoursite.com/llms.txt 确认返回 200 状态码,内容格式正确
02
JSON-LD 语法验证
使用 Google Rich Results Test 或 Schema.org Validator 验证所有 JSON-LD 标记
03
robots.txt AI 爬虫可访问性验证
使用 Google Search Console 的 robots.txt 测试工具,验证 AI 爬虫可以访问关键页面
04
JSON-LD 与页面内容一致性检查
确保标记中的数据与页面可见内容一致,避免"隐藏内容"违规
05
多页面标记完整性检查
确认每个页面都有对应的 JSON-LD 标记,FAQ 页面有 FAQPage,产品页有 Product
06
Schema.org 类型层级检查
Organization 标记中的 @id 被 Service/Product 正确引用,形成实体关联

AI 收录追踪方法

定期 AI 搜索测试

每周在 ChatGPT、Perplexity、Google AI Overview、文心一言等平台上搜索品牌关键词,记录是否被引用及引用内容。

引用内容比对

比对 AI 引用的内容与你部署的 JSON-LD/llms.txt 中的信息,判断 AI 是从结构化标记还是正文中提取的信息。

竞品对比追踪

同时测试竞品品牌在相同 AI 平台上的可见度,建立横向对比基准,评估相对优势。

服务器日志分析

分析服务器访问日志中 AI 爬虫的访问记录,了解爬取频率、访问页面和响应状态。

持续优化策略

01

基于查询数据补充 FAQ

收集 AI 搜索中用户实际查询的问题,将有价值但未覆盖的问题补充到 FAQPage 标记中。

02

更新 llms.txt 中的 Pages 列表

当新增重要页面时,及时更新 llms.txt 的 Pages 列表,确保 AI 模型能发现新内容。

03

优化 description 字段的引用率

分析 AI 引用的内容片段,优化 Organization/Product 的 description 字段,使其更贴近用户查询意图。

04

扩展 Schema 类型覆盖

在基础类型(Organization、FAQPage、Product)之外,逐步添加 HowTo、Article、VideoObject 等类型,扩大结构化数据的覆盖面。

05

跟踪新 AI 爬虫并适配

持续关注新兴 AI 平台(如新的 AI 搜索引擎)的爬虫 User-Agent,及时在 robots.txt 中添加适配规则。

常见问题 FAQ

问题 解答
部署后多久能看到效果? AI 爬虫重新索引通常需要 1-4 周。Perplexity 等实时检索型平台可能更快,训练型爬虫需要等待下次数据采集周期。
llms.txt 和 JSON-LD 哪个更重要? 两者互补而非替代。llms.txt 帮助 AI 发现和定位你的网站,JSON-LD 帮助 AI 精确理解页面内容。建议同时部署。
JSON-LD 数据必须与页面内容完全一致吗? 是的。Google 明确要求 JSON-LD 中的数据必须反映页面上可见的内容,不一致可能被视为违规。但 JSON-LD 可以比页面内容更结构化。
是否需要禁止某些 AI 爬虫? 取决于你的业务需求。如果希望最大化 AI 可见度,建议允许所有主流 AI 爬虫访问核心内容。如果有数据隐私顾虑,可以有选择地禁止。
多个页面的 Organization 标记需要重复吗? 建议在首页放完整的 Organization 标记,其他页面通过 @id 引用:"provider": {"@id": "https://example.com/#organization"}
FAQPage 中的 Answer 可以包含 HTML 吗? 不建议。Schema.org 规范中 text 字段应为纯文本。如果需要格式化,使用单独的字段或在页面正文中呈现。

下一步建议