llms.txt 概述与规范
什么是 llms.txt,为什么需要它
llms.txt 是一种放置在网站根目录的纯文本文件,专门为 AI 大模型(LLM)提供关于网站的简洁摘要信息。它的核心作用是帮助 AI 模型在检索网页内容之前,快速了解网站的核心定位、主要内容和关键页面,从而提高信息检索和引用的效率与准确性。
在 RAG(检索增强生成)流程中,AI 模型需要从海量网页中筛选出最相关的内容。如果网站没有 llms.txt,AI 模型只能逐页爬取和分析,效率低且容易遗漏关键信息。有了 llms.txt,AI 模型可以在检索阶段就获得网站的"名片"——了解你是谁、你提供什么、哪些页面最重要,从而更精准地匹配用户查询。
llms.txt 的本质是为 AI 模型提供一份结构化的网站索引。它不替代 robots.txt(控制爬取权限)或 sitemap.xml(列出所有URL),而是补充了一个语义层——告诉 AI "这个网站的核心价值是什么,哪些页面最值得关注"。
llms.txt vs robots.txt vs sitemap.xml 对比
| 对比维度 | llms.txt | robots.txt | sitemap.xml |
|---|---|---|---|
| 核心用途 | 为 AI 模型提供网站语义摘要 | 控制爬虫访问权限 | 列出网站所有URL |
| 面向对象 | AI 大模型 / LLM | 所有爬虫(含搜索引擎) | 搜索引擎爬虫 |
| 内容形式 | Markdown 格式文本 | 指令式规则文本 | XML 结构化数据 |
| 信息粒度 | 语义摘要 + 关键页面推荐 | 允许/禁止路径规则 | URL列表 + 更新频率 |
| GEO 作用 | 直接提升 AI 理解与引用效率 | 控制 AI 爬虫的访问范围 | 辅助搜索引擎发现页面 |
| 是否必须 | 强烈推荐(新兴标准) | 强烈推荐 | 推荐 |
llms.txt 社区规范(llmstxt.org)核心要点
llms.txt 规范由 llmstxt.org 社区维护,定义了文件的标准格式和最佳实践。以下是核心规范要点:
- 文件位置:必须放置在网站根目录,路径为
/llms.txt,可通过https://example.com/llms.txt直接访问 - 文件格式:纯文本,使用 Markdown 语法,编码为 UTF-8
- 首行标题:文件必须以一级标题(# )开头,作为网站名称
- 摘要段落:标题后紧跟一段简短的网站描述,概括核心定位与价值
- Pages 列表:使用
## Pages标记关键页面列表,每行一个链接 + 描述 - 可选扩展:支持
## Optional区域放置补充信息 - 简洁原则:整个文件建议控制在 500 行以内,信息密度优先
完整的 llms.txt 文件示例
# ExampleCorp - AI驱动的企业级数据分析平台 > ExampleCorp 提供基于大语言模型的企业级数据分析与智能决策平台, > 帮助企业从海量数据中提取洞察、生成报告并辅助决策。 > 成立于2020年,服务超过2000家企业客户,覆盖金融、零售、制造等行业。 ## 核心能力 - 智能数据分析:自然语言驱动的数据查询与可视化 - AI报告生成:自动化生成结构化分析报告 - 预测性洞察:基于机器模型的趋势预测与异常检测 - 数据安全合规:SOC 2 Type II 认证,端到端加密 ## Pages - [产品功能](https://example.com/features):平台核心功能详解与演示 - [定价方案](https://example.com/pricing):免费版、专业版与企业版定价 - [API文档](https://example.com/docs/api):RESTful API 完整参考手册 - [集成指南](https://example.com/docs/integrations):与主流数据源的接入方式 - [客户案例](https://example.com/customers):行业标杆客户的实践案例 - [关于我们](https://example.com/about):公司介绍、团队与愿景 ## Optional - [博客](https://example.com/blog):数据分析与AI行业洞察 - [更新日志](https://example.com/changelog):产品版本更新记录 - [状态页面](https://status.example.com):服务可用性实时监控
llms.txt 编写实战
必填字段与可选字段
| 字段 | 是否必填 | 说明 | 优化建议 |
|---|---|---|---|
| # 标题 | 必填 | 网站/品牌名称 | 包含核心关键词,简洁有力 |
| > 摘要 | 必填 | 网站核心描述 | 3-5行,覆盖核心业务与差异化 |
| ## Pages | 必填 | 关键页面列表 | 控制在 5-15 个,按重要性排序 |
| ## Optional | 可选 | 补充信息区域 | 博客、更新日志等辅助页面 |
| 自定义章节 | 可选 | 核心能力、特色功能等 | 使用 ## 二级标题,增强语义结构 |
Pages 列表的最佳组织方式
Pages 列表是 llms.txt 中最关键的部分,它直接决定 AI 模型在检索时会优先访问哪些页面。以下是组织原则:
按重要性降序排列
将最核心的页面(产品/服务介绍页)放在最前面,AI 模型对列表靠前的项目权重更高。
每个链接附带简短描述
使用 - [页面名](URL):描述 格式,描述控制在 15 字以内,聚焦该页面的核心价值。
区分核心与辅助页面
核心页面(产品、定价、API文档)放在 ## Pages 下;辅助页面(博客、更新日志)放在 ## Optional 下。
控制总量
Pages 列表建议 5-15 个链接,Optional 建议 3-8 个。过多的链接会稀释语义焦点,降低 AI 的检索效率。
Description 的语义优化技巧
llms.txt 的摘要描述(> 引用块部分)是 AI 模型理解网站的第一入口,优化技巧如下:
- 首句定义核心身份:用一句话说清楚"你是谁、做什么",例如"ExampleCorp 是一家提供 AI 数据分析的 SaaS 公司"
- 第二句补充差异化:说明与竞品的关键区别,例如"业内唯一支持自然语言查询的企业级平台"
- 第三句量化可信度:提供具体的数字支撑,例如"服务 2000+ 企业客户,年处理数据量超 50PB"
- 使用行业术语:AI 模型在语义匹配时更倾向于专业术语(如"RAG"而非"AI 先查资料再回答")
- 避免营销语言:去掉"领先的"、"最好的"等主观评价,AI 模型对客观事实的采信度远高于营销话术
多语言站点的 llms.txt 策略
对于多语言站点,llms.txt 规范支持通过不同的文件名提供多语言版本。策略如下:
- 默认版本:
/llms.txt使用网站的主要语言(通常是英语) - 语言变体:
/llms-fr.txt(法语)、/llms-zh.txt(中文)等 - 语言代码遵循 RFC 5646:例如
zh-CN、ja、ko - 内容本地化而非直译:每个语言版本应根据当地用户的需求调整 Pages 列表和描述重点
# 英文(默认) https://example.com/llms.txt # 中文简体 https://example.com/llms-zh.txt # 日语 https://example.com/llms-ja.txt # 法语 https://example.com/llms-fr.txt
三个不同行业的 llms.txt 模板
电商行业模板
侧重商品分类、促销页面、物流政策与售后服务。核心页面包括热销品类、优惠活动、退换货政策。
SaaS 行业模板
侧重产品功能、定价方案、API 文档与客户案例。核心页面包括功能对比、集成指南、开发者资源。
媒体行业模板
侧重内容分类、热门专题、作者团队与订阅服务。核心页面包括内容导航、热门文章、RSS 订阅。
# ShopMall - 全品类品质电商平台 > ShopMall 是面向中国消费者的全品类品质电商平台,覆盖数码、家居、服饰、美妆等 50+ 品类。 > 自营仓储覆盖全国 30 个省市,平均配送时效 1.5 天,支持 7 天无理由退换。 > 日活用户超过 800 万,SKU 超过 2000 万。 ## 热门品类 - 数码电子:手机、电脑、智能穿戴、摄影器材 - 家居生活:家具、厨具、家纺、收纳整理 - 美妆个护:护肤品、彩妆、个人护理、香水 ## Pages - [今日特卖](https://shop.com/deals):每日限时折扣与优惠券 - [全部分类](https://shop.com/categories):50+ 品类导航 - [退换货政策](https://shop.com/returns):7天无理由退换流程 - [配送说明](https://shop.com/shipping):配送范围、时效与费用 - [品牌入驻](https://shop.com/merchants):商家入驻申请与合作
# CloudFlow - 企业级工作流自动化平台 > CloudFlow 提供无代码工作流自动化解决方案,帮助企业实现业务流程的数字化与智能化。 > 支持 200+ 第三方应用集成,拖拽式流程编排,平均为客户节省 60% 的重复性工作。 > 获 SOC 2 Type II 和 ISO 27001 认证,服务 5000+ 企业客户。 ## 核心能力 - 无代码流程编排:拖拽式设计器,零代码构建自动化流程 - 200+ 应用集成:覆盖 CRM、ERP、邮件、通讯等主流系统 - AI 智能决策:基于大模型的条件判断与异常处理 ## Pages - [产品功能](https://cloudflow.io/features):核心功能与使用场景 - [定价方案](https://cloudflow.io/pricing):免费版、专业版与企业版 - [集成列表](https://cloudflow.io/integrations):200+ 支持的第三方应用 - [API 文档](https://docs.cloudflow.io):REST API 参考手册 - [客户案例](https://cloudflow.io/customers):行业标杆客户实践
# TechPulse - 前沿科技深度媒体 > TechPulse 是专注于 AI、云计算、半导体等前沿科技领域的深度媒体平台。 > 拥有 50+ 资深科技记者与分析师团队,日均产出 30+ 篇原创深度报道。 > 月均独立访客超过 500 万,覆盖技术开发者、产品经理与科技投资者群体。 ## 内容领域 - 人工智能:大模型、AI 应用、算力基础设施 - 云计算:云原生、多云架构、SaaS 生态 - 半导体:芯片设计、制造工艺、产业链分析 ## Pages - [AI 专题](https://techpulse.com/ai):人工智能领域深度报道 - [深度分析](https://techpulse.com/analysis):行业趋势与技术研判 - [作者团队](https://techpulse.com/authors):资深记者与分析师介绍 - [RSS 订阅](https://techpulse.com/rss):全站与分类 RSS 源 - [投稿指南](https://techpulse.com/contribute):作者投稿与转载规范
llms.txt 部署与验证
部署位置:网站根目录
llms.txt 必须部署在网站的根目录下,确保通过以下 URL 可直接访问:
# 正确的部署位置 https://example.com/llms.txt # 对应的文件系统路径 /var/www/html/llms.txt # Apache / Nginx 默认 /public/llms.txt # Vercel / Netlify /docs/llms.txt # GitHub Pages /static/llms.txt # Django / Flask
服务器配置注意事项
设置正确的 Content-Type
确保服务器返回 text/plain; charset=utf-8。大多数服务器对 .txt 文件会自动设置,但需验证。
确保无访问限制
llms.txt 不能被 robots.txt 禁止访问,不能需要认证,不能被防火墙拦截。AI 爬虫需要能直接获取此文件。
配置 CORS 头
添加 Access-Control-Allow-Origin: *,确保前端工具和 AI 代理可以跨域获取 llms.txt。
设置缓存策略
建议 Cache-Control: max-age=86400(24小时),平衡及时更新与服务器负载。更新后可通过 CDN 缓存刷新立即生效。
验证工具与验证方法
手动验证
在浏览器中直接访问 https://yoursite.com/llms.txt,确认内容正确加载,无 404 错误。
curl 验证
使用 curl -I https://yoursite.com/llms.txt 检查 Content-Type 和 HTTP 状态码是否正确。
结构验证
使用 llmstxt.org 提供的在线验证工具,检查文件格式是否符合规范,包括标题、摘要、Pages 列表等。
AI 实测
在 ChatGPT 或 Perplexity 中询问与网站相关的问题,观察 AI 是否能正确引用网站信息。
常见部署错误与排查
| 错误现象 | 可能原因 | 排查方法 |
|---|---|---|
| 404 Not Found | 文件未放置在根目录,或路径错误 | 检查文件是否在 Web 根目录下,确认文件名全小写 |
| 内容乱码 | 编码非 UTF-8 或 Content-Type 未设置 charset | 确认文件保存为 UTF-8,检查服务器响应头 |
| AI 仍未引用 | robots.txt 禁止了 AI 爬虫访问 | 检查 robots.txt 是否允许 GPTBot、PerplexityBot 等 |
| 格式解析失败 | 未使用 Markdown 格式或缺少必填字段 | 验证是否以 # 标题开头,是否有 > 摘要和 ## Pages |
| 更新后 AI 仍使用旧信息 | 缓存未刷新或 AI 尚未重新爬取 | 刷新 CDN 缓存,等待 AI 爬虫下次访问 |
JSON-LD 概述与 Schema.org
什么是 JSON-LD,为什么对 GEO 至关重要
JSON-LD(JavaScript Object Notation for Linked Data)是一种基于 JSON 的结构化数据格式,用于在网页中嵌入语义化的机器可读信息。它通过 <script type="application/ld+json"> 标签嵌入 HTML 页面,让 AI 模型和搜索引擎能够精确理解页面内容的语义——这不仅仅是"这是关于什么",更是"这个实体有哪些属性、与其他实体有什么关系"。
对 GEO 而言,JSON-LD 的价值在于:它为 AI 模型提供了结构化、标准化、可验证的事实性信息。当 AI 模型通过 RAG 机制检索到你的页面时,JSON-LD 标记的数据比正文文本更易被提取和采信,因为它是机器可读的结构化数据,不存在自然语言理解的歧义问题。
- 语义明确性:消除自然语言的歧义,让 AI 精确理解"这是 Organization 类型、名称是 X、提供 Y 服务"
- 关系可追溯性:通过 @id 和 sameAs 等字段,建立实体间的语义链接,构建知识图谱
- 跨平台互操作性:Schema.org 是 Google、Bing、百度等搜索引擎共同认可的标准,AI 模型天然适配
Schema.org 类型体系概览
Schema.org 是由 Google、Microsoft、Yahoo 和 Yandex 共同创建的结构化数据词汇表,定义了数百种实体类型和数千个属性。以下是与 GEO 最相关的核心类型:
| Schema 类型 | 用途 | GEO 价值 |
|---|---|---|
| Organization | 描述组织/公司信息 | 建立品牌实体,提升 AI 对品牌认知的准确度 |
| FAQPage | 标记 FAQ 问答内容 | 直接被 AI 引用为答案来源,引用率提升显著 |
| Product | 描述产品信息 | 让 AI 精确推荐产品,包含价格、评分等 |
| Service | 描述服务信息 | 帮助 AI 理解服务范围、区域与特征 |
| Article | 标记文章/博客内容 | 提升内容在 AI 搜索中的引用可信度 |
| LocalBusiness | 描述本地商家信息 | 本地搜索场景下的 AI 推荐优化 |
| Person | 描述个人/专家信息 | 建立人物权威性,E-E-A-T 信号增强 |
| HowTo | 标记步骤化教程 | AI 在回答"如何做"类问题时优先引用 |
JSON-LD vs Microdata vs RDFa 对比
| 对比维度 | JSON-LD | Microdata | RDFa |
|---|---|---|---|
| 语法形式 | 独立的 JSON 脚本块 | HTML 属性嵌套 | HTML 属性嵌套 |
| 与 HTML 耦合度 | 低(独立于 HTML 结构) | 高(必须嵌入 HTML 标签) | 高(必须嵌入 HTML 标签) |
| 维护难度 | 低,修改不影响页面结构 | 高,修改需同步 HTML | 高,修改需同步 HTML |
| Google 推荐度 | 首选推荐 | 支持但不推荐 | 支持但不推荐 |
| AI 可解析性 | 极高,JSON 天然结构化 | 中,需解析 HTML 属性 | 中,需解析 HTML 属性 |
| 多类型共存 | 支持,多个 script 标签 | 有限,嵌套复杂 | 有限,嵌套复杂 |
AI 搜索引擎对 JSON-LD 的支持情况
目前主流 AI 搜索引擎和平台对 JSON-LD 的支持程度各不相同,但整体趋势是越来越重视:
- Google AI Overview:深度依赖 JSON-LD 数据,FAQPage 和 Product 标记的页面在 AI 概览中被引用的概率显著更高
- Perplexity:在生成引用时会参考页面中的 JSON-LD 结构化数据,优先引用信息完整的标记
- Bing(Copilot):同样依赖 Schema.org 标记来理解页面内容并生成 AI 回答
- ChatGPT(Browse):浏览模式下会解析 JSON-LD 获取结构化信息
- 百度 AI 搜索:对 Organization 和 FAQPage 等常见类型有较好的识别能力
无论 AI 平台当前对 JSON-LD 的解析深度如何,部署 JSON-LD 都是一项高回报、低风险的 GEO 投入。它不仅服务于当前的 AI 搜索引擎,更是面向未来所有 AI 代理和 RAG 系统的基础设施。
Organization 类型标记详解
Organization 是 JSON-LD 中最基础也最重要的类型之一。它为你的品牌/公司在 AI 的知识库中建立一个精确的实体画像——名称、描述、官网、联系方式、社交媒体、地址等。当用户在 AI 搜索中询问关于你的品牌时,完善的 Organization 标记能大幅提升 AI 回答的准确性和完整性。
完整的 Organization 标记代码示例
<script type="application/ld+json"> { "@context": "https://schema.org", "@type": "Organization", "@id": "https://example.com/#organization", "name": "ExampleCorp", "alternateName": ["示例科技", "Example Corp"], "url": "https://example.com", "logo": { "@type": "ImageObject", "url": "https://example.com/logo.png", "width": 512, "height": 512 }, "description": "ExampleCorp 是一家提供 AI 驱动企业级数据分析平台的科技公司,帮助超过 2000 家企业客户实现数据驱动的智能决策。", "foundingDate": "2020", "founder": { "@type": "Person", "name": "张三" }, "address": { "@type": "PostalAddress", "streetAddress": "天河路385号太古汇一座38层", "addressLocality": "广州市", "addressRegion": "广东省", "postalCode": "510620", "addressCountry": "CN" }, "geo": { "@type": "GeoCoordinates", "latitude": 23.1365, "longitude": 113.3284 }, "contactPoint": { "@type": "ContactPoint", "telephone": "+86-400-888-9999", "contactType": "customer service", "availableLanguage": ["Chinese", "English"] }, "sameAs": [ "https://weibo.com/examplecorp", "https://www.zhihu.com/org/examplecorp", "https://github.com/examplecorp", "https://www.linkedin.com/company/examplecorp", "https://twitter.com/examplecorp" ], "knowsAbout": ["企业级数据分析", "AI 智能决策", "数据可视化"] } </script>
关键字段说明与优化建议
| 字段 | 重要性 | 说明与优化建议 |
|---|---|---|
| @id | 关键 | 为实体提供唯一标识符,便于其他标记引用此实体。格式:网站URL/#organization |
| name | 关键 | 使用品牌官方名称,与工商注册和社交媒体保持一致 |
| alternateName | 推荐 | 包含品牌别名、缩写、中文名等,帮助 AI 匹配不同查询方式 |
| description | 关键 | 3-5 句话概括核心业务与差异化,使用精确数据和行业术语 |
| foundingDate | 推荐 | 使用 ISO 8601 格式(YYYY 或 YYYY-MM-DD),增强可信度 |
| knowsAbout | GEO 增强字段 | 非 Schema.org 标准字段,但部分 AI 模型会参考,标注核心能力领域 |
sameAs 字段的权威链接策略
sameAs 字段是 Organization 标记中最具 GEO 价值的字段之一。它告诉 AI 模型"这些外部页面也是关于同一个实体的",帮助 AI 在知识图谱中建立跨平台的实体一致性。策略如下:
- 优先添加权威平台链接:维基百科、LinkedIn、GitHub(技术公司)、知乎机构号等
- 确保链接指向的是关于你的页面:而不是你自己发布的内容页面
- 覆盖多个平台:至少包含 3-5 个不同平台的链接,形成多源验证
- 避免低质量链接:不要添加个人社交媒体、论坛帖子等非权威链接
- 保持一致性:所有 sameAs 链接中关于你的描述应与 Organization 标记一致
address 与 geo 字段的优化
对于有线下业务的公司,address 和 geo 字段能帮助 AI 在"附近推荐"和"本地搜索"场景中更精准地推荐你的业务:
- address 字段:填写完整的邮政地址,包含省市区、街道门牌号和邮编
- geo 字段:提供精确的经纬度坐标,AI 在计算距离和推荐附近商家时依赖此字段
- 多办公地点:如有多个办公地点,使用
address数组或在每个地点页面使用 LocalBusiness 标记
FAQPage 类型标记详解
FAQPage 标记对 AI 引用的显著提升效果
FAQPage 是 GEO 投入产出比最高的 Schema 类型之一。其核心优势在于:AI 模型在回答用户问题时,天然偏好引用"问答对"格式的内容——因为 FAQ 的 Question/Answer 结构与用户的查询-回答模式完全吻合。
实践数据显示,部署了 FAQPage 标记的页面,在 AI 生成回答中的引用率比纯文本 FAQ 页面高出 3-5 倍。原因很简单:JSON-LD 中的 Question 和 Answer 是结构化数据,AI 模型无需理解自然语言的上下文就能直接提取——这大幅降低了信息提取的成本和出错率。
FAQPage 标记 = 结构化问答对 = AI 零成本提取 = 高概率引用。自然语言 FAQ = 需要理解上下文 = 提取成本高 = 低概率引用。这就是结构化标记对 GEO 的核心价值。
完整代码示例
<script type="application/ld+json"> { "@context": "https://schema.org", "@type": "FAQPage", "mainEntity": [ { "@type": "Question", "name": "GEO 和传统 SEO 有什么区别?", "acceptedAnswer": { "@type": "Answer", "text": "GEO(生成式引擎优化)面向 AI 大模型搜索场景,核心目标是让内容被 AI 引用和推荐;传统 SEO 面向搜索引擎排名,核心目标是获取点击流量。GEO 侧重语义清晰度、结构化数据和权威信源建设,SEO 侧重关键词密度、外链权重和页面排名。" } }, { "@type": "Question", "name": "部署 llms.txt 需要多长时间?", "acceptedAnswer": { "@type": "Answer", "text": "编写和部署 llms.txt 通常只需 1-2 小时。编写文件约 30 分钟,部署到服务器约 15 分钟,验证和调试约 30 分钟。这是一项高 ROI 的 GEO 投入。" } }, { "@type": "Question", "name": "JSON-LD 会影响页面加载速度吗?", "acceptedAnswer": { "@type": "Answer", "text": "JSON-LD 对页面加载速度的影响极小。一段典型的 JSON-LD 标记大小在 1-5KB 之间,远小于一张图片。浏览器不会执行 ld+json 类型的 script 标签,因此不会阻塞渲染。" } } ] } </script>
Question 与 Answer 的优化写法
Question 写用户真实会问的问题
使用用户在 AI 搜索中的真实查询语句,而非品牌视角的描述。例如"GEO 和 SEO 有什么区别"比"关于我们的 GEO 服务"更有效。
Answer 直接给结论,再补充说明
答案的第一句话就给出核心结论,后续再展开细节。AI 模型在引用时通常会截取答案的前 1-2 句,首句决定了引用质量。
Answer 中包含精确数据
尽量在答案中包含具体的数字、时间、比例等事实性信息。AI 模型对精确数据的采信度远高于模糊描述。
覆盖长尾查询场景
FAQ 中的问题应覆盖不同层次的查询:基础概念(是什么)、操作指导(怎么做)、对比分析(与X的区别)、数据事实(多少/多久)。
多 FAQ 页面的组织策略
对于内容丰富的网站,一个 FAQ 页面可能无法覆盖所有关键问题。多 FAQ 页面的组织策略:
- 按主题分组:将 FAQ 按产品功能、价格方案、技术支持、公司信息等主题分组,每组一个页面
- 每个页面独立标记:每个 FAQ 页面都有自己独立的 FAQPage JSON-LD 标记
- 控制每页问题数量:建议每个 FAQ 页面包含 5-15 个问题,过多会降低每个问题被引用的概率
- 在 llms.txt 中列出所有 FAQ 页面:确保 AI 模型能发现和访问每个 FAQ 页面
- 定期更新:根据 AI 搜索中的实际查询数据,持续补充新的高频问题
Product 与 Service 类型标记
当用户在 AI 搜索中询问产品推荐或服务对比时,Product 和 Service 标记能让 AI 模型获取精确的结构化信息——产品名称、价格、评分、服务范围等,从而在回答中给出更准确的推荐。
Product 标记代码示例
<script type="application/ld+json"> { "@context": "https://schema.org", "@type": "Product", "name": "CloudFlow 专业版", "description": "企业级工作流自动化平台专业版,支持无代码流程编排、200+ 应用集成与 AI 智能决策。", "brand": { "@type": "Brand", "name": "CloudFlow" }, "category": "工作流自动化软件", "image": "https://cloudflow.io/images/pro-plan.png", "offers": { "@type": "Offer", "url": "https://cloudflow.io/pricing", "priceCurrency": "CNY", "price": 2999, "priceValidUntil": "2026-12-31", "availability": "https://schema.org/InStock", "eligibleForQuantity": 1 }, "aggregateRating": { "@type": "AggregateRating", "ratingValue": 4.7, "bestRating": 5, "worstRating": 1, "ratingCount": 1286, "reviewCount": 843 }, "review": [ { "@type": "Review", "author": { "@type": "Person", "name": "王经理" }, "datePublished": "2026-03-15", "reviewRating": { "@type": "Rating", "ratingValue": 5, "bestRating": 5 }, "reviewBody": "使用 CloudFlow 后,我们团队的重复性工作减少了 70%,流程执行效率提升了 3 倍。" } ] } </script>
Service 标记代码示例
<script type="application/ld+json"> { "@context": "https://schema.org", "@type": "Service", "serviceType": "AI 数据分析咨询", "name": "ExampleCorp AI 数据分析服务", "description": "提供基于大语言模型的企业级数据分析咨询服务,包括数据架构设计、AI 模型选型、业务场景落地等。服务周期 4-12 周,已交付 200+ 项目。", "provider": { "@type": "Organization", "@id": "https://example.com/#organization", "name": "ExampleCorp" }, "areaServed": { "@type": "Country", "name": "中国" }, "hasOfferCatalog": { "@type": "OfferCatalog", "name": "数据分析服务套餐", "itemListElement": [ { "@type": "Offer", "itemOffered": { "@type": "Service", "name": "数据架构评估", "description": "4周交付,评估现有数据架构并给出优化建议" } }, { "@type": "Offer", "itemOffered": { "@type": "Service", "name": "AI 落地全案", "description": "12周交付,从场景梳理到模型部署的全流程服务" } } ] }, "aggregateRating": { "@type": "AggregateRating", "ratingValue": 4.8, "reviewCount": 156 } } </script>
review 与 aggregateRating 字段
用户评价是 AI 推荐产品时的重要参考信号。review 和 aggregateRating 字段的优化要点:
- aggregateRating 必填:包含 ratingValue、ratingCount 或 reviewCount,缺少这些字段 AI 无法判断产品口碑
- 评分需真实:不要伪造评分数据,AI 模型和搜索引擎都会检测异常评分模式
- 精选 review:不必列出所有评价,选择 3-5 条最有代表性的评价(包含具体数据和使用效果)
- review 中的 reviewBody:应包含具体的事实性信息(如"效率提升 3 倍"),而非纯情感表达(如"很好用")
- 日期标注:每条 review 附带 datePublished,AI 模型更倾向于引用近期的评价
offers 与 price 字段优化
价格信息是 AI 在推荐产品时的重要决策因素,优化要点:
- price 必须为数字:不要包含货币符号或文字,使用 priceCurrency 字段指定货币
- priceValidUntil:标注价格有效期,过期价格可能导致 AI 给出错误推荐
- availability:使用 Schema.org 标准值(InStock、OutOfStock、PreOrder 等),AI 可能不会推荐缺货产品
- 多规格定价:如果产品有多个版本,每个版本应有独立的 Product 标记和 Offer
- 定期更新价格:价格变更后及时更新 JSON-LD,确保 AI 获取到最新信息
robots.txt 大模型爬虫适配
robots.txt 是控制爬虫访问权限的基础文件。在 GEO 场景下,你需要确保 AI 大模型的爬虫能够访问你的关键内容,同时合理控制爬取频率和范围。本章节详解主流 AI 爬虫的 User-Agent 及其适配策略。
主流 AI 爬虫 User-Agent 清单
| AI 平台 | User-Agent | 用途说明 | 建议策略 |
|---|---|---|---|
| OpenAI / ChatGPT | GPTBot | OpenAI 的通用网络爬虫,用于训练和检索 | 允许核心内容 |
| ChatGPT 浏览 | ChatGPT-User | ChatGPT Browse 模式的实时检索爬虫 | 允许所有内容 |
| Google AI | Google-Extended | Google 用于 AI 训练数据采集的爬虫 | 允许核心内容 |
| Perplexity | PerplexityBot | Perplexity AI 搜索的索引爬虫 | 允许所有内容 |
| 百度 AI | ByteSparrowBot | 百度 AI 搜索的爬虫 | 允许核心内容 |
| 字节跳动 | Bytespider | 字节跳动通用爬虫(含 AI 训练数据采集) | 按需控制 |
| Common Crawl | CCBot | 开放网络爬虫,数据被多个 AI 模型使用 | 允许核心内容 |
| Anthropic | ClaudeBot | Anthropic Claude 的网络爬虫 | 允许核心内容 |
| Meta AI | FacebookBot | Meta 的 AI 训练数据采集爬虫 | 按需控制 |
| Apple | Applebot-Extended | Apple 用于 AI/ML 训练的爬虫 | 允许核心内容 |
允许/禁止爬取的规则配置
建议允许爬取
产品介绍页、定价页面、FAQ 页面、博客文章、API 文档、关于我们、客户案例等核心内容页面。
建议禁止爬取
用户后台、支付页面、内部管理系统、用户隐私数据页面、临时测试页面、搜索结果页等。
针对不同爬虫的差异化策略
不同 AI 爬虫的用途不同,可以制定差异化策略:
- 实时检索型爬虫(ChatGPT-User、PerplexityBot):这些爬虫是用户实时提问时触发的检索,应全面开放,因为它们直接决定 AI 在回答时能否引用你的内容
- 训练数据型爬虫(GPTBot、Google-Extended、CCBot):这些爬虫采集数据用于模型训练,应开放核心内容但可适当限制爬取频率
- 通用型爬虫(Bytespider、FacebookBot):这些爬虫用途较广,可根据自身需求选择性开放
完整的 robots.txt 示例代码
# GEO 优化的 robots.txt 配置示例 # 确保关键内容对 AI 爬虫可见 # === 通用规则 === User-agent: * Allow: / Disallow: /admin/ Disallow: /account/ Disallow: /checkout/ Disallow: /search? Disallow: /api/internal/ Disallow: /tmp/ Sitemap: https://example.com/sitemap.xml # === OpenAI 爬虫(GPTBot)=== # 允许访问核心内容,禁止内部页面 User-agent: GPTBot Allow: /products/ Allow: /features/ Allow: /pricing/ Allow: /about/ Allow: /blog/ Allow: /docs/ Allow: /faq/ Allow: /customers/ Allow: /llms.txt Disallow: /admin/ Disallow: /account/ Disallow: /api/internal/ # === ChatGPT 浏览模式 === # 实时检索爬虫,全面开放核心内容 User-agent: ChatGPT-User Allow: / Disallow: /admin/ Disallow: /account/ # === Google AI 训练数据爬虫 === User-agent: Google-Extended Allow: /products/ Allow: /features/ Allow: /pricing/ Allow: /about/ Allow: /blog/ Allow: /docs/ Allow: /faq/ Allow: /llms.txt Disallow: /admin/ Disallow: /account/ # === Perplexity AI 搜索 === # 实时检索型爬虫,全面开放 User-agent: PerplexityBot Allow: / Disallow: /admin/ # === 百度 AI 爬虫 === User-agent: ByteSparrowBot Allow: / Disallow: /admin/ Disallow: /account/ # === Common Crawl === # 开放核心内容用于训练数据 User-agent: CCBot Allow: /products/ Allow: /features/ Allow: /blog/ Allow: /docs/ Allow: /llms.txt Disallow: /admin/ # === Anthropic Claude === User-agent: ClaudeBot Allow: / Disallow: /admin/ Disallow: /account/ # === 字节跳动通用爬虫 === # 按需控制:开放核心内容,限制爬取频率 User-agent: Bytespider Allow: /products/ Allow: /features/ Allow: /blog/ Allow: /docs/ Disallow: /admin/ Disallow: /account/ Disallow: /api/ # === Apple AI 训练爬虫 === User-agent: Applebot-Extended Allow: /products/ Allow: /features/ Allow: /blog/ Allow: /docs/ Allow: /llms.txt Disallow: /admin/
robots.txt 中的规则按从上到下的顺序匹配,第一个匹配的规则生效。当为特定 User-Agent 设置了独立规则后,通用规则(User-agent: *)将不再适用于该爬虫。因此,如果你为某个爬虫设置了 Allow 规则,务必同时包含需要 Disallow 的路径,否则该爬虫可能会访问到不应该公开的页面。
部署效果追踪与优化迭代
部署 llms.txt、JSON-LD 和 robots.txt 只是 GEO 工作的起点,持续的追踪和迭代才是关键。本章节介绍如何建立完整的效果追踪体系,并基于数据不断优化。
部署后的验证清单
AI 收录追踪方法
定期 AI 搜索测试
每周在 ChatGPT、Perplexity、Google AI Overview、文心一言等平台上搜索品牌关键词,记录是否被引用及引用内容。
引用内容比对
比对 AI 引用的内容与你部署的 JSON-LD/llms.txt 中的信息,判断 AI 是从结构化标记还是正文中提取的信息。
竞品对比追踪
同时测试竞品品牌在相同 AI 平台上的可见度,建立横向对比基准,评估相对优势。
服务器日志分析
分析服务器访问日志中 AI 爬虫的访问记录,了解爬取频率、访问页面和响应状态。
持续优化策略
基于查询数据补充 FAQ
收集 AI 搜索中用户实际查询的问题,将有价值但未覆盖的问题补充到 FAQPage 标记中。
更新 llms.txt 中的 Pages 列表
当新增重要页面时,及时更新 llms.txt 的 Pages 列表,确保 AI 模型能发现新内容。
优化 description 字段的引用率
分析 AI 引用的内容片段,优化 Organization/Product 的 description 字段,使其更贴近用户查询意图。
扩展 Schema 类型覆盖
在基础类型(Organization、FAQPage、Product)之外,逐步添加 HowTo、Article、VideoObject 等类型,扩大结构化数据的覆盖面。
跟踪新 AI 爬虫并适配
持续关注新兴 AI 平台(如新的 AI 搜索引擎)的爬虫 User-Agent,及时在 robots.txt 中添加适配规则。
常见问题 FAQ
| 问题 | 解答 |
|---|---|
| 部署后多久能看到效果? | AI 爬虫重新索引通常需要 1-4 周。Perplexity 等实时检索型平台可能更快,训练型爬虫需要等待下次数据采集周期。 |
| llms.txt 和 JSON-LD 哪个更重要? | 两者互补而非替代。llms.txt 帮助 AI 发现和定位你的网站,JSON-LD 帮助 AI 精确理解页面内容。建议同时部署。 |
| JSON-LD 数据必须与页面内容完全一致吗? | 是的。Google 明确要求 JSON-LD 中的数据必须反映页面上可见的内容,不一致可能被视为违规。但 JSON-LD 可以比页面内容更结构化。 |
| 是否需要禁止某些 AI 爬虫? | 取决于你的业务需求。如果希望最大化 AI 可见度,建议允许所有主流 AI 爬虫访问核心内容。如果有数据隐私顾虑,可以有选择地禁止。 |
| 多个页面的 Organization 标记需要重复吗? | 建议在首页放完整的 Organization 标记,其他页面通过 @id 引用:"provider": {"@id": "https://example.com/#organization"} |
| FAQPage 中的 Answer 可以包含 HTML 吗? | 不建议。Schema.org 规范中 text 字段应为纯文本。如果需要格式化,使用单独的字段或在页面正文中呈现。 |