// TABLE OF CONTENTS
  1. AI引用数据采集
  2. 竞品内容结构逆向分析
  3. 竞品技术标注提取
  4. 竞品GEO情报数据库构建
CHAPTER 01

AI引用数据采集

AI引用数据是GEO竞品分析的核心数据源。采集方法分为手动采集和自动化采集两种。手动采集适用于小规模分析,通过在主流AI搜索引擎中搜索目标关键词,记录哪些竞品内容被引用。自动化采集适用于大规模持续监测,通过API或爬虫定期查询AI搜索结果。

采集数据应包括:引用的竞品URL、引用在AI回答中的位置(首次引用/后续引用)、引用的片段内容、引用的上下文(问题和完整回答)。这些数据为后续分析提供了完整的原始素材。

CHAPTER 02

竞品内容结构逆向分析

内容结构逆向分析是理解竞品GEO策略的关键步骤。通过分析被AI引用的竞品页面的内容结构,可以揭示AI引擎偏好的内容模式。重点分析内容包括:标题层次结构、段落长度分布、信息密度、数据引用模式、列表和表格使用频率等。

逆向分析的核心方法是「AI视角还原」——站在AI引擎的角度审视竞品页面,理解它为什么被引用。通常会发现,被高频引用的页面具有共同的结构特征:清晰的标题层次、适中的段落长度、高频的数据引用、丰富的列表和表格。

分析维度 采集方法 关键指标 典型发现
标题结构 爬取页面标题层级 H2/H3数量、关键词密度 被引用页面平均4-6个H2
段落长度 文本分析 平均字数、最长/最短段落 80-150字段落最易被提取
信息密度 实体识别+事实提取 每千字事实点数量 高频引用页面密度>5个/千字
数据引用 正则匹配+人工校验 数据引用次数和来源标注率 被引用页面数据标注率>60%
结构化元素 DOM分析 列表/表格/代码块占比 被引用页面结构化元素占比>30%
CHAPTER 03

竞品技术标注提取

技术标注提取分析竞品的Schema.org结构化数据、元数据标注和技术SEO实现。这是评估竞品GEO技术完备度的核心方法。通过查看页面源码和使用结构化数据测试工具,可以获取竞品的完整Schema标注信息。

重点关注:竞品是否使用了Article、FAQ、HowTo等GEO高价值Schema类型,标注的完整度和准确性如何,是否有独特的标注策略(如同时使用Article和FAQ来覆盖更多AI引用场景)。

competitor_schema_extract.md markdown
## 竞品Schema标注提取流程

### 第一步:页面源码获取
- 使用curl或浏览器开发者工具获取页面HTML
- 搜索 <script type="application/ld+json"> 标签
- 提取所有JSON-LD数据块

### 第二步:标注类型分析
- 统计使用的Schema类型(Article/FAQ/HowTo等)
- 检查必填字段的完整度
- 评估标注的准确性和一致性

### 第三步:标注策略评估
- 是否使用了多类型组合标注
- 是否有自定义扩展字段
- 关键词在标注中的分布模式

### 第四步:差距识别
- 对标自身标注,识别缺失类型
- 评估可改进的标注字段
- 制定标注策略优化方案
CHAPTER 04

竞品GEO情报数据库构建

将采集到的情报系统化存储是持续分析的基础。建议构建一个竞品GEO情报数据库,包含以下核心数据表:竞品基本信息、AI引用记录、内容结构分析、技术标注分析、时间序列变化。数据库应支持快速查询和趋势分析。

数据库可以从小型电子表格开始,随着数据量增长迁移到关系型数据库。关键是要确保数据的结构化和可查询性,避免原始数据堆积而无法分析。