学习AI引用数据采集、内容结构逆向分析、技术标注提取等竞品GEO情报采集方法。
AI引用数据是GEO竞品分析的核心数据源。采集方法分为手动采集和自动化采集两种。手动采集适用于小规模分析,通过在主流AI搜索引擎中搜索目标关键词,记录哪些竞品内容被引用。自动化采集适用于大规模持续监测,通过API或爬虫定期查询AI搜索结果。
采集数据应包括:引用的竞品URL、引用在AI回答中的位置(首次引用/后续引用)、引用的片段内容、引用的上下文(问题和完整回答)。这些数据为后续分析提供了完整的原始素材。
内容结构逆向分析是理解竞品GEO策略的关键步骤。通过分析被AI引用的竞品页面的内容结构,可以揭示AI引擎偏好的内容模式。重点分析内容包括:标题层次结构、段落长度分布、信息密度、数据引用模式、列表和表格使用频率等。
逆向分析的核心方法是「AI视角还原」——站在AI引擎的角度审视竞品页面,理解它为什么被引用。通常会发现,被高频引用的页面具有共同的结构特征:清晰的标题层次、适中的段落长度、高频的数据引用、丰富的列表和表格。
| 分析维度 | 采集方法 | 关键指标 | 典型发现 |
|---|---|---|---|
| 标题结构 | 爬取页面标题层级 | H2/H3数量、关键词密度 | 被引用页面平均4-6个H2 |
| 段落长度 | 文本分析 | 平均字数、最长/最短段落 | 80-150字段落最易被提取 |
| 信息密度 | 实体识别+事实提取 | 每千字事实点数量 | 高频引用页面密度>5个/千字 |
| 数据引用 | 正则匹配+人工校验 | 数据引用次数和来源标注率 | 被引用页面数据标注率>60% |
| 结构化元素 | DOM分析 | 列表/表格/代码块占比 | 被引用页面结构化元素占比>30% |
技术标注提取分析竞品的Schema.org结构化数据、元数据标注和技术SEO实现。这是评估竞品GEO技术完备度的核心方法。通过查看页面源码和使用结构化数据测试工具,可以获取竞品的完整Schema标注信息。
重点关注:竞品是否使用了Article、FAQ、HowTo等GEO高价值Schema类型,标注的完整度和准确性如何,是否有独特的标注策略(如同时使用Article和FAQ来覆盖更多AI引用场景)。
## 竞品Schema标注提取流程 ### 第一步:页面源码获取 - 使用curl或浏览器开发者工具获取页面HTML - 搜索 <script type="application/ld+json"> 标签 - 提取所有JSON-LD数据块 ### 第二步:标注类型分析 - 统计使用的Schema类型(Article/FAQ/HowTo等) - 检查必填字段的完整度 - 评估标注的准确性和一致性 ### 第三步:标注策略评估 - 是否使用了多类型组合标注 - 是否有自定义扩展字段 - 关键词在标注中的分布模式 ### 第四步:差距识别 - 对标自身标注,识别缺失类型 - 评估可改进的标注字段 - 制定标注策略优化方案
将采集到的情报系统化存储是持续分析的基础。建议构建一个竞品GEO情报数据库,包含以下核心数据表:竞品基本信息、AI引用记录、内容结构分析、技术标注分析、时间序列变化。数据库应支持快速查询和趋势分析。
数据库可以从小型电子表格开始,随着数据量增长迁移到关系型数据库。关键是要确保数据的结构化和可查询性,避免原始数据堆积而无法分析。