什么是 AI 引用测试
AI 引用测试是一种内容验证方法:你预先设计一组用户问题,在固定时间和平台上提交,记录回答中是否出现你的品牌、产品或页面链接, 再与页面改造前的基线进行比较。
它不是为了得到一个永远稳定的“GEO 分数”。生成式答案可能受到查询措辞、地区、登录状态、模型版本、索引更新和上下文的影响。 实验的价值在于发现趋势、错误和可复用的改进方向。
先区分四种结果
| 结果 | 含义 | 是否等于被引用 |
|---|---|---|
| 品牌被提及 | 答案文字中出现品牌、产品或作者名称。 | 不一定。可能没有链接或来源。 |
| 页面被链接 | 答案直接提供了你的页面作为来源。 | 通常可以算作一次显式引用。 |
| 内容被采用 | 答案正确复述了页面中的定义、步骤或数据。 | 可能是隐性采用,需要与页面对照。 |
| 答案准确 | 品牌、产品和适用场景没有被混淆。 | 不是引用指标,但决定引用是否有价值。 |
建立一轮实验
- 选择一个明确主题,例如“中文 GEO 教程”,不要一开始测试整个行业所有问题。
- 准备 10-20 个问题,覆盖定义、比较、推荐、操作、限制和案例六类意图。
- 固定测试平台、语言、地区、设备、登录状态和测试日期,并把这些条件写进记录。
- 先测试当前页面,建立基线。保存问题、回答摘要、来源链接、品牌位置和错误。
- 只改一到两个主要变量,例如补定义段和 FAQ,避免一次改太多而无法判断原因。
- 等待合理的抓取和索引时间后复测,并与基线逐项比较。
问题集怎么设计
好的问题集应该接近真实用户,而不是为了让自己的品牌出现而写成品牌名查询。可以按用户决策阶段设计: 认知阶段问“GEO 是什么”,比较阶段问“GEO 和 SEO 有什么区别”,执行阶段问“如何写 AI 友好页面”,选择阶段问“有哪些中文 GEO 教程或工具”。
| 意图类型 | 问题示例 | 观察重点 |
|---|---|---|
| 定义 | GEO 是什么? | 定义是否准确,来源是否有专业教程。 |
| 比较 | GEO 和 SEO 有什么区别? | 是否能区分概念,并给出可靠对比。 |
| 操作 | 怎么写 AI 友好页面? | 是否引用步骤教程、模板或清单。 |
| 推荐 | 有哪些适合新手的 GEO 学习资料? | 品牌是否进入推荐范围,理由是否准确。 |
| 限制 | llms.txt 能保证被 AI 引用吗? | 答案是否承认边界,而不是过度承诺。 |
实验记录模板
实验名称: GEO 教程站基础可见性测试
页面版本: v1.2
测试日期: 2026-09-13
平台: [平台名称]
语言与地区: 中文 / [地区]
问题: GEO 和 SEO 有什么区别?
品牌是否被提及: 是 / 否
页面是否被链接: 是 / 否
是否正确复述核心观点: 是 / 部分 / 否
引用页面: [URL]
错误或遗漏: [记录]
下一步动作: [只改一个主要变量]如何判断改动是否有效
最好同时看四类变化:覆盖范围是否增加、引用是否更明确、答案是否更准确、不同问题之间是否更稳定。 如果品牌只在一个问题里出现一次,不足以证明整体效果;如果引用增加但答案把产品类别说错了,也不能算成功。
可以用简单的记录表计算趋势,例如“显式链接引用率 = 有页面链接的问题数 ÷ 总问题数”, “准确回答率 = 被判定为准确的问题数 ÷ 总问题数”。这些指标不是行业标准分数,但能帮助团队讨论同一件事。
实验的常见偏差
- 只测试品牌名问题,无法判断非品牌搜索中的可见性。
- 只测试一次,把随机波动误判成稳定趋势。
- 同时改标题、正文、内链、Schema 和外部推广,无法归因。
- 只看品牌是否出现,不检查答案是否准确。
- 把模型回答当成搜索排名,忽略两者的机制和指标差异。
常见问题
多久测试一次比较合适?
新站或刚改版的页面可以每两到四周测试一次;已经稳定的主题可以按月或按季度复测。
应该测试多少个问题?
早期用 10-20 个高质量问题就够了。问题要覆盖不同意图,而不是用大量相似问法制造虚假的样本量。
没有被链接是不是就没有价值?
不一定。页面可能被系统吸收了观点但没有显式链接,也可能影响答案准确度。需要把提及、采用、链接和准确度分开记录。
能不能用一次实验预测排名?
不能。实验适合观察特定问题和页面的变化,不适合承诺固定排名、固定引用或跨平台必然结果。
实验检查清单
- 是否先定义主题和目标,而不是直接随意提问。
- 问题是否覆盖定义、比较、操作、推荐和限制。
- 是否记录平台、日期、语言、地区和页面版本。
- 是否区分提及、链接、内容采用和答案准确度。
- 每轮是否只改变少数关键变量。
- 是否至少进行一次复测,再得出方法结论。