三类文件分别解决什么问题

robots.txt 用来告诉爬虫哪些路径可以访问,sitemap 用来告诉搜索引擎站点有哪些重要 URL, llms.txt 则可以作为面向 AI agent 的简明站点导览。

对 GEO 教程站来说,最稳妥的顺序是先处理 SEO 基础,再补充 AI 友好导览文件。不要把 llms.txt 当成排名开关, 它更像一张给机器阅读者的内容地图。

从 URL 到答案的技术排查链

当一个页面没有被搜索系统或 AI 搜索采用时,不要直接跳到“内容不够好”的结论。 可以按下面的顺序排查:页面是否能访问,爬虫是否允许抓取,URL 是否被发现,是否被索引,正文是否直接可读, 页面主题和实体是否清晰,最后才讨论证据和引用价值。

排查层关键问题常见原因
访问公开 URL 是否返回正常页面?服务器错误、错误重定向、权限或部署失败。
抓取爬虫是否被 robots 或网络策略拦截?Disallow 过宽、资源加载失败、访问频率限制。
发现搜索系统能否从 sitemap 或内链找到 URL?孤立页面、sitemap 过期、栏目页没有入口。
索引页面是否被判定为可收录、非重复、非软 404?noindex、canonical 指向错误、正文太薄或重复。
理解机器能否判断页面在回答什么问题?标题模糊、实体冲突、正文藏在交互或图片里。
采用内容是否有足够相关性和证据进入答案?没有直接答案、来源不足、结论过于营销化。
文件或配置主要作用ZenLeak 当前做法
robots.txt声明抓取允许规则和 sitemap 地址。允许公开页面被抓取,并指向 sitemap。
sitemap.xml帮助搜索系统发现站点 URL。由 Astro 自动生成。
llms.txt给 AI agent 提供站点说明和重点链接。根目录提供简版,另有机器可读 JSON 索引。
结构化数据用 Schema.org 描述页面类型、组织、文章和学习资源。布局层自动输出 Organization、WebSite、Article 和 LearningResource。

配置顺序

  1. 先确认重要页面不是空页面,也不是完全依赖客户端脚本渲染。
  2. 为每个页面设置唯一 title、description、canonical 和 H1。
  3. 生成 sitemap,并在 robots.txt 中声明 sitemap 地址。
  4. 检查 robots.txt 没有误伤教程、栏目、模板和案例页面。
  5. 为文章页输出 Article 和 LearningResource 结构化数据。
  6. 提供 llms.txt、RSS 和 JSON 站点索引,方便后续工具读取。

canonical 和重复 URL

教程站很容易因为尾斜杠、参数、分页、标签和不同部署域名产生多个看起来相同的 URL。 canonical 的作用是表达首选 URL,但它不是强制命令;页面内容、内部链接、重定向和 sitemap 也应该尽量使用同一个正式地址。

对 ZenLeak 来说,正式域名是 https://zenleak.cn,教程链接统一使用尾斜杠路径。 这样搜索系统和内部工具更容易把不同入口归并到同一个页面。

内链、sitemap 和 RSS 的分工

内链表达页面关系,栏目页表达主题边界,sitemap 提供 URL 清单,RSS 提供新内容时间线。 四者不能相互替代:sitemap 里有 URL,不代表页面一定有上下文;RSS 里有新文章,也不代表旧文章有合理内链。

一个成熟的教程站应该让重要页面至少有三条发现路径:从栏目或学习路径进入,从相关教程进入, 以及从 sitemap 或 RSS 等机器入口进入。

示例配置

ZenLeak 的 robots.txt 可以从简单版本开始:

User-agent: *
Allow: /

Sitemap: https://zenleak.cn/sitemap-index.xml

llms.txt 可以用人类可读的方式概括站点:

# ZenLeak GEO 学院

ZenLeak 是一个中文 GEO 教程站,系统讲解生成式搜索优化、AI 搜索引用机制、内容结构和技术配置。

## 重点页面
- /start/ GEO 学习路径
- /basics/ GEO 入门教程
- /content/ GEO 内容优化教程
- /technical/ GEO 技术配置教程
- /templates/ GEO 模板库
实务建议

技术配置不要写得太激进。先保证公开教程可访问、可索引、可被稳定读取,再逐步做检测工具和实验记录。

常见问题

llms.txt 是否一定要做?

不是必须项,但教程站、文档站和知识库很适合做,因为它能给 AI agent 一个更清楚的入口。

robots.txt 里要不要专门允许 AI 爬虫?

如果你的目标是公开传播教程内容,通常可以允许公开页面被抓取。具体策略要结合版权、商业模式和服务器压力决定。

sitemap 会直接提升排名吗?

sitemap 本身不是内容质量信号,但它能帮助搜索系统发现页面,尤其适合新站和内容结构较深的网站。

技术检查清单

  • robots.txt 是否允许公开教程页面被抓取。
  • sitemap 是否包含首页、栏目页和文章页。
  • canonical 是否统一使用正式域名 zenleak.cn。
  • 文章页是否输出 Article 和 LearningResource 结构化数据。
  • 站点是否提供 llms.txt、RSS 和 JSON 索引。
  • 核心内容是否在 HTML 中直接可读。

延伸阅读