三类文件分别解决什么问题
robots.txt 用来告诉爬虫哪些路径可以访问,sitemap 用来告诉搜索引擎站点有哪些重要 URL, llms.txt 则可以作为面向 AI agent 的简明站点导览。
对 GEO 教程站来说,最稳妥的顺序是先处理 SEO 基础,再补充 AI 友好导览文件。不要把 llms.txt 当成排名开关, 它更像一张给机器阅读者的内容地图。
从 URL 到答案的技术排查链
当一个页面没有被搜索系统或 AI 搜索采用时,不要直接跳到“内容不够好”的结论。 可以按下面的顺序排查:页面是否能访问,爬虫是否允许抓取,URL 是否被发现,是否被索引,正文是否直接可读, 页面主题和实体是否清晰,最后才讨论证据和引用价值。
| 排查层 | 关键问题 | 常见原因 |
|---|---|---|
| 访问 | 公开 URL 是否返回正常页面? | 服务器错误、错误重定向、权限或部署失败。 |
| 抓取 | 爬虫是否被 robots 或网络策略拦截? | Disallow 过宽、资源加载失败、访问频率限制。 |
| 发现 | 搜索系统能否从 sitemap 或内链找到 URL? | 孤立页面、sitemap 过期、栏目页没有入口。 |
| 索引 | 页面是否被判定为可收录、非重复、非软 404? | noindex、canonical 指向错误、正文太薄或重复。 |
| 理解 | 机器能否判断页面在回答什么问题? | 标题模糊、实体冲突、正文藏在交互或图片里。 |
| 采用 | 内容是否有足够相关性和证据进入答案? | 没有直接答案、来源不足、结论过于营销化。 |
| 文件或配置 | 主要作用 | ZenLeak 当前做法 |
|---|---|---|
| robots.txt | 声明抓取允许规则和 sitemap 地址。 | 允许公开页面被抓取,并指向 sitemap。 |
| sitemap.xml | 帮助搜索系统发现站点 URL。 | 由 Astro 自动生成。 |
| llms.txt | 给 AI agent 提供站点说明和重点链接。 | 根目录提供简版,另有机器可读 JSON 索引。 |
| 结构化数据 | 用 Schema.org 描述页面类型、组织、文章和学习资源。 | 布局层自动输出 Organization、WebSite、Article 和 LearningResource。 |
配置顺序
- 先确认重要页面不是空页面,也不是完全依赖客户端脚本渲染。
- 为每个页面设置唯一 title、description、canonical 和 H1。
- 生成 sitemap,并在 robots.txt 中声明 sitemap 地址。
- 检查 robots.txt 没有误伤教程、栏目、模板和案例页面。
- 为文章页输出 Article 和 LearningResource 结构化数据。
- 提供 llms.txt、RSS 和 JSON 站点索引,方便后续工具读取。
canonical 和重复 URL
教程站很容易因为尾斜杠、参数、分页、标签和不同部署域名产生多个看起来相同的 URL。 canonical 的作用是表达首选 URL,但它不是强制命令;页面内容、内部链接、重定向和 sitemap 也应该尽量使用同一个正式地址。
对 ZenLeak 来说,正式域名是 https://zenleak.cn,教程链接统一使用尾斜杠路径。 这样搜索系统和内部工具更容易把不同入口归并到同一个页面。
内链、sitemap 和 RSS 的分工
内链表达页面关系,栏目页表达主题边界,sitemap 提供 URL 清单,RSS 提供新内容时间线。 四者不能相互替代:sitemap 里有 URL,不代表页面一定有上下文;RSS 里有新文章,也不代表旧文章有合理内链。
一个成熟的教程站应该让重要页面至少有三条发现路径:从栏目或学习路径进入,从相关教程进入, 以及从 sitemap 或 RSS 等机器入口进入。
示例配置
ZenLeak 的 robots.txt 可以从简单版本开始:
User-agent: *
Allow: /
Sitemap: https://zenleak.cn/sitemap-index.xmlllms.txt 可以用人类可读的方式概括站点:
# ZenLeak GEO 学院
ZenLeak 是一个中文 GEO 教程站,系统讲解生成式搜索优化、AI 搜索引用机制、内容结构和技术配置。
## 重点页面
- /start/ GEO 学习路径
- /basics/ GEO 入门教程
- /content/ GEO 内容优化教程
- /technical/ GEO 技术配置教程
- /templates/ GEO 模板库技术配置不要写得太激进。先保证公开教程可访问、可索引、可被稳定读取,再逐步做检测工具和实验记录。
常见问题
llms.txt 是否一定要做?
不是必须项,但教程站、文档站和知识库很适合做,因为它能给 AI agent 一个更清楚的入口。
robots.txt 里要不要专门允许 AI 爬虫?
如果你的目标是公开传播教程内容,通常可以允许公开页面被抓取。具体策略要结合版权、商业模式和服务器压力决定。
sitemap 会直接提升排名吗?
sitemap 本身不是内容质量信号,但它能帮助搜索系统发现页面,尤其适合新站和内容结构较深的网站。
技术检查清单
- robots.txt 是否允许公开教程页面被抓取。
- sitemap 是否包含首页、栏目页和文章页。
- canonical 是否统一使用正式域名 zenleak.cn。
- 文章页是否输出 Article 和 LearningResource 结构化数据。
- 站点是否提供 llms.txt、RSS 和 JSON 索引。
- 核心内容是否在 HTML 中直接可读。