TL;DR
- URL 发现应结合网站地图解析和有限链接爬取;单一方法会遗漏重要页面。
- 早期规范化,保持发现来源,并拒绝注销、搜索、日历、参数陷阱和超范围主机。
- URL 映射是清单,而不是证明每个页面都有效或成功可检索的证据。
- Nstdata Crawl 可以在明确的深度、页面、包含、排除和查询规则下发现内部页面。
为什么 URL 发现比读取 sitemap.xml 更难
一个网站地图爬虫可以从 XML 开始,但许多网站有过时的网站地图条目、孤立页面、JavaScript 导航、不同语言的 URL 和创建无限爬取空间的查询组合。
心理模型: 网站地图是网站声明的清单;爬取是您实际能够观察的清单。
网站地图协议 提供标准的 URL 供给,但它补充而不是替代链接发现。
团队何时需要 URL 映射
常见用包括迁移清单、SEO 审核、文档摄取、断链分析、变更监控,以及确定哪些页面应该进入 RAG 语料库。每个用途需要不同的过滤器;“所有 URL”很少是正确的生产目标。
安全映射工作流
步骤 1:定义边界
设置允许的主机、路径前缀、最大页面、最大深度以及查询字符串的处理。排除登录、注销、购物车、帐户、站点搜索、日历、分面导航和大文件,除非明确要求。
步骤 2:解析声明的网站地图
阅读 robots.txt 中的 Sitemap: 指令,然后处理网站地图索引和 URL 集。将 lastmod 存储为提示,而不是保证的真实。
步骤 3:广度优先爬取链接
获取批准的页面,提取绝对链接,规范化片段和默认端口,并将未见的内部 URL 添加到队列中。广度优先发现通常会在深分支消耗页面预算之前产生更有用的浅层清单。
步骤 4:规范化和分类
同时保留发现的 URL 和规范键。根据来源、状态、内容类型、语言和引用页面标记每个 URL。不要仅因为它们的路径看起来相似而合并不同的页面。
Nstdata Crawl 网站地图示例
Nstdata Crawl 可以开始有限的网站爬取并返回发现的页面结果。此凭证受限的示例使用文档化的网站爬取格式;请在当前文档中验证字段。




