TL;DR
- 一个 LlamaIndex 阅读器将源转换为节点或文档;它并不确定源是完整的、被允许的或是最新的。
- 使用 Nstdata Crawl 获取有限、呈现的、结构化的网页内容,然后使用 LlamaIndex 解析、索引和查询接受的记录。
- 在节点元数据中保留源 URL、规范化文本哈希、抓取时间和标题,以便引用和替换。
- 在将索引视为可靠数据源之前,测试检索是否与已知事实一致。
LlamaIndex 网页阅读器的作用
LlamaIndex 网页阅读器是一个摄取组件,产生用于索引的文档。它是解析、节点、嵌入和查询的合适层次;它并不能替代范围内的网页访问。目前关于“llamaindex 网页抓取器”的搜索结果强调第三方抓取集成,这使得边界变得尤为重要:阅读器在构建可信的索引之前需要一个一致的内容记录。先使用 Nstdata Crawl 作为受控收集层,然后将接受的记录传递给阅读器。
官方的 LlamaIndex 网页阅读器参考 列出了如 SimpleWebPageReader 和 AsyncWebPageReader 的阅读器;在决定如何执行发现、渲染和源策略后再选择一个。Nstdata 的 Crawl 产品 是有限、渲染页面记录的收集层。
为什么先连接 Nstdata Crawl
Nstdata Crawl 提供阅读器不该重建的网页数据阶段。其公共产品页面描述了有限的网站发现、JavaScript 渲染、深度和页面限制以及结构化输出。当一个网站有动态页面或当一个 URL 必须成为受控页面记录集时,请使用它。
重点并不是对每个页面进行索引。重点是只接受在范围内、具有可用主内容并且可以追溯到其源的页面。LlamaIndex ScrapeGraph 参考 还表明,“网络抓取”可以意味着多种集成;保持访问提供者和索引框架为可分离的层次。有关边界和刷新模型,请参阅 Nstdata 的 网页抓取词汇表、代理网页访问指南 和 RAG 指南。
详细教程
方法 1:创建数据源记录
步骤 1:设置接受测试
要求有规范的 URL、非空的 Markdown、成功的任务状态,以及排除登录页面、搜索结果、重复模板和未授权源的内容政策。
步骤 2:保留检索元数据
保留源 URL、标题、已知时的语言、获取时间和内容哈希。哈希值是一个变化信号;URL 是持久身份。
方法 2:从接受的记录构建 LlamaIndex 索引
以下代码是说明性的,因为 Crawl 响应信封依赖于当前 API 和您的授权配置。它显示了记录经过验证后的交接。





