TL;DR
- 一个生产 RAG 管道与 LlamaIndex 在需要复杂查询引擎之前需要一个受管控的摄取系统。 脆弱的源集合无法通过嵌入或提示得到修复。
- 每个网页文档应在索引中携带规范 URL、检索时间、内容哈希、架构版本和接受状态。
- Nstdata Crawl 可以为授权的页面和网站提供有界集合和审核工件。 然后 LlamaIndex 负责文档转换、索引、检索和应用程序编排。
- 使用稳定的文档 ID 和幂等的更新,以便重试和重新抓取不会创建重复知识。
- 生产评估必须包括无答复问题、已更改页面、过时文档和引用验证。 仅仅检索命中率是不够的。
生产 RAG 网页抓取管道需要什么?
生产 RAG 网页抓取管道需要受控的发现、可归因的检索、语义验证、文档版本控制、转换、索引、评估和删除或替换。Nstdata Crawl 可以提供管理的集合层,而 LlamaIndex 组织文档和检索。边界很重要:爬虫检索源材料;LlamaIndex 不会使不完整或未经授权的内容值得信任。
原型教程通常加载一个 URL,拆分文本,创建一个向量索引,并提出一个问题。生产系统还必须回答当 URL 重定向、页面变为空、文档更改、嵌入写入部分失败或某个源必须被删除时会发生什么。Nstdata 的 RAG 文档助手 提供了相关产品背景,但下面的管道增加了操作接受和恢复。
开始之前需要准备什么?
您需要一个授权的源清单、一个抓取政策、一个规范化政策、一个文档架构、一个 LlamaIndex 环境、一个嵌入提供者或本地模型、一个向量存储,以及一个评估集。将凭据保存在环境变量或获得批准的秘密存储中。不要将它们放在笔记本、提示、日志或提交的配置中。
定义一个文档接受记录,包括 document_id、canonical_url、retrieved_at、content_hash、content_type、language、source_status、schema_version 和 accepted。定义重新抓取如何替换或版本之前的块。在索引受控或授权内容之前定义删除行为。
将网页转化为可用数据 |




