TL;DR
- Một trình đọc LlamaIndex chuyển đổi một nguồn thành các nút hoặc tài liệu; nó không xác lập rằng nguồn đó là đầy đủ, được phép hoặc mới.
- Sử dụng Nstdata Crawl để thu thập nội dung web có cấu trúc, được hiển thị và giới hạn, sau đó sử dụng LlamaIndex để phân tích, lập chỉ mục và truy vấn các bản ghi được chấp nhận.
- Giữ địa chỉ URL nguồn, băm văn bản được chuẩn hóa, thời gian thu thập và tiêu đề trong siêu dữ liệu của nút để có thể trích dẫn và thay thế.
- Kiểm tra việc truy xuất dựa trên các sự kiện đã biết trước khi coi một chỉ mục là nguồn dữ liệu đáng tin cậy.
Những gì mà trình đọc web LlamaIndex thực hiện
Một trình đọc web LlamaIndex là một thành phần thu thập để sản xuất tài liệu cho một chỉ mục. Nó là lớp thích hợp cho việc phân tích, các nút, nhúng và truy vấn; nó không phải là sự thay thế cho quyền truy cập web đã xác định. Các kết quả tìm kiếm hiện tại cho “llamaindex web scraper” nhấn mạnh các tích hợp lấy dữ liệu từ bên thứ ba, điều này khiến ranh giới trở nên đặc biệt quan trọng: một trình đọc cần một bản ghi nội dung nhất quán trước khi có thể xây dựng một chỉ mục đáng tin cậy. Bắt đầu với Nstdata Crawl như là lớp thu thập được kiểm soát, sau đó chuyển các bản ghi đã chấp nhận tới trình đọc.
Tài liệu chính thức tham khảo trình đọc web LlamaIndex liệt kê các trình đọc như SimpleWebPageReader và AsyncWebPageReader; hãy chọn một trong số đó chỉ sau khi quyết định cách thức khám phá, hiện thị và chính sách nguồn được thực thi. Sản phẩm Crawl của Nstdata là lớp thu thập cho các bản ghi trang được giới hạn và hiển thị.
Tại sao kết nối Nstdata Crawl trước
Nstdata Crawl cung cấp giai đoạn dữ liệu web mà một trình đọc không nên phải tái tạo. Trang sản phẩm công khai của nó mô tả khám phá trang web có giới hạn, hiển thị JavaScript, giới hạn độ sâu và trang, và đầu ra có cấu trúc. Sử dụng nó khi một trang web có các trang động hoặc khi một URL phải trở thành một bộ bản ghi trang được kiểm soát.





