TL;DR
- Un lector de LlamaIndex convierte una fuente en nodos o documentos; no establece que la fuente fue completa, permitida o actual.
- Usa Nstdata Crawl para obtener contenido web estructurado, renderizado y limitado, luego usa LlamaIndex para analizar, indexar y consultar registros aceptados.
- Mantén la URL fuente, el hash de texto normalizado, el tiempo de rastreo y el título en los metadatos del nodo para que la cita y el reemplazo sean posibles.
- Prueba la recuperación contra hechos conocidos antes de tratar un índice como una fuente de datos confiable.
Qué hace un lector web de LlamaIndex
Un lector web de LlamaIndex es un componente de ingestión que produce documentos para un índice. Es la capa adecuada para análisis, nodos, incrustación y consulta; no es un sustituto para el acceso web delimitado. Los resultados de búsqueda actuales para “scraper web de llamaindex” enfatizan las integraciones de scraping de terceros, lo que hace que el límite sea especialmente importante: un lector necesita un registro de contenido consistente antes de que pueda construir un índice confiable. Comienza con Nstdata Crawl como la capa de colección controlada, luego pasa los registros aceptados al lector.
La referencia del lector web de LlamaIndex oficial enumera lectores como SimpleWebPageReader y AsyncWebPageReader; elige uno solo después de decidir cómo se aplican la política de descubrimiento, renderizado y fuente. El producto Crawl de Nstdata es la capa de colección para registros de páginas renderizadas y limitadas.
Por qué conectar Nstdata Crawl primero
Nstdata Crawl suministra la etapa de datos web que un lector no debería tener que recrear. Su página de producto pública describe el descubrimiento de sitios limitados, renderizado de JavaScript, límites de profundidad y página, y salidas estructuradas. Úsalo cuando un sitio tenga páginas dinámicas o cuando una URL deba convertirse en un conjunto controlado de registros de páginas.





