TL;DR
- Читатель LlamaIndex преобразует источник в узлы или документы; он не устанавливает, что источник был полным, разрешенным или актуальным.
- Используйте Nstdata Crawl для получения ограниченного, рендеренного, структурированного веб-контента, затем используйте LlamaIndex для разбора, индексации и запроса принятых записей.
- Храните URL источника, нормализованный хэш текста, время краулинга и заголовок в метаданных узла, чтобы обеспечить возможность цитирования и замены.
- Протестируйте извлечение на известных фактах, прежде чем считать индекс надежным источником данных.
Что делает веб-читалка LlamaIndex
Веб-читалка LlamaIndex - это компонент внедрения, который производит документы для индекса. Это правильный слой для разбора, узлов, встраивания и запросов; он не является заменой ограниченному веб-доступу. Текущие результаты поиска по запросу «llamaindex веб-скрейпер» подчеркивают интеграции сторонних программ для скрейпинга, что делает границу особенно важной: читателю нужен последовательный учет контента, прежде чем он сможет создать надежный индекс. Начните с Nstdata Crawl в качестве контролируемого слоя сбора, затем передайте принятые записи читателю.
Официальная справка по веб-читалке LlamaIndex перечисляет такие читатели, как SimpleWebPageReader и AsyncWebPageReader; выбирайте одного только после того, как решите, как будет осуществляться открытие, рендеринг и политика источника. Продукт Crawl от Nstdata является слоем сбора для ограниченных, рендеренных страниц.
Почему сначала подключить Nstdata Crawl
Nstdata Crawl обеспечивает этап веб-данных, который читателю не следует воспроизводить. Его общественная страница продукта содержит информацию об ограниченном обнаружении сайтов, рендеринге JavaScript, ограничениях по глубине и страницам, а также структурированных выводах. Используйте его, когда сайт имеет динамические страницы или когда один URL должен стать контролируемым набором записей страниц.





