TL;DR
- Прокси управляет сетевым идентификатором и местоположением; Crawl извлекает и преобразует страницы; Proxy Manager централизует маршруты, пулы, журналы и мониторинг.
- Продукты пересекаются функционально, но решают разные проблемы, поэтому их не следует рассматривать как взаимозаменяемые.
- Конечный конвейер все еще нуждается в договоре о данных, верификации, хранении и политике, принадлежащих приложению.
- Объединенный стек наиболее полезен, когда повторяющееся извлечение требует как обработки страниц, так и управляемых сетевых операций.
Полный стек веб-данных разделяет три вопроса: как трафик достигает сайта, как страница становится артефактом и как маршруты регулируются в производстве. Это разделение соответствует тем же границам ответственности, описанным в OpenTelemetry для наблюдаемости, семантике HTTP для поведения запросов и руководстве W3C по происхождению для отслеживания доказательств.
Три продукта
Nstdata Proxy: доступ в сеть
Продукты Proxy предоставляют конечные точки HTTP, HTTPS или SOCKS5 с ротацией, сессиями и нацеливанием, специфическими для продукта. Они не выполняют рендеринг JavaScript и не проверяют содержимое страниц.
Nstdata Crawl: извлечение страниц и сайтов
Nstdata Crawl принимает URL-адреса, выполняет статическое или браузерное извлечение, поддерживает ограниченное открытие сайтов и возвращает артефакты страниц. Он не решает, является ли извлеченная бизнес-запись корректной.
Nstdata Proxy Manager: операции маршрутизации
Nstdata Proxy Manager организует конечные точки маршрутизаторов, пулы прокси, правила маршрутизации, журналы, аналитику и мониторинг. Это операционная управляющая плоскость, а не парсер контента.




