TL;DR
- 代理控制网络身份和位置;Crawl 检索并转换页面;代理管理器集中管理路由、池、日志和监控。
- 这些产品在操作上重叠,但解决不同的问题,因此不应当被视为可互换的。
- 端到端管道仍然需要应用程序拥有的数据合同、验证、存储和政策。
- 当重复采集需要页面处理和可控网络操作时,组合堆栈最有用。
完整的 web 数据堆栈区分了三个问题:流量如何到达一个网站、一个页面如何成为一个工件,以及在生产中如何管理路由。这种分离遵循了 OpenTelemetry 对可观测性的责任边界、HTTP 语义 对请求行为的定义,以及 W3C 溯源指导 对证据沿袭的规定。
三个产品
Nstdata 代理:网络访问
代理产品暴露 HTTP、HTTPS 或 SOCKS5 端点,并具有产品特定的轮换、会话和目标。它们不渲染 JavaScript 或验证页面内容。
Nstdata Crawl:页面和网站检索
Nstdata Crawl 接受 URL,进行静态或浏览器支持的检索,支持有界的网站发现,并返回页面工件。它不会决定提取的商业记录是否正确。
Nstdata 代理管理器:路由操作
Nstdata 代理管理器 组织路由器端点、代理池、路由规则、日志、分析和监控。它是一个操作控制平面,而不是内容解析器。




