TL;DR
- Масштабное сканирование сначала сталкивается с проблемами координации, дублирования работы, валидации и повторных попыток — а не с сырой скоростью запросов.
- Используйте надежную очередь, идемпотентные задачи, бюджеты по доменам, статическое извлечение, ограниченные пулы браузеров и результаты только для добавления.
- Разделяйте по политике и целевому поведению, устанавливайте контрольные точки на каждом этапе и рассчитывайте стоимость за принятую страницу.
- Управляемый обход и операции прокси могут убрать работу по инфраструктуре, но не заменяют контрактов на данные или бизнес-валидацию.
Масштабирование сканера до миллионов страниц означает масштабирование решений и маршрутов восстановления, а не запуск миллионов одновременных запросов.
Узкие места, которые появляются первыми
Дублирующиеся URL увеличивают объем работы, повторные попытки усиливают инциденты, браузерные работники исчерпывают память, специфические для цели ограничения создают блокировку в очереди, а неполные страницы проходят за успехи. Nstdata Crawl может убрать части слоя извлечения, но архитектура все равно нуждается в идемпотентности и валидации. Спецификация семантики HTTP помогает классифицировать ответы; OpenTelemetry помогает связывать трассировки и метрики; Протокол исключения роботов информирует о политике обхода.
Архитектура производства
→ static workers → browser escalation → extraction → semantic validation → append-only storage → export




