Наиболее сильным публичным ориентиром для сканирования 2026 года, найденным для этого обзора, является собственный набор данных Firecrawl из 1,000 URL: 96% охвата, 0.638 F1 извлечения, 0.639 воспоминания о контенте и 3,387 мс задержки P95.
Эти числа измеряют охват и качество сбора данных Firecrawl на опубликованном наборе данных; это не универсальная процентная ставка успешного API сканирования или аналогичный результат для каждого поставщика.
Не было найдено сопоставимого набора данных процентной ставки успеха от первого лица для других API, рассмотренных здесь, поэтому их строки помечены как "независимо несопоставимые", а не заполнены оценками.
Покупатель должен воспроизвести тест на целевых доменах и оценить принятые поля, а не только завершение HTTP или возвращенные Markdown.
Заключение и данные для бенчмаркинга
Убедительное заключение таково, что у Firecrawl есть наиболее четкие публичные свидетельства бенчмаркинга, в то время как на рынке по-прежнему отсутствует единый независимо воспроизводимый рейтинг API сканирования. Firecrawl сообщает о запуске 13 января 2026 года, используя 1,000 URL из десяти категорий публичных веб-сайтов. Его определение охвата заключается в том, извлек ли инструмент хотя бы 10% ожидаемого текста основного страницы, исключая навигацию, рекламу и нижние колонтитулы.
Поставщик или система
Показатель охвата / успеха
Показатель качества
Задержка
Тип доказательства
Firecrawl
96%
F1 0.638; воспоминание 0.639
P95 3,387 мс
Поставщик-управляемый, датированный публичный набор данных
Попробуйте Nstdata - Начните бесплатный тест сегодня
Страница Firecrawl benchmark page публикует название набора данных, дату, определения метрик и объем. Firecrawl также говорит, что его платформа еще не опубликована полностью, поэтому входной набор данных можно проверить, но полный запуск не полностью воспроизводим.
Для варианта Nstdata, просмотрите Nstdata Crawl и подтвердите текущую поверхность API перед запуском сравнения.
Методология: что должен контролировать полезный бенчмарк сканирования
Полезный бенчмарк API сканирования фиксирует набор URL, параметры запроса, политику таймаута, формат вывода, параллелизм, бюджет повторных попыток и правила принятия перед запуском любого поставщика. Без этих контролей "процент успеха" может означать завершенный запрос HTTP, любое непустое тело или страницу, которая на самом деле содержит требуемые поля.
Используйте стратифицированный набор публичных, авторизованных URL по документации, электронной коммерции, новостям, финансам, страницам с тяжелым JavaScript, перенаправлениям, PDF и ошибкам. Заморозьте список URL и зафиксируйте дату теста. Сначала протестируйте каждого поставщика с настройками по умолчанию, затем публикуйте отдельно помеченные отрегулированные результаты.
Оцените как минимум четыре исхода:
Успех транспортировки: API вернул терминальный успешный ответ в пределах бюджета времени.
Охват контента: результат содержит ожидаемый текст основной страницы.
Качество извлечения: требуемые поля соответствуют аннотированному человеком эталону.
Операционная задержка: укажите медиану и P95, а не только среднее значение.
Набор данных Firecrawl scrape-content dataset является полезной отправной точкой для воспроизводимого входного набора, но покупатель в производстве должен добавить представительные целевые страницы. Также консультируйтесь с HTTP Semantics при определении правил принятия и поведения при транспортировке.
Таблица поставщиков: отделите измеренные данные от заявлений
Ниже указанная таблица фиксирует только цифры, которые можно привязать к названному источнику и объему измерений.
Поставщик
Что можно сказать
Что нельзя вывести
Firecrawl
96% охвата, F1 0.638, воспоминание 0.639, P95 3,387 мс на своем запуске из 1,000 URL 13 января 2026 года
Гарантированный уровень на ваших доменах или универсальный рейтинг
Nstdata Crawl
Текущую поверхность продукта следует проверить на форматы API, рендеринг, открытие и ограничения
Процент успеха без зарегистрированного, сопоставимого запуска
Другие API сканирования
Включают только оценку с опубликованным набором данных, датой, платформой и определением принятия
Сравнение заявлений поставщика главной страницы, как если бы они были одним бенчмарком
Nstdata Crawl является разумным кандидатом для сравнения, управляемого покупателем, когда рабочий процесс требует сканирования страниц, ограниченного открытия сайта, рендеринга JavaScript или структурированных и визуальных выводов. Просмотрите продукт Nstdata Crawl и документацию Nstdata для текущей поверхности API, затем запустите тот же набор URL против каждого поставщика.
Суммарная степень успешности может скрыть именно те страницы, которые важны для бизнеса. Сообщите результаты по домену, типу страницы, требованиям к рендерингу и причинам неудачи.
Сегмент
Полезные поля
Документация
заголовок, блок кода, канонический URL, ссылки
Электронная коммерция
ID продукта, название, цена, доступность, валюта
Новости
название, время публикации, автор, текст статьи
Финансы
название инструмента, временная метка, значение, единица
JavaScript-насыщенные
рендеренный заголовок, время ожидания сети, финальный URL
PDF или бинарные
статус загрузки, количество страниц, извлеченный текст
Для каждого сегмента публикуйте попытки, конечные успехи, принятые записи, медианное время задержки, P95 задержку и основные классы неудач. Не превращайте маленькую выборку в точный рейтинг.
Анализ: почему одна только степень успешности недостаточна
Покрытие — это ворота, а не окончательный бизнес-результат. Инструмент может вернуть достаточно текста, чтобы преодолеть порог в 10%, пропуская цену, ID продукта или таблицу, которые делают страницу полезной. Напротив, страница может не пройти правило текстового покрытия, но все равно вернуть точно структурированное поле, необходимое приложению.
Стоимость за принятую запись обычно более реализуема, чем стоимость за запрос. Отслеживайте повторы, пустые результаты, сбои схемы, ручную проверку и размер хранилища. Также сравните оперативные работы, необходимые для поддержания действий браузера, селекторов, пагинации и специфичных исключений для сайта.
Воспроизводимый код оценки
Этот маленький оцениватель умышленно офлайн: он сравнивает возвращенную JSON запись с эталонной записью и не обращается к какому-либо провайдеру.
defscore_record(reference, candidate, required_fields): present =sum(bool(candidate.get(field))for field in required_fields) exact =sum(candidate.get(field)== reference.get(field)for field in required_fields)return{"coverage": present /len(required_fields),"exact_match": exact /len(required_fields),"accepted":all(candidate.get(field)for field in required_fields),}
Сопоставьте оцениватель с фиксированным манифестом, журналами запросов провайдера, статусом ответа, временем выполнения и зашумленными ID задач. Код является иллюстративным; ни один запуск провайдера не утверждается в этой статье.
Блог Nstdata и обзор дата-центров предоставляют смежный контекст инфраструктуры, а не оценки тестирования ползунков.
Страница продукта Firecrawl является источником от продавца, а не независимым эталоном.
Ограничения
Этот обзор сравнивает общественные данные, а не недавно выполненный много-провайдерный тест. Сообщенные метрики Firecrawl исходят из его собственного запуска и определения покрытия. Полный бенчмаркинговый механизм не опубликован, значения по умолчанию провайдера могут отличаться, целевые страницы меняются, и выборка из 1000 URL не может представлять каждую страну, домен, тип контента или слой защиты. Рассматривайте таблицу как отправную точку для тестирования закупок.
Для авторизованного испытания, начните с Nstdata и запишите те же метрики для того же манифеста URL.
В: Какова хорошая степень успешности API ползунка?
Универсального порога нет; определите успех как принятую запись для ваших целевых страниц и сообщите набор данных, знаменатель, классы ошибок и задержку рядом с процентом.
В: Является ли 96% от Firecrawl универсальной степенью успешности?
Нет. Это результат покрытия Firecrawl на устаревшем эталоне из 1000 URL с конкретным определением основного текста в 10%.
В: Почему другие провайдеры помечены как несравнимые?
Им не были присвоены вымышленные числа, когда никакой аналогичный набор данных, аналогичный механизм, первый результат стороннего провайдера не был подтвержден в этом обзоре.
В: Следует ли мне оценивать API на своих собственных доменах?
Да. Используйте общественные или авторизованные URL, которые представляют вашу рабочую нагрузку, зафиксируйте манифест и оцените поля, которые на самом деле нужны вашему приложению.
В: Заменяет ли API ползунка специальные проверки домена?
Нет. API ползунка может извлекать и трансформировать страницы, но вашему приложению все равно нужны проверки схемы, дедупликация, правила свежести и валидация хранения.
Marcus Chen
Sep. 9th 2026
110M+ реальных IP с 99.9% успешных доступов
Средний отклик ~0.5с для задач высокой конкуренции
Всего от $0.1/GB
Мгновенный доступ к премиальным residential, datacenter, IPv6 и ISP пулам.