El benchmark público de rastreo más fuerte de 2026 ubicado para esta revisión es el conjunto de datos de 1,000 URLs de Firecrawl: 96% de cobertura, 0.638 de extracción F1, 0.639 de recuperación de contenido, y 3,387 ms de latencia P95.
Esos números miden la cobertura y calidad de raspado de Firecrawl en un conjunto de datos publicado; no son una tasa de éxito de API de rastreo universal o un resultado equivalente para cada proveedor.
No se encontró un conjunto de datos de tasa de éxito de primera parte comparable de 2026 para las otras APIs revisadas aquí, por lo que sus filas están marcadas como “no independientemente comparables” en lugar de llenas de estimaciones.
Un comprador debería reproducir la prueba en dominios objetivo y puntuar los campos aceptados, no solo la finalización HTTP o Markdown devuelto.
Conclusión y datos de benchmark
La conclusión defendible es que Firecrawl tiene la evidencia de benchmark público más clara, mientras que el mercado aún carece de un único leaderboard de API de rastreo reproducible de manera independiente. Firecrawl informa de una ejecución el 13 de enero de 2026 utilizando 1,000 URLs de diez categorías de la web pública. Su definición de cobertura es si la herramienta recuperó al menos el 10% del texto de la página central esperado, excluyendo navegación, anuncios y pies de página.
Proveedor o sistema
Métrica de cobertura / éxito
Métrica de calidad
Latencia
Tipo de evidencia
Firecrawl
96%
F1 0.638; recuperación 0.639
P95 3,387 ms
Conjunto de datos público, gestionado por el proveedor
Otras APIs de rastreo
No independientemente comparables en esta revisión
No se localizó un resultado verificado equivalente
La página de benchmarks de Firecrawl publica el nombre del conjunto de datos, la fecha, las definiciones de métricas y el alcance. Firecrawl también dice que su arnés aún no está publicado de manera integral, por lo que el conjunto de datos de entrada es verificable pero la ejecución completa no es totalmente reproducible.
Para la opción Nstdata, revise Nstdata Crawl y confirme la superficie API actual antes de realizar una comparación.
Metodología: qué debe controlar un benchmark útil de rastreo
Un benchmark útil de API de rastreo fija el conjunto de URLs, las opciones de solicitud, la política de tiempo de espera, el formato de salida, la concurrencia, el presupuesto de reintentos y las reglas de aceptación antes de ejecutar cualquier proveedor. Sin esos controles, una “tasa de éxito” puede significar una solicitud HTTP completada, cualquier cuerpo no vacío, o una página que realmente contiene los campos requeridos.
Utilice un conjunto estratificado de URLs públicas y autorizadas en documentación, comercio electrónico, noticias, finanzas, páginas con mucho JavaScript, redireccionamientos, PDFs y casos de error. Congela la lista de URLs y registra la fecha de la prueba. Ejecuta cada proveedor primero con la configuración predeterminada y luego publica los resultados ajustados etiquetados por separado.
Puntué al menos cuatro resultados:
Éxito del transporte: la API devolvió una respuesta de éxito terminal dentro del presupuesto de tiempo.
Cobertura de contenido: el resultado contiene el texto de la página central esperado.
Calidad de extracción: los campos requeridos coinciden con una referencia anotada por humanos.
Latencia operativa: informe la mediana y P95, no solo un promedio.
El conjunto de datos de raspado de Firecrawl es un buen punto de partida para un conjunto de entrada reproducible, pero un comprador de producción debería añadir páginas objetivo representativas. También consulte Semántica HTTP al definir la aceptación y el comportamiento de transporte.
Tabla de proveedores: separar los datos medidos de las afirmaciones
La tabla a continuación registra solo cifras que pueden ser vinculadas a una fuente y alcance de medición nombradas.
Proveedor
Lo que se puede afirmar
Lo que no se puede inferir
Firecrawl
96% de cobertura, F1 0.638, recuperación 0.639, P95 3,387 ms en su ejecución de 1,000 URLs del 13 de enero de 2026
Una tasa garantizada en sus dominios o un rango universal
Nstdata Crawl
La superficie del producto actual debe ser verificada para formatos de API, renderizado, descubrimiento y límites
Una tasa de éxito sin una ejecución comparable registrada
Otras APIs de rastreo
Incluyen solo una puntuación con un conjunto de datos publicado, fecha, arnés y definición de aceptación
Comparar las afirmaciones de la página de inicio del proveedor como si fueran un único benchmark
Nstdata Crawl es un candidato razonable para una comparación gestionada por el comprador cuando el flujo de trabajo necesita raspado de páginas, descubrimiento de sitios limitado, renderizado de JavaScript, o salidas estructuradas y visuales. Revise el producto Nstdata Crawl y la documentación de Nstdata para la superficie API actual, y luego ejecute el mismo conjunto de URL contra cada proveedor.
La tasa de éxito agregada puede ocultar las páginas exactas que son importantes para un negocio. Informe los resultados por dominio, tipo de página, requisito de renderizado y motivo de fallo.
Segmento
Campos útiles
Documentación
encabezado, bloque de código, URL canónica, enlaces
Comercio electrónico
ID de producto, título, precio, disponibilidad, moneda
Noticias
título, hora de publicación, autor, cuerpo del artículo
Finanzas
nombre del instrumento, marca de tiempo, valor, unidad
Pesado en JavaScript
encabezado renderizado, espera de red, URL final
PDF o binario
estado de descarga, recuento de páginas, texto extraído
Para cada segmento, publique intentos, éxitos terminales, registros aceptados, latencia mediana, latencia P95 y las principales clases de fallo. No convierta una pequeña muestra en un ranking preciso.
Análisis: por qué la tasa de éxito sola es insuficiente
La cobertura es una puerta, no el resultado final del negocio. Una herramienta puede devolver suficiente texto para superar un umbral del 10% mientras se pierde el precio, el ID de producto o la tabla que hace que la página sea útil. Por el contrario, una página puede fallar una regla de cobertura de texto mientras sigue devolviendo el campo estructurado exacto que la aplicación necesita.
El costo por registro aceptado suele ser más accionable que el costo por solicitud. Haga un seguimiento de reintentos, salidas vacías, fallos de esquema, revisión manual y tamaño de almacenamiento. También compare el trabajo operativo requerido para mantener acciones de navegador, selectores, paginación y excepciones específicas del sitio.
Código de puntuación reproducible
Este pequeño evaluador está intencionadamente fuera de línea: compara un registro JSON devuelto con un registro de referencia y no llama a ningún proveedor.
defscore_record(reference, candidate, required_fields): present =sum(bool(candidate.get(field))for field in required_fields) exact =sum(candidate.get(field)== reference.get(field)for field in required_fields)return{"coverage": present /len(required_fields),"exact_match": exact /len(required_fields),"accepted":all(candidate.get(field)for field in required_fields),}
Empareje el evaluador con un manifiesto congelado, registros de solicitudes del proveedor, estado de respuesta, tiempo transcurrido e IDs de tarea redactados. El código es ilustrativo; no se reclama la ejecución de ningún proveedor en este artículo.
Esta revisión compara evidencia pública, no una prueba multi-proveedor recién ejecutada. Las métricas reportadas de Firecrawl provienen de su propia ejecución y definición de cobertura. El arnés de referencia completo no está publicado, los valores predeterminados del proveedor pueden diferir, las páginas objetivo cambian, y una muestra de 1,000 URL no puede representar cada país, dominio, tipo de contenido o capa de protección. Trate la tabla como un punto de partida para pruebas de adquisición.
Para una prueba autorizada, comience con Nstdata y registre las mismas métricas para el mismo manifiesto de URL.
Q: ¿Cuál es una buena tasa de éxito de API de rastreo?
No hay un umbral universal; defina el éxito como un registro aceptado para sus páginas objetivo e informe el conjunto de datos, denominador, clases de fallo y latencia junto con el porcentaje.
Q: ¿Es el 96% de Firecrawl una tasa de éxito universal?
No. Es el resultado de cobertura de Firecrawl en un benchmark de 1,000 URL datado con una definición específica de 10% de texto central.
Q: ¿Por qué se marcan otros proveedores como no comparables?
No se les asignaron números inventados cuando no se verificó en esta revisión un resultado de primer nivel con el mismo conjunto de datos y el mismo arnés.
Q: ¿Debería evaluar APIs en mis propios dominios?
Sí. Utilice URL públicas o autorizadas que representen su carga de trabajo, congele el manifiesto y evalúe los campos que su aplicación realmente necesita.
Q: ¿Reemplaza una API de rastreo la validación específica del dominio?
No. Una API de rastreo puede recuperar y transformar páginas, pero su aplicación aún necesita verificaciones de esquema, deduplicación, reglas de frescura y validación de almacenamiento.
Revisa el más claro hito de referencia del API de rastreo público 2026, separa las afirmaciones de los proveedores de la evidencia medida y aprende cómo realizar una prueba justa en tus propias URLs.
Marcus Chen
Sep. 9th 2026
110M+ IP reales con 99.9% de acceso exitoso
Respuesta media ultrarrapida ~0.5s para tareas de alta concurrencia
Desde solo $0.1/GB
Acceso inmediato a pools premium de proxies residenciales, datacenter, IPv6 e ISP.