Cómo construir un scraper de TechCrunch con Python: paso a paso
TL;DR
Usa el feed público de TechCrunch para el descubrimiento de artículos recientes cuando satisfaga el proyecto; es más simple y estable que rastrear páginas de listados.
Usa el HTML del artículo solo para campos que el feed no proporciona, y mantén la URL original y los metadatos de publicación.
Prefiere la marcado semántico de artículos y JSON-LD sobre clases de presentación.
Respeta los términos actuales, las directivas de robots, los derechos de autor y los límites de tasa; almacena solo el contenido necesario para el uso autorizado.
Haz que la tubería sea idempotente con URLs canónicas, identificadores de publicación, marcas de tiempo de recuperación y hashes de contenido.
¿Qué es un scraper de TechCrunch y por qué deberías construir uno?
Un scraper de TechCrunch es una tubería delimitada que descubre artículos públicos permitidos y extrae metadatos seleccionados para monitoreo, búsqueda o investigación. Nstdata Crawl puede proporcionar una colección de páginas gestionada, mientras que las bibliotecas de feed y HTML de Python ofrecen un pequeño camino alojado en uno mismo. Para muchos proyectos, un lector de feeds más un análisis selectivo de artículos es más seguro y simple que rastrear páginas de categoría.
La guía de mejores prácticas de web scraping explica por qué un inventario de fuentes estrecho y una política de retención explícita son importantes. El texto de noticias tiene derechos de autor, así que almacena los campos y enlaces mínimos requeridos a menos que el uso previsto y la licencia permitan más.
¿Qué necesitas antes de comenzar?
Instala feedparser, httpx, beautifulsoup4 y trafilatura. Define , , , , , , y . Decide si el texto completo es realmente necesario.
Verifica el feed actual de TechCrunch, los términos y el archivo de robots antes de la ejecución. Usa un agente de usuario descriptivo y una tasa de solicitud baja y limitada.
¿Cómo funciona el flujo de trabajo de recopilación de TechCrunch?
El feed suministra entradas recientes y enlaces de artículos estables. Cada enlace aceptado puede normalizarse, verificarse contra el registro de documentos y recuperarse solo cuando sea nuevo o haya cambiado. El HTML del artículo puede exponer JSON-LD y marcado semántico para el título, el autor y las marcas de tiempo. La extracción de contenido principal es un paso separado del descubrimiento.
Conéctate al Proxy Correcto
Elige la ubicación y el modo de sesión que se adapten a tu flujo de trabajo, luego conéctate a través de Nstdata.
import feedparser
feed = feedparser.parse("https://techcrunch.com/feed/")if feed.bozo:raise RuntimeError(f"Error al analizar el feed: {feed.bozo_exception}")entries =[{"title": e.get("title"),"url": e.get("link"),"published": e.get("published")}for e in feed.entries]
Paso 2: Validar cada entrada
Requiere una URL de TechCrunch HTTPS y un título no vacío. Rechaza URLs canónicas duplicadas antes de recuperar la página.
Paso 3: Guardar un punto de control de descubrimiento
Almacena el tiempo de recuperación del feed y el identificador de la entrada. No asumas que el orden del feed por sí solo es lo suficientemente estable para la recuperación.
Utiliza Beautiful Soup para localizar application/ld+json y seleccionar objetos NewsArticle o Article. Preserva el titular, los objetos de autor, los campos de fecha y la URL canónica sin inventar valores faltantes.
Paso 3: Extraer solo el contenido requerido
Utiliza un selector de article verificado o Trafilatura para el texto principal. Registra el método de extracción y la versión del analizador para que los cambios posteriores puedan reproducirse. La documentación de Trafilatura describe los controles actuales de extracción.
Método 3: Usar la superficie REST de WordPress cuando esté disponible y permitido
Paso 1: Confirmar el endpoint desde el sitio
No asumas que un endpoint de WordPress es público o estable. Descúbrelo a través de metadatos de página oficiales o documentación y verifica que el uso previsto esté permitido.
Paso 2: Solicitar campos restringidos y páginas limitadas
Usa _fields cuando sea compatible, un pequeño per_page y límites de página explícitos. La documentación del API REST de WordPress documenta las interfaces generales, pero el sitio controla lo que expone.
Paso 3: Tratar el HTML renderizado como entrada no confiable
Sanea el contenido antes de mostrarlo y retiene la atribución de la fuente. La salida REST no otorga derechos de reutilización más allá de la licencia y los términos aplicables.
Método 4: Usar una capa de colección administrada
Paso 1: Enviar solo URLs de artículos aprobados
Usa Nstdata Crawl cuando el renderizado, los reintentos, el estado de la tarea y múltiples artefactos deban ser administrados. Mantén el descubrimiento del feed como la fuente de verdad y utiliza trabajos de página limitados.
Paso 2: Validar el éxito a nivel de cuerpo
Verifica la URL final, el título, la evidencia de publicación, el idioma y la completitud del contenido. Utiliza los precios actuales de Crawl para comparar el costo por artículo nuevo aceptado.
Paso 3: Normalizar en el mismo registro
La ruta administrada y la ruta HTTP deben producir metadatos internos idénticos. Los campos del proveedor no deben filtrarse en las claves comerciales.
¿Por qué falta artículos o texto en el scraper de TechCrunch?
Los feeds pueden ser truncados, retrasados o limitados a elementos recientes. Las plantillas de artículos pueden cambiar, el contenido puede estar incrustado, y una respuesta puede ser un error o un estado de consentimiento. Compara los IDs de feed, las URLs canónicas, JSON-LD, URL final y la cobertura de campos aceptados. No resuelvas un campo faltante coleccionando regiones de página no relacionadas.
Sondea el feed en un intervalo respetuoso, actualiza o inserta por URL canónica o ID de entrada estable, y recupera solo páginas no vistas o explícitamente refrescadas. Calcula un hash de contenido normalizado para distinguir las ediciones de metadatos de los nuevos documentos. Reintenta fallos transitorios de red con un límite y envía cambios de análisis a revisión.
La guía de infraestructura de datos web proporciona un patrón útil: descubrimiento, adquisición, validación, normalización y entrega deben tener estados separados.
Conclusión
Utilice la fuente pública para el descubrimiento, obtenga solo artículos nuevos permitidos, prefiera metadatos estructurados y agregue extracción de texto completo solo cuando el caso de uso lo requiera. Mantenga un registro de documentos y mida los nuevos artículos aceptados en lugar de las solicitudes totales. Nstdata Crawl es una opción cuando se necesita gestionar la ejecución del navegador y los artefactos. Nstdata Proxy Manager es relevante solo cuando el enrutamiento y el control operativo se convierten en una preocupación de plataforma separada.
Experiencia Nstdata — Comience su prueba gratuita hoy
TechCrunch expone una fuente pública en la URL utilizada en este tutorial, pero su alcance y comportamiento deben ser verificados nuevamente antes del uso en producción.
P: ¿Debería un scraper de TechCrunch almacenar el texto completo del artículo?
Solo cuando el proyecto tenga una necesidad válida y derechos aplicables. Los metadatos, resúmenes y enlaces canónicos son a menudo suficientes para el monitoreo.
P: ¿Cómo evitas artículos duplicados de TechCrunch?
Utilice URL canónicas o identificadores de feed estables, normalice los parámetros de seguimiento conservadores y realice actualizaciones idempotentes.
P: ¿Por qué el feed contiene menos artículos que el sitio?
Los feeds comúnmente exponen un subconjunto reciente en lugar de un archivo completo. Utilice solo rutas de descubrimiento aprobadas y no asuma que el feed es exhaustivo.
P: ¿Cuándo se requiere un navegador?
Se requiere un navegador solo cuando el campo permitido depende de la representación o interacción del cliente y no se puede obtener del feed, datos estructurados o HTML inicial.
Las páginas renderizadas con JavaScript requieren el método que coincida con su ruta de datos. Esta guía cubre la extracción de red, tres enfoques de navegador y renderizado gestionado.
Ivy Lin
Sep. 28th 2026
Descubre Nstproxy Crawl - Empieza Tu Prueba Gratuita Hoy
Rastrea sitios web completos con una sola solicitud API
Convierte cualquier sitio web en Markdown, HTML, JSON, enlaces, PDF y más, sin gestionar infraestructura de rastreo.
99,8% de éxito con renderizado JavaScript
Obtén datos limpios, listos para LLM, en múltiples formatos