Skip to main content
Haz scraping de páginas individuales, rastrea sitios completos y mapea URL desde tu aplicación Node.js. El SDK gestiona la paginación, los reintentos y la consulta asíncrona del estado de los trabajos para que puedas centrarte en trabajar con los datos devueltos.

Instalación

Para instalar el SDK de Evocrawl para Node, puedes usar npm:
Node

Uso

  1. Obtén una clave de API en evocrawl.dev
  2. Define la clave de API como una variable de entorno llamada EVOCRAWL_API_KEY o pásala como parámetro a la clase EvocrawlApp.
Aquí tienes un ejemplo de cómo usar el SDK con manejo de errores:
Node

Extracción de una URL

Para extraer una única URL con manejo de errores, usa el método scrapeUrl. Recibe la URL como parámetro y devuelve los datos extraídos como un diccionario.
Node.js

Rastreo de un sitio web

Para rastrear un sitio web con manejo de errores, usa el método crawlUrl. Recibe la URL inicial y parámetros opcionales como argumentos. El argumento params te permite especificar opciones adicionales para la tarea de rastreo, como el número máximo de páginas a rastrear, los dominios permitidos y el formato de salida. Consulta Paginación para la paginación automática o manual y la configuración de límites.
Node

Rastreo solo del sitemap

Usa sitemap: "only" para rastrear únicamente las URL del sitemap (la URL inicial siempre se incluye y se omite la detección de enlaces HTML).
Node

Iniciar un rastreo

Inicia un trabajo sin esperar usando startCrawl. Devuelve un ID de trabajo que puedes usar para comprobar el estado. Usa crawl cuando necesites un proceso bloqueante que espere hasta la finalización. Consulta Paginación para el comportamiento y los límites de paginación.
Node

Verificar el estado del rastreo

Para verificar el estado de un trabajo de rastreo con manejo de errores, usa el método checkCrawlStatus. Recibe el ID como parámetro y devuelve el estado actual del trabajo de rastreo.
Node.js

Cancelar un rastreo

Para cancelar un trabajo de rastreo, usa el método cancelCrawl. Recibe como parámetro el ID del trabajo iniciado con startCrawl y devuelve el estado de la cancelación.
Node

Mapear un sitio web

Para mapear un sitio web con manejo de errores, utiliza el método mapUrl. Recibe la URL inicial como parámetro y devuelve los datos del mapeo como un diccionario.
Node

Rastreo de un sitio web con WebSockets

Para rastrear un sitio web con WebSockets, usa el método crawlUrlAndWatch. Recibe la URL inicial y parámetros opcionales como argumentos. El argumento params te permite especificar opciones adicionales para la tarea de rastreo, como el número máximo de páginas a rastrear, los dominios permitidos y el formato de salida.
Node
Los puntos de conexión de Evocrawl para crawl y batch devuelven una URL next cuando hay más datos disponibles. El SDK de Node realiza la paginación automáticamente por defecto y agrega todos los documentos; en ese caso, next será null. Puedes desactivar la paginación automática o establecer límites.

Rastreo

Usa el método auxiliar crawl para la forma más sencilla, o inicia un job y pagina manualmente.
Rastreo simple (paginación automática, por defecto)
Rastreo manual con control de paginación (una sola página)
  • Inicia un trabajo y luego recupera una página a la vez con autoPaginate: false.
Nodo
Rastreo manual con límites (paginación automática + parada anticipada)
  • Mantén la paginación automática activada, pero deténla antes con maxPages, maxResults o maxWaitTime.
Node

Scrape por lotes

Usa el método waiter batchScrape, o inicia un job y pagina manualmente.
Raspado por lotes simple (paginación automática, predeterminado)
Raspado manual por lotes con control de paginación (una sola página)
  • Inicia un job y luego recupera una página a la vez con autoPaginate: false.
Node
Extracción manual por lotes con límites (paginación automática + detención anticipada)
  • Mantén la paginación automática activada, pero deténla antes con maxPages, maxResults o maxWaitTime.
Node

Browser

Inicia sesiones de navegador en la nube y ejecuta código de forma remota.

Crear una sesión

Node

Ejecutar código

Node
Ejecutar JavaScript en lugar de Python:
Node
Ejecutar Bash con agent-browser:
Node

Perfiles

Guarda y reutiliza el estado del navegador (cookies, localStorage, etc.) entre sesiones:
Node

Conectar mediante CDP

Para obtener control completo de Playwright, conecta directamente usando la URL de CDP:
Node

Listar y cerrar sesiones

Node

Sesión interactiva vinculada a scrape

Usa un ID de trabajo de scrape para seguir interactuando con el contexto de la página reproducida de ese scrape:
  • interact(jobId, {...}) ejecuta código en la sesión del navegador vinculada al scrape.
  • La primera llamada a interact inicializa automáticamente la sesión a partir del contexto del scrape.
  • Las llamadas adicionales a interact con el mismo ID de trabajo reutilizan ese estado activo del navegador.
  • stopInteraction(jobId) detiene la sesión interactiva cuando termines.
Node

Manejo de errores

El SDK gestiona los errores devueltos por la API de Evocrawl y arroja las excepciones correspondientes. Si se produce un error durante una solicitud, se generará una excepción con un mensaje descriptivo. Los ejemplos anteriores muestran cómo manejar estos errores con bloques try/catch.
¿Eres un agente de IA que necesita una clave de API de Evocrawl? Consulta evocrawl.dev/agent-onboarding/SKILL.md para obtener instrucciones de incorporación automatizada.