Scraping básico
/scrape.
Extracción de PDF
parsers (por ejemplo, parsers: ["pdf"]) cuando quieras asegurar el análisis de PDF. Puedes controlar la estrategia de análisis con la opción mode:
auto(predeterminado): intenta primero una extracción rápida basada en texto y luego recurre a OCR si es necesario.fast: solo análisis basado en texto (texto incrustado). Es el más rápido, pero omite páginas escaneadas o con muchas imágenes.ocr: fuerza el análisis mediante OCR en cada página. Úsalo para documentos escaneados o cuandoautoclasifique mal una página.
{ type: "pdf" } y "pdf" usan por defecto mode: "auto".
Opciones de extracción
/scrape, puedes personalizar la solicitud con las siguientes opciones.
Formatos (formats)
formats controla qué tipos de salida devuelve el scraper. Predeterminado: ["markdown"].
Formatos de tipo string: pasa el nombre directamente (por ejemplo, "markdown").
Formatos de objeto: pasa un objeto con
type y opciones adicionales.
Filtrado de contenido
onlyMainContent es true (el valor predeterminado), se elimina el contenido de plantilla (nav, footer, etc.). includeTags y excludeTags se aplican sobre el DOM original de la página, no sobre el resultado posterior al filtrado, por lo que tus selectores deben apuntar a los elementos tal como aparecen en el HTML de origen. Si configuras onlyMainContent: false, se utiliza el HTML completo de la página como punto de partida para el filtrado por etiquetas.
Temporización y caché
Análisis de PDF
Acciones
wait y waitFor no debe superar los 60 segundos.
Notas sobre la ejecución de acciones
- Write requiere un
clickprevio para poner el foco en el elemento de destino. - Scroll acepta un
selectoropcional para desplazar un elemento específico en lugar de la página completa. - Wait acepta
milliseconds(retraso fijo) oselector(esperar hasta que sea visible). - Las acciones se ejecutan secuencialmente: cada paso se completa antes de que comience el siguiente.
- Las acciones no son compatibles con PDFs. Si la URL apunta a un PDF, la solicitud fallará.
Ejemplos de acciones avanzadas
cURL
cURL
cURL
cURL
executeJavascript se captura en el array actions.javascriptReturns de la respuesta.
Ejemplo de scraping completo
cURL
<h1>, <p>, <a> y .main-content mientras excluye #ad y #footer, espera 1 segundo antes de realizar el scraping, establece un tiempo de espera de 15 segundos y habilita el análisis de PDF.
Consulta la referencia completa de la API de Scrape para más detalles.
Extracción JSON mediante formatos
formats para extraer datos estructurados en una sola operación:
Endpoint del agente
/v2/agent para la extracción autónoma de datos en múltiples páginas. El agente se ejecuta de forma asíncrona: inicias un trabajo y luego consultas periódicamente los resultados.
Opciones del agente
Comprobar el estado del agente
GET /v2/agent/{jobId} para verificar el progreso. El campo status de la respuesta será "processing", "completed" o "failed".
cURL
evocrawl.agent()) que inicia la tarea y consulta automáticamente el estado hasta que finaliza.
Rastreo de múltiples páginas
/v2/crawl. El rastreo se ejecuta de forma asíncrona y devuelve un ID de trabajo. Usa el parámetro limit para controlar cuántas páginas se rastrean. Si se omite, el rastreo procesará hasta 10,000 páginas.
cURL
Respuesta
Consultar trabajo de rastreo
cURL
next, una URL de la siguiente página de resultados.
Vista previa del prompt y parámetros de rastreo
prompt en lenguaje natural para que Evocrawl derive la configuración de rastreo. Primero, prévisualízala:
cURL
Opciones del rastreador
/v2/crawl, puedes personalizar el comportamiento del rastreo con las siguientes opciones.
Filtrado de rutas
Alcance del rastreo
Sitemap y deduplicación
Opciones de scrape para crawl
Ejemplo de rastreo
cURL
Mapeo de enlaces de sitios web
/v2/map identifica las URL relacionadas con un sitio web determinado.
cURL
Opciones de Map
Consulta la referencia de la API: Documentación del endpoint /map
Agregar Evocrawl a la lista de permitidos
Permitir que Evocrawl rastree tu sitio web
- User Agent: Permite
EvocrawlAgenten tu firewall o en tus reglas de seguridad. - Direcciones IP: Evocrawl no utiliza un conjunto fijo de direcciones IP salientes.
Permitir que tu aplicación llame a la API de Evocrawl
api.evocrawl.dev):
- Dirección IP:
35.245.250.27

