Skip to main content

Java

El SDK de Java de Firecrawl es una biblioteca que envuelve la API de Firecrawl para que puedas convertir fácilmente sitios web en markdown.
3 min read

Instalación#

El SDK oficial de Java se mantiene en el monorepo de Firecrawl en apps/java-sdk.

Para instalar el SDK de Java de Firecrawl, agrega la dependencia desde Maven Central:

Note
Requiere Java 11 o una versión posterior.

Uso#

  1. Obtén una clave de API en firecrawl.dev
  2. Configura la clave de API como una variable de entorno llamada FIRECRAWL_API_KEY, o pásala con FirecrawlClient.builder().apiKey(...)

Aquí tienes un ejemplo rápido con la API actual del SDK:

Scraping de una URL#

Para hacer scraping de una sola URL, usa el método scrape.

Análisis de archivos cargados#

El paquete más reciente del SDK de Java (com.firecrawl:firecrawl-java) admite la carga directa de archivos a /v2/parse. parse no admite changeTracking ni opciones exclusivas del navegador como screenshot, branding, actions, waitFor, location y mobile.

Java

Extracción de JSON#

Extrae JSON estructurado con JsonFormat mediante el endpoint scrape:

Rastrear un sitio web#

Para rastrear un sitio web y esperar a que finalice, usa crawl.

Iniciar un rastreo#

Inicia un trabajo de forma asíncrona con startCrawl.

Comprobar el estado del rastreo#

Consulta el progreso del rastreo con getCrawlStatus.

Cancelar un rastreo#

Cancela un rastreo en ejecución con cancelCrawl.

Mapeo de un sitio web#

Descubre enlaces en un sitio web con map.

Buscar en la Web#

Busca con configuraciones de búsqueda optional usando search.

Scraping por lotes#

Haz scraping de varias URL en paralelo con batchScrape.

Agente#

Ejecuta un agente basado en IA con agent.

Con un esquema JSON para una salida estructurada:

Uso y métricas#

Consulta la concurrencia y los créditos restantes:

Soporte asíncrono#

Se incluyen variantes asíncronas que devuelven CompletableFuture.

El SDK de Java incluye utilidades de Browser Sandbox.

Crear una sesión#

Ejecutar código#

Sesión interactiva vinculada al scraping#

Usa un ID de trabajo de scraping para ejecutar código posterior en el mismo contexto reproducido del navegador:

  • interact(...) ejecuta código en la sesión del navegador vinculada al scraping (y la inicializa en el primer uso).
  • stopInteraction(...) detiene explícitamente la sesión interactiva cuando hayas terminado.

Listar & cerrar sesiones#

Configuración#

FirecrawlClient.builder() admite las siguientes opciones:

OpciónTipoPredeterminadoDescripción
apiKeyStringvariable de entorno FIRECRAWL_API_KEY o propiedad del sistema firecrawl.apiKeyTu API key de Firecrawl
apiUrlStringhttps://api.firecrawl.dev (o FIRECRAWL_API_URL)URL base de la API
timeoutMslong300000Tiempo de espera de la request HTTP en ms
maxRetriesint3Reintentos automáticos para fallos transitorios
backoffFactordouble0.5Factor de retroceso exponencial en segundos
asyncExecutorExecutorForkJoinPool.commonPool()Ejecutor personalizado para métodos asíncronos
httpClientOkHttpClientConstruido a partir de timeoutMsInstancia de OkHttpClient preconfigurada

Cliente HTTP personalizado#

Puedes pasar un OkHttpClient preconfigurado para controlar el pool de conexiones, los interceptores, la configuración de SSL, la configuración del proxy y cualquier otra funcionalidad de OkHttp. Cuando se proporciona, la configuración timeoutMs se ignora y se usa la propia configuración del cliente.

Manejo de errores#

El SDK lanza excepciones en tiempo de ejecución en com.firecrawl.errors.

¿Eres un agente de IA que necesita una clave de API de Firecrawl? Consulta firecrawl.dev/agent-onboarding/SKILL.md para ver las instrucciones de incorporación automática.