Skip to main content

Java

Le SDK Java de Firecrawl est un wrapper autour de l’API Firecrawl pour vous aider à convertir facilement des sites web en markdown.
3 min read

Installation#

Le SDK Java officiel est maintenu dans le monorepo Firecrawl sous apps/java-sdk.

Pour installer le SDK Java de Firecrawl, ajoutez la dépendance depuis Maven Central :

Note
Nécessite Java 11 ou une version ultérieure.

Utilisation#

  1. Obtenez une clé API sur firecrawl.dev
  2. Définissez la clé API dans une variable d’environnement nommée FIRECRAWL_API_KEY, ou passez-la avec FirecrawlClient.builder().apiKey(...)

Voici un exemple rapide utilisant l’API actuelle du SDK :

Scraping d’une URL#

Pour scraper une seule URL, utilisez la méthode scrape.

Analyse des fichiers importés#

La dernière version du SDK Java (com.firecrawl:firecrawl-java) prend en charge l’import direct de fichiers vers /v2/parse. parse ne prend pas en charge changeTracking ni les options propres au navigateur, comme screenshot, branding, actions, waitFor, location et mobile.

Java

Extraction de JSON#

Extrayez du JSON structuré avec JsonFormat via le point de terminaison scrape :

Effectuer un crawl d’un site web#

Pour effectuer un crawl d’un site web et attendre la fin de l’opération, utilisez crawl.

Démarrer un crawl#

Démarrez une tâche sans attendre avec startCrawl.

Vérification de l’état d’un crawl#

Vérifiez la progression du crawl avec getCrawlStatus.

Annuler un crawl#

Pour annuler un crawl en cours, utilisez cancelCrawl.

Mapping d’un site web#

Découvrez les liens d’un site à l’aide de map.

Recherche sur le web#

Effectuez une recherche avec des paramètres facultatifs à l’aide de search.

Batch Scraping#

Scrapez plusieurs URL en parallèle avec batchScrape.

Agent#

Exécutez un agent IA avec agent.

Avec un schéma JSON pour obtenir une sortie structurée :

Utilisation & métriques#

Vérifiez la concurrence et les crédits restants :

Prise en charge de l'asynchrone#

Des variantes asynchrones sont intégrées nativement et renvoient un CompletableFuture.

Browser#

Le SDK Java inclut des utilitaires pour Browser Sandbox.

Créer une session#

Exécuter du code#

Session interactive liée à un scrape#

Utilisez un ID de tâche de scrape pour exécuter du code de navigateur supplémentaire dans le même contexte rejoué :

  • interact(...) exécute du code dans la session de navigateur liée au scrape (et l’initialise lors de la première utilisation).
  • stopInteraction(...) arrête explicitement la session interactive lorsque vous avez terminé.

Lister & fermer les sessions#

Configuration#

FirecrawlClient.builder() prend en charge les options suivantes :

OptionTypePar défautDescription
apiKeyStringvariable d’environnement FIRECRAWL_API_KEY ou propriété système firecrawl.apiKeyVotre clé API Firecrawl
apiUrlStringhttps://api.firecrawl.dev (ou FIRECRAWL_API_URL)URL de base de l’API
timeoutMslong300000Délai d’expiration de la requête HTTP en ms
maxRetriesint3Nouvelles tentatives automatiques en cas d’échecs temporaires
backoffFactordouble0.5Facteur de backoff exponentiel en secondes
asyncExecutorExecutorForkJoinPool.commonPool()Exécuteur personnalisé pour les méthodes asynchrones
httpClientOkHttpClientCréé à partir de timeoutMsInstance OkHttpClient préconfigurée

Client HTTP personnalisé#

Vous pouvez fournir un OkHttpClient préconfiguré pour contrôler le pool de connexions, les intercepteurs, la configuration SSL, les paramètres du proxy et toute autre fonctionnalité d’OkHttp. Lorsqu’il est fourni, le paramètre timeoutMs est ignoré au profit de la configuration propre au client.

Gestion des erreurs#

Le SDK lève des exceptions d’exécution dans com.firecrawl.errors.

Êtes-vous un agent IA ayant besoin d’une clé API Firecrawl ? Consultez firecrawl.dev/agent-onboarding/SKILL.md pour les instructions d’intégration automatisée.