Plugin officiel Dify : marketplace.dify.ai/plugins/langgenius/firecrawl
Plugin officiel de l’équipe Dify • Plus de 170 000 installations • Applications Chatflow et Agent • Gratuit
Présentation de l’intégration Dify#
Dify est une plateforme open source de développement d’applications basées sur des LLM. Le plugin officiel de Firecrawl permet d’effectuer du crawling et du scraping web directement dans vos workflows d’IA.
Créez des pipelines visuels avec des nœuds Firecrawl pour extraire des données
Donnez aux agents IA la possibilité de scraper des données web en temps réel, à la demande
Outils Firecrawl dans Dify#
Le plugin propose sept actions.
Recherche
Recherchez sur le Web et, si besoin, scrapez les résultats obtenus pour récupérer des métadonnées récentes ou le contenu complet des pages en une seule étape.
Cas d'utilisation : Assistants de recherche IA, identification de concurrents, enrichissement des réponses avec des sources en temps réel.
Scrape
Convertissez n'importe quelle URL en données propres et structurées. Transformez du HTML brut en insights exploitables.
Cas d'utilisation : Extraction de données produit, scraping du contenu d'articles, obtention de données structurées avec le mode JSON.
Crawl
Effectuez des crawls récursifs de sites Web et de sous-domaines pour collecter de grandes quantités de contenu.
Cas d'utilisation : Extraction du contenu complet d'un site, scraping de documentation, collecte de données sur plusieurs pages.
cartographie
Générez une cartographie complète de toutes les URL présentes sur un site Web.
Cas d'utilisation : Analyse de la structure du site, audit SEO, découverte d'URL pour le scraping par lots.
Tâche de crawl
Récupérez les résultats de scraping à partir d'un ID de tâche ou annulez les tâches en cours.
Cas d'utilisation : Surveiller les crawls de longue durée, gérer les workflows de scraping asynchrones, annuler des opérations si nécessaire.
Créer un monitor
Créez un monitor planifié qui revérifie une cible à intervalles réguliers.
Cas d'utilisation : Maintenir les données ingérées à jour, surveiller les journaux des modifications, suivre les concurrents.
Vérifications du monitor
Récupérez les détails d'un monitor et les résultats de ses vérifications afin d'agir uniquement sur les pages modifiées.
Cas d'utilisation : Mises à jour incrémentielles de la base de connaissances, alertes de changement, déclencheurs en aval.
Premiers pas#
Installer le plugin Firecrawl
Accédez au Marketplace des plugins Dify et installez l’outil Firecrawl
Obtenir une clé API Firecrawl
Rendez-vous sur Clés API Firecrawl et créez une clé API
Autoriser Firecrawl dans Dify
Accédez à Plugins > Firecrawl > To Authorize et saisissez votre clé API
Ajouter à votre workflow
Glissez les outils Firecrawl dans votre application Chatflow, Workflow ou Agent
Configurer et tester
Configurez les paramètres et testez votre workflow
Modèles d’utilisation#
Intégration dans un pipeline visuel
- Ajoutez un nœud Firecrawl à votre pipeline
- Sélectionnez une action (cartographie, Crawl, Scrape)
- Définissez les variables d’entrée
- Exécutez le pipeline de manière séquentielle
Exemple de flux :
Traitement automatisé des données
Créez des workflows à plusieurs étapes avec :
- Scraping planifié
- Transformation des données
- Stockage en base de données
- Notifications
Exemple de flux :
Accès au web optimisé par l’IA
Offrez aux agents des capacités de scraping web en temps réel :
- Ajoutez l’outil Firecrawl à l’agent
- L’agent décide de manière autonome quand effectuer un scraping
- Le LLM analyse le contenu extrait
- L’agent fournit des réponses pertinentes
Cas d’utilisation : Agents de support client consultant la documentation à jour
Cas d'utilisation courants#
Créez des chatbots basés sur la RAG qui scrappent et citent du contenu web en temps réel
Des agents qui étudient des sujets en scrappant et analysant plusieurs sources
Des workflows automatisés qui suivent les sites web des concurrents et vous alertent en cas de changement
Extrayez et enrichissez les données de sites web dans des bases de données structurées
Actions Firecrawl#
| Outil | Description | Idéal pour |
|---|---|---|
| Recherche | Recherche web avec contenu de page facultatif | Étayer les réponses à l’aide de sources en temps réel |
| Scrape | Extraction de données d’une seule page | Capture rapide de contenu |
| Crawl | Crawl récursif de plusieurs pages | Extraction complète d’un site |
| Cartographie | Découverte d’URL et cartographie de site | Analyse SEO, listes d’URL |
| Tâche de crawl | Gestion asynchrone des tâches | Opérations de longue durée |
| Créer un monitor | Vérifications programmées d’une cible | Maintenir à jour les données ingérées |
| Vérifications du monitor | Détails du monitor et résultats des vérifications | Agir uniquement sur les pages modifiées |
Bonnes pratiques#
- Laissez les agents décider quand effectuer un scrape
- Utilisez des instructions en langage naturel
- Activez l’appel d’outils dans les paramètres du LLM
- Surveillez l’utilisation des jetons lors de scrapes volumineux
- Utilisez cartographie avant Crawl pour les sites volumineux
- Définissez des limites de crawl adaptées
- Ajoutez des nœuds de gestion des erreurs
- Commencez par tester avec de petits jeux de données
Dify et les autres plateformes#
| Fonctionnalité | Dify | Make | Zapier | n8n |
|---|---|---|---|---|
| Type | Plateforme d'applications LLM | Automatisation de workflows | Automatisation de workflows | Automatisation de workflows |
| Idéal pour | Agents IA et chatbots | Workflows visuels | Automatisation rapide | Contrôle pour les développeurs |
| Tarification | Open source + Cloud | À l'opération | À la tâche | À l'exécution |
| Natif IA | Oui | Partiel | Partiel | Partiel |
| Auto-hébergé | Oui | Non | Non | Oui |
Conseil de pro : Dify excelle dans la création d'applications nativement basées sur l'IA, où les agents ont besoin d'un accès dynamique au web. Idéal pour les chatbots, les assistants de recherche IA et les outils d'IA nécessitant des données en temps réel.
Synchroniser des sites web dans la base de connaissances de Dify#
Firecrawl peut également extraire une page web au format Markdown et l’importer dans la base de connaissances de Dify depuis Dify Cloud.
Configuration de Firecrawl#
Ouvrez le menu de votre avatar, accédez à la page DataSource, puis configurez les identifiants Firecrawl.
Connectez-vous à votre compte Firecrawl, récupérez votre clé d’API, puis saisissez-la et enregistrez-la dans Dify.
Scraper la page web cible#
Sur la page de création de la base de connaissances, sélectionnez Sync from website, choisissez Firecrawl comme provider et saisissez l’URL à scraper.
Les options de configuration incluent : Activer le crawl des sous-pages, Limite de pages à crawler, Profondeur maximale de scraping par page, Chemins exclus, Chemins à inclure uniquement, et Portée de l’extraction de contenu. Une fois la configuration terminée, cliquez sur Run pour prévisualiser les pages analysées.
Examiner les résultats de l’importation#
Le texte des pages importées est enregistré dans les documents de la base de connaissances. Consultez les résultats et cliquez sur Add URL pour importer davantage de pages.


