Skip to main content

Dify

Plugin officiel Firecrawl pour les workflows Dify, avec synchronisation de sites web avec la base de connaissances
6 min read
Note

Plugin officiel Dify : marketplace.dify.ai/plugins/langgenius/firecrawl

Plugin officiel de l’équipe Dify • Plus de 170 000 installations • Applications Chatflow et Agent • Gratuit

Présentation de l’intégration Dify#

Dify est une plateforme open source de développement d’applications basées sur des LLM. Le plugin officiel de Firecrawl permet d’effectuer du crawling et du scraping web directement dans vos workflows d’IA.

Applications Chatflow et Workflow

Créez des pipelines visuels avec des nœuds Firecrawl pour extraire des données

Applications d’agents

Donnez aux agents IA la possibilité de scraper des données web en temps réel, à la demande

Outils Firecrawl dans Dify#

Le plugin propose sept actions.

Recherche

Recherchez sur le Web et, si besoin, scrapez les résultats obtenus pour récupérer des métadonnées récentes ou le contenu complet des pages en une seule étape.

Cas d'utilisation : Assistants de recherche IA, identification de concurrents, enrichissement des réponses avec des sources en temps réel.

Scrape

Convertissez n'importe quelle URL en données propres et structurées. Transformez du HTML brut en insights exploitables.

Cas d'utilisation : Extraction de données produit, scraping du contenu d'articles, obtention de données structurées avec le mode JSON.

Crawl

Effectuez des crawls récursifs de sites Web et de sous-domaines pour collecter de grandes quantités de contenu.

Cas d'utilisation : Extraction du contenu complet d'un site, scraping de documentation, collecte de données sur plusieurs pages.

cartographie

Générez une cartographie complète de toutes les URL présentes sur un site Web.

Cas d'utilisation : Analyse de la structure du site, audit SEO, découverte d'URL pour le scraping par lots.

Tâche de crawl

Récupérez les résultats de scraping à partir d'un ID de tâche ou annulez les tâches en cours.

Cas d'utilisation : Surveiller les crawls de longue durée, gérer les workflows de scraping asynchrones, annuler des opérations si nécessaire.

Créer un monitor

Créez un monitor planifié qui revérifie une cible à intervalles réguliers.

Cas d'utilisation : Maintenir les données ingérées à jour, surveiller les journaux des modifications, suivre les concurrents.

Vérifications du monitor

Récupérez les détails d'un monitor et les résultats de ses vérifications afin d'agir uniquement sur les pages modifiées.

Cas d'utilisation : Mises à jour incrémentielles de la base de connaissances, alertes de changement, déclencheurs en aval.

Premiers pas#

Installer le plugin Firecrawl

Accédez au Marketplace des plugins Dify et installez l’outil Firecrawl

Obtenir une clé API Firecrawl

Rendez-vous sur Clés API Firecrawl et créez une clé API

Autoriser Firecrawl dans Dify

Accédez à Plugins > Firecrawl > To Authorize et saisissez votre clé API

Ajouter à votre workflow

Glissez les outils Firecrawl dans votre application Chatflow, Workflow ou Agent

Configurer et tester

Configurez les paramètres et testez votre workflow

Modèles d’utilisation#

Intégration dans un pipeline visuel

  1. Ajoutez un nœud Firecrawl à votre pipeline
  2. Sélectionnez une action (cartographie, Crawl, Scrape)
  3. Définissez les variables d’entrée
  4. Exécutez le pipeline de manière séquentielle

Exemple de flux :

Cas d'utilisation courants#

Chatbot IA avec données en temps réel

Créez des chatbots basés sur la RAG qui scrappent et citent du contenu web en temps réel

Agent d'analyse de contenu

Des agents qui étudient des sujets en scrappant et analysant plusieurs sources

Surveillance des concurrents

Des workflows automatisés qui suivent les sites web des concurrents et vous alertent en cas de changement

Pipeline d'enrichissement des données

Extrayez et enrichissez les données de sites web dans des bases de données structurées

Actions Firecrawl#

OutilDescriptionIdéal pour
RechercheRecherche web avec contenu de page facultatifÉtayer les réponses à l’aide de sources en temps réel
ScrapeExtraction de données d’une seule pageCapture rapide de contenu
CrawlCrawl récursif de plusieurs pagesExtraction complète d’un site
CartographieDécouverte d’URL et cartographie de siteAnalyse SEO, listes d’URL
Tâche de crawlGestion asynchrone des tâchesOpérations de longue durée
Créer un monitorVérifications programmées d’une cibleMaintenir à jour les données ingérées
Vérifications du monitorDétails du monitor et résultats des vérificationsAgir uniquement sur les pages modifiées

Bonnes pratiques#

Applications d’agents
  • Laissez les agents décider quand effectuer un scrape
  • Utilisez des instructions en langage naturel
  • Activez l’appel d’outils dans les paramètres du LLM
  • Surveillez l’utilisation des jetons lors de scrapes volumineux
Applications de workflows
  • Utilisez cartographie avant Crawl pour les sites volumineux
  • Définissez des limites de crawl adaptées
  • Ajoutez des nœuds de gestion des erreurs
  • Commencez par tester avec de petits jeux de données

Dify et les autres plateformes#

FonctionnalitéDifyMakeZapiern8n
TypePlateforme d'applications LLMAutomatisation de workflowsAutomatisation de workflowsAutomatisation de workflows
Idéal pourAgents IA et chatbotsWorkflows visuelsAutomatisation rapideContrôle pour les développeurs
TarificationOpen source + CloudÀ l'opérationÀ la tâcheÀ l'exécution
Natif IAOuiPartielPartielPartiel
Auto-hébergéOuiNonNonOui
Tip

Conseil de pro : Dify excelle dans la création d'applications nativement basées sur l'IA, où les agents ont besoin d'un accès dynamique au web. Idéal pour les chatbots, les assistants de recherche IA et les outils d'IA nécessitant des données en temps réel.

Synchroniser des sites web dans la base de connaissances de Dify#

Firecrawl peut également extraire une page web au format Markdown et l’importer dans la base de connaissances de Dify depuis Dify Cloud.

Configuration de Firecrawl#

Ouvrez le menu de votre avatar, accédez à la page DataSource, puis configurez les identifiants Firecrawl.

Configurer la clé Firecrawl

Connectez-vous à votre compte Firecrawl, récupérez votre clé d’API, puis saisissez-la et enregistrez-la dans Dify.

Enregistrer la clé Firecrawl

Scraper la page web cible#

Sur la page de création de la base de connaissances, sélectionnez Sync from website, choisissez Firecrawl comme provider et saisissez l’URL à scraper.

Configuration du scraping

Les options de configuration incluent : Activer le crawl des sous-pages, Limite de pages à crawler, Profondeur maximale de scraping par page, Chemins exclus, Chemins à inclure uniquement, et Portée de l’extraction de contenu. Une fois la configuration terminée, cliquez sur Run pour prévisualiser les pages analysées.

Définir la configuration Firecrawl

Examiner les résultats de l’importation#

Le texte des pages importées est enregistré dans les documents de la base de connaissances. Consultez les résultats et cliquez sur Add URL pour importer davantage de pages.

Voir les résultats du scraping Firecrawl