Skip to main content

Dify

Plugin oficial de Firecrawl para flujos de trabajo de Dify y sincronización de sitios web con bases de conocimientos
6 min read
Note

Plugin oficial de Dify: marketplace.dify.ai/plugins/langgenius/firecrawl

Plugin oficial del equipo de Dify • Más de 170.000 instalaciones • Aplicaciones Chatflow y Agent • Gratis

Descripción general de la integración con Dify#

Dify es una plataforma de código abierto para desarrollar aplicaciones basadas en LLM. El plugin oficial de Firecrawl permite realizar rastreo y scraping web directamente en tus flujos de trabajo de IA.

Aplicaciones de Chatflow y Workflow

Crea flujos visuales con nodos de Firecrawl para extraer datos

Aplicaciones de agentes

Permite que los agentes de IA hagan scraping de datos web en tiempo real bajo demanda

Herramientas de Firecrawl en Dify#

El plugin incluye siete acciones.

Búsqueda

Busca en la web y, opcionalmente, realiza scraping de los resultados obtenidos para recibir metadatos actualizados o el contenido completo de las páginas en un solo paso.

Casos de uso: Asistentes de investigación, descubrimiento de competidores, fundamentación de respuestas con fuentes en tiempo real.

Scraping

Convierte cualquier URL en datos limpios y estructurados. Transforma HTML sin procesar en información útil.

Casos de uso: Extraer datos de productos, realizar scraping de contenido de artículos, obtener datos estructurados con el modo JSON.

Rastreo

Realiza rastreos recursivos de sitios web y subdominios para recopilar grandes volúmenes de contenido.

Casos de uso: Extracción de contenido de sitios completos, scraping de documentación, recopilación de datos de varias páginas.

Mapeo

Genera un mapa completo de todas las URL de un sitio web.

Casos de uso: Análisis de la estructura del sitio, auditorías SEO, descubrimiento de URL para scraping por lotes.

Trabajo de rastreo

Recupera resultados de scraping mediante un ID de trabajo o cancela tareas en curso.

Casos de uso: Supervisar rastreos de larga duración, gestionar flujos de trabajo de scraping asíncronos, cancelar operaciones cuando sea necesario.

Crear monitor

Crea un monitor programado que vuelve a comprobar un objetivo de forma periódica.

Casos de uso: Mantener actualizados los datos ingeridos, supervisar registros de cambios, realizar seguimiento de la competencia.

Comprobaciones del monitor

Recupera los detalles de un monitor y los resultados de sus comprobaciones para actuar solo sobre las páginas que hayan cambiado.

Casos de uso: Actualizaciones incrementales de bases de conocimiento, alertas de cambios, desencadenadores para procesos posteriores.

Primeros pasos#

Instala el plugin de Firecrawl

Accede al marketplace de plugins de Dify e instala la herramienta Firecrawl

Obtén una clave de API de Firecrawl

Visita Claves de API de Firecrawl y crea una nueva clave de API

Autoriza en Dify

Ve a Plugins > Firecrawl > To Authorize e introduce tu clave de API

Añádelo a tu flujo de trabajo

Arrastra las herramientas de Firecrawl a tu aplicación de Chatflow, Workflow o Agent

Configura y prueba

Configura los parámetros y prueba tu flujo de trabajo

Patrones de uso#

Integración visual de pipelines

  1. Añade un nodo de Firecrawl a tu pipeline
  2. Selecciona la acción (mapeo, rastreo, scraping)
  3. Define las variables de entrada
  4. Ejecuta el pipeline de forma secuencial

Flujo de ejemplo:

Casos de uso habituales#

Chatbot de IA con datos en tiempo real

Crea chatbots con RAG que hacen scraping y consultan contenido actualizado de sitios web

Agente de análisis de contenido

Agentes que investigan temas mediante scraping y análisis de múltiples fuentes

Supervisión de la competencia

Flujos de trabajo automatizados que rastrean sitios web de la competencia y alertan sobre cambios

Flujo de enriquecimiento de datos

Extrae y enriquece datos de sitios web en bases de datos estructuradas

Acciones de Firecrawl#

HerramientaDescripciónIdeal para
BúsquedaBúsqueda web con contenido de página opcionalFundamentar respuestas con fuentes actualizadas
ScrapingExtracción de datos de una sola páginaCapturar contenido rápidamente
RastreoRastreo recursivo de varias páginasExtraer todo el sitio
MapeoDescubrimiento de URL y mapeo de sitiosAnálisis SEO y listas de URL
Trabajo de rastreoGestión de trabajos asíncronosOperaciones de larga duración
Crear monitorRevisiones periódicas programadas de un objetivoMantener actualizados los datos ingeridos
Comprobaciones del monitorDetalles del monitor y resultados de las comprobacionesActuar solo sobre páginas modificadas

Buenas prácticas#

Aplicaciones de agentes
  • Deja que los agentes decidan cuándo hacer scraping
  • Usa instrucciones en lenguaje natural
  • Habilita las llamadas a herramientas en la configuración del LLM
  • Supervisa el uso de tokens en scrapes grandes
Aplicaciones de flujos de trabajo
  • Usa mapeo antes de rastreo en sitios grandes
  • Establece límites de rastreo adecuados
  • Agrega nodos de manejo de errores
  • Primero, realiza pruebas con conjuntos de datos pequeños

Dify frente a otras plataformas#

FuncionalidadDifyMakeZapiern8n
TipoPlataforma de aplicaciones con LLMAutomatización de flujos de trabajoAutomatización de flujos de trabajoAutomatización de flujos de trabajo
Ideal paraAgentes de IA y chatbotsFlujos de trabajo visualesAutomatizaciones rápidasControl para desarrolladores
PreciosCódigo abierto + CloudPor operaciónPor tareaPor ejecución
Nativo de IAParcialParcialParcial
AutogestionadoNoNo
Tip

Consejo: Dify destaca en la creación de aplicaciones nativas de IA en las que los agentes necesitan acceso dinámico a la web. Es ideal para chatbots, asistentes de investigación y herramientas de IA que requieren datos en tiempo real.

Sincroniza sitios web con la base de conocimientos de Dify#

Firecrawl también puede extraer una página web a Markdown e importarla en la base de conocimientos de Dify desde Dify Cloud.

Configurar Firecrawl#

Abre el menú de tu avatar, ve a la página DataSource y configura las credenciales de Firecrawl.

Configurar la clave de Firecrawl

Inicia sesión en tu cuenta de Firecrawl, obtén tu clave de API y luego introdúcela y guárdala en Dify.

Guardar la clave de Firecrawl

Scraping de la página de destino#

En la página de creación de la base de conocimientos, selecciona Sync from website, elige Firecrawl como proveedor e introduce la URL para hacer scraping.

Configuración de scraping

Las opciones de configuración incluyen: rastrear subpáginas o no, límite de rastreo de páginas, profundidad máxima de scraping, rutas excluidas, rutas incluidas únicamente y alcance de extracción de contenido. Después de configurar las opciones, haz clic en Run para previsualizar las páginas analizadas.

Configurar Firecrawl

Revisa los resultados de la importación#

El texto de las páginas importadas se guarda en los documentos de la base de conocimientos. Revisa los resultados y haz clic en Add URL para importar más páginas.

Ver los resultados del scraping de Firecrawl