Skip to main content

CrewAI

Aprende a usar Firecrawl con CrewAI
3 min read

Uso de Firecrawl con CrewAI#

Firecrawl está integrado con CrewAI, el framework para orquestar agentes de IA. Esta página presenta todas las herramientas de Firecrawl incorporadas al framework.

Instalar Firecrawl Tools dentro de CrewAI#

Herramientas#

Herramienta FirecrawlCrawlWebsite#

Ejemplo#

Utiliza FirecrawlScrapeFromWebsiteTool de la siguiente manera para que tu agente cargue sitios web:

Argumentos#

  • api_key: Opcional. Especifica la clave de API de Firecrawl. El valor predeterminado es la variable de entorno FIRECRAWL_API_KEY.
  • url: La URL base desde la que comenzar el rastreo.
  • page_options: Opcional.
    • onlyMainContent: Opcional. Devuelve solo el contenido principal de la página, excluyendo encabezados, barras de navegación, pies de página, etc.
    • includeHtml: Opcional. Incluye el contenido HTML sin procesar de la página. Generará una clave html en la respuesta.
  • crawler_options: Opcional. Opciones para controlar el comportamiento del rastreador.
    • includes: Opcional. Patrones de URL que se incluirán en el rastreo.
    • exclude: Opcional. Patrones de URL que se excluirán del rastreo.
    • generateImgAltText: Opcional. Genera texto alternativo para imágenes usando LLMs (requiere un plan de pago).
    • returnOnlyUrls: Opcional. Si es true, devuelve solo las URLs como una lista en el estado del rastreo. Nota: la respuesta será una lista de URLs dentro de data, no una lista de documentos.
    • maxDepth: Opcional. Profundidad máxima de rastreo. La profundidad 1 es la URL base, la profundidad 2 incluye la URL base y sus hijos directos, y así sucesivamente.
    • mode: Opcional. El modo de rastreo a utilizar. El modo rápido (fast) realiza el rastreo 4 veces más rápido en sitios web sin sitemap, pero puede no ser tan preciso y no debería usarse en sitios web fuertemente renderizados con JavaScript.
    • limit: Opcional. Número máximo de páginas a rastrear.
    • timeout: Opcional. Tiempo de espera (en milisegundos) para la operación de rastreo.

Herramienta FirecrawlScrapeWebsite#

Ejemplo#

Usa FirecrawlScrapeWebsiteTool de la siguiente manera para permitir que tu agente cargue sitios web:

Argumentos#

  • api_key: Opcional. Especifica la clave de API de Firecrawl. De forma predeterminada usa la variable de entorno FIRECRAWL_API_KEY.
  • url: La URL que se va a extraer.
  • page_options: Opcional.
    • onlyMainContent: Opcional. Devuelve solo el contenido principal de la página, excluyendo encabezados, barras de navegación, pies de página, etc.
    • includeHtml: Opcional. Incluye el contenido HTML sin procesar de la página. Devolverá una clave html en la respuesta.
  • extractor_options: Opcional. Opciones para la extracción mediante LLM de información estructurada a partir del contenido de la página.
    • mode: El modo de extracción a usar, actualmente admite llm-extraction.
    • extractionPrompt: Opcional. Un prompt que describe qué información extraer de la página.
    • extractionSchema: Opcional. El esquema de los datos que se van a extraer.
  • timeout: Opcional. Tiempo máximo de espera en milisegundos para la solicitud.

FirecrawlSearchTool#

Ejemplo#

Utiliza FirecrawlSearchTool de la siguiente manera para que tu agente pueda cargar sitios web:

Argumentos#

  • api_key: Opcional. Especifica la clave de API de Firecrawl. El valor predeterminado es la variable de entorno FIRECRAWL_API_KEY.
  • query: La cadena de consulta de búsqueda que se utilizará para buscar.
  • page_options: Opcional. Opciones para el formato del resultado.
    • onlyMainContent: Opcional. Devuelve solo el contenido principal de la página, excluyendo encabezados, barras de navegación, pies de página, etc.
    • includeHtml: Opcional. Incluye el contenido HTML sin procesar de la página. Devolverá una clave html en la respuesta.
    • fetchPageContent: Opcional. Obtiene el contenido completo de la página.
  • search_options: Opcional. Opciones para controlar el comportamiento del crawling.
    • limit: Opcional. Número máximo de páginas a rastrear.