Instalación#
pip install 'firecrawl-py>=4.3.3' llama-index llama-index-readers-webUso#
FireCrawlWebReader admite los modos scrape, crawl, map, search y extract.
Usar Firecrawl para recopilar todo un sitio web#
from llama_index.readers.web import FireCrawlWebReaderfrom llama_index.core import SummaryIndeximport os# Inicializa FireCrawlWebReader para rastrear un sitio webfirecrawl_reader = FireCrawlWebReader( api_key="<your_api_key>", # Sustituye por tu clave de API real de https://www.firecrawl.dev/ mode="crawl", # "scrape", "crawl", "map", "search" o "extract" params={"additional": "parameters"} # Parámetros adicionales opcionales)# Establece la variable de entorno para la clave de OpenAIos.environ["OPENAI_API_KEY"] = "<OPENAI_API_KEY>"# Carga documentos desde una URL de una sola páginadocuments = firecrawl_reader.load_data(url="http://paulgraham.com/")index = SummaryIndex.from_documents(documents)# Configura el nivel de registro en DEBUG para obtener salidas más detalladasquery_engine = index.as_query_engine()response = query_engine.query("What did the author do growing up?")display(Markdown(f"<b>{response}</b>"))Usar Firecrawl para recopilar una sola página#
from llama_index.readers.web import FireCrawlWebReader# Inicializa FireCrawlWebReader con tu clave de API y el modo deseadofirecrawl_reader = FireCrawlWebReader( api_key="<your_api_key>", # Reemplaza con tu clave de API real de https://www.firecrawl.dev/ mode="scrape", # "scrape", "crawl", "map", "search" o "extract" params={"additional": "parameters"} # Parámetros adicionales opcionales)# Carga documentos desde una URL específicadocuments = firecrawl_reader.load_data(url="http://paulgraham.com/worked.html")index = SummaryIndex.from_documents(documents)# Configura el registro en DEBUG para obtener salidas más detalladasquery_engine = index.as_query_engine()response = query_engine.query("What did the author do growing up?")display(Markdown(f"<b>{response}</b>"))
