Instalação#
pip install 'firecrawl-py>=4.3.3' llama-index llama-index-readers-webUso#
FireCrawlWebReader oferece suporte aos modos scrape, crawl, map, search e extract.
Usando o Firecrawl para coletar um site inteiro#
from llama_index.readers.web import FireCrawlWebReaderfrom llama_index.core import SummaryIndeximport os# Inicialize o FireCrawlWebReader para rastrear um sitefirecrawl_reader = FireCrawlWebReader( api_key="<your_api_key>", # Substitua pela sua chave de API em https://www.firecrawl.dev/ mode="crawl", # "scrape", "crawl", "map", "search" ou "extract" params={"additional": "parameters"} # Parâmetros adicionais opcionais)# Defina a variável de ambiente para a chave da APIos.environ["OPENAI_API_KEY"] = "<OPENAI_API_KEY>"# Carregue documentos de uma única URLdocuments = firecrawl_reader.load_data(url="http://paulgraham.com/")index = SummaryIndex.from_documents(documents)# Ajuste o nível de log para DEBUG para obter saídas mais detalhadasquery_engine = index.as_query_engine()response = query_engine.query("What did the author do growing up?")display(Markdown(f"<b>{response}</b>"))Usando o Firecrawl para coletar uma única página#
from llama_index.readers.web import FireCrawlWebReader# Inicialize o FireCrawlWebReader com sua chave de API e o modo desejadofirecrawl_reader = FireCrawlWebReader( api_key="<your_api_key>", # Substitua pela sua chave de API em https://www.firecrawl.dev/ mode="scrape", # "scrape", "crawl", "map", "search" ou "extract" params={"additional": "parameters"} # Parâmetros adicionais opcionais)# Carregue documentos de uma URL específicadocuments = firecrawl_reader.load_data(url="http://paulgraham.com/worked.html")index = SummaryIndex.from_documents(documents)# Defina o nível de log como DEBUG para obter saídas mais detalhadasquery_engine = index.as_query_engine()response = query_engine.query("What did the author do growing up?")display(Markdown(f"<b>{response}</b>"))
