安装#
pip install 'firecrawl-py>=4.3.3' llama-index llama-index-readers-web使用方式#
FireCrawlWebReader 支持 scrape、crawl、map、search 和 extract 模式。
使用 Firecrawl 抓取整个网站#
from llama_index.readers.web import FireCrawlWebReaderfrom llama_index.core import SummaryIndeximport os# 初始化 FireCrawlWebReader 以爬取网站firecrawl_reader = FireCrawlWebReader( api_key="<your_api_key>", # 将其替换为你在 https://www.firecrawl.dev/ 获取的实际 API 密钥 mode="crawl", # "scrape"、"crawl"、"map"、"search" 或 "extract" params={"additional": "parameters"} # 可选的附加参数)# 设置环境变量以配置虚拟密钥os.environ["OPENAI_API_KEY"] = "<OPENAI_API_KEY>"# 从单个页面 URL 加载文档documents = firecrawl_reader.load_data(url="http://paulgraham.com/")index = SummaryIndex.from_documents(documents)# 将日志级别设置为 DEBUG 以获得更详细的输出query_engine = index.as_query_engine()response = query_engine.query("What did the author do growing up?")display(Markdown(f"<b>{response}</b>"))使用 Firecrawl 采集单个页面#
from llama_index.readers.web import FireCrawlWebReader# 使用你的 API 密钥和所需模式初始化 FireCrawlWebReaderfirecrawl_reader = FireCrawlWebReader( api_key="<your_api_key>", # 将其替换为你在 https://www.firecrawl.dev/ 获取的实际 API 密钥 mode="scrape", # "scrape"、"crawl"、"map"、"search" 或 "extract" params={"additional": "parameters"} # 可选的附加参数)# 从指定的 URL 加载文档documents = firecrawl_reader.load_data(url="http://paulgraham.com/worked.html")index = SummaryIndex.from_documents(documents)# 将日志级别设置为 DEBUG 以获得更详细的输出query_engine = index.as_query_engine()response = query_engine.query("What did the author do growing up?")display(Markdown(f"<b>{response}</b>"))
