インストール#
pip install 'firecrawl-py>=4.3.3' llama-index llama-index-readers-web使用方法#
FireCrawlWebReader は、scrape、crawl、map、search、extract モードをサポートしています。
Firecrawlでウェブサイト全体を収集する#
from llama_index.readers.web import FireCrawlWebReaderfrom llama_index.core import SummaryIndeximport os# ウェブサイトをクロールするために FireCrawlWebReader を初期化firecrawl_reader = FireCrawlWebReader( api_key="<your_api_key>", # https://www.firecrawl.dev/ で取得した実際の API キーに置き換えてください mode="crawl", # "scrape"、"crawl"、"map"、"search"、または "extract" params={"additional": "parameters"} # 追加パラメータ(任意))# 環境変数に仮想キーを設定os.environ["OPENAI_API_KEY"] = "<OPENAI_API_KEY>"# 単一ページの URL からドキュメントを読み込むdocuments = firecrawl_reader.load_data(url="http://paulgraham.com/")index = SummaryIndex.from_documents(documents)# 詳細な出力のためにログレベルを DEBUG に設定query_engine = index.as_query_engine()response = query_engine.query("What did the author do growing up?")display(Markdown(f"<b>{response}</b>"))Firecrawl を使って単一ページを収集する#
from llama_index.readers.web import FireCrawlWebReader# APIキーと目的のモードで FireCrawlWebReader を初期化しますfirecrawl_reader = FireCrawlWebReader( api_key="<your_api_key>", # https://www.firecrawl.dev/ で取得した実際のAPIキーに置き換えてください mode="scrape", # "scrape"、"crawl"、"map"、"search"、または "extract" params={"additional": "parameters"} # 任意の追加パラメータ)# 指定したURLからドキュメントを読み込みますdocuments = firecrawl_reader.load_data(url="http://paulgraham.com/worked.html")index = SummaryIndex.from_documents(documents)# より詳細な出力のため、ログレベルをDEBUGに設定しますquery_engine = index.as_query_engine()response = query_engine.query("What did the author do growing up?")display(Markdown(f"<b>{response}</b>"))
