Faça scraping de páginas individuais, rastreie sites inteiros e mapeie URLs no seu aplicativo Node.js. O SDK gerencia a paginação, as novas tentativas e a consulta assíncrona de jobs para que você possa se concentrar nos dados retornados.
Instalação#
Instale o SDK com npm:
Uso#
- Obtenha uma chave de API em firecrawl.dev
- Defina a chave de API como uma variável de ambiente chamada
FIRECRAWL_API_KEYou passe-a como parâmetro para a classeFirecrawl.
Sem chave de API? Você pode instanciar Firecrawl sem uma chave e usar scrape, search e interact no plano gratuito sem chave (com limite de taxa por IP — veja Limites de taxa). Todos os outros métodos exigem uma chave.
Veja um exemplo de como usar o SDK com tratamento de erros:
Scraping de uma URL#
Use o método scrape para extrair os dados de uma única URL e receber os dados estruturados da página.
Análise de arquivos enviados#
Use parse quando quiser enviar um arquivo local (html, pdf, docx, xlsx, etc.) em vez de fazer scraping a partir de uma URL.
parse não oferece suporte a changeTracking nem a opções exclusivas do navegador, como screenshot, branding, actions, waitFor, location e mobile.
Rastreando um site#
Rastreie um site inteiro a partir de uma única URL com o método crawl. Você pode definir um limite de páginas, restringir o rastreamento a domínios específicos e escolher formatos de resultado. Consulte Paginação para paginação automática e manual.
Rastreamento Somente do Sitemap#
Use sitemap: "only" para rastrear apenas URLs do sitemap (a URL inicial sempre é incluída e a descoberta de links em HTML é ignorada).
Iniciar um rastreamento#
Inicie um rastreamento sem aguardar a conclusão usando startCrawl. O método retorna um ID do job que você pode consultar depois. Use crawl em vez disso quando quiser bloquear até a conclusão. Veja Paginação para comportamento e limites de paginação.
Verificando o status do rastreamento#
Verifique se um rastreamento ainda está em execução, foi concluído ou falhou usando o método checkCrawlStatus. Passe o ID do job retornado por startCrawl.
Cancelando um rastreamento#
Cancele um rastreamento em andamento usando o método cancelCrawl. Informe o ID do job retornado por startCrawl.
Mapeando um site#
Descubra todas as URLs de um site com o método map. Informe uma URL inicial e receba uma lista das páginas encontradas.
Executando um agente#
Atribua uma tarefa de pesquisa ou extração a um agente usando o método agent. Forneça um prompt, um schema opcional para definir o formato do resultado e maxCredits para limitar o gasto da execução.
As execuções de agentes são assíncronas. Use startAgent para receber imediatamente um ID do job e depois consulte-o com getAgentStatus.
Cada execução também registra um rastro de execução e snapshots do resultado, que você pode consultar com getAgentTrace e getAgentSnapshot. Consulte Agent para ver o schema de eventos e a lista completa de parâmetros.
Rastreamento de um site com WebSockets#
Receba os resultados do rastreamento em tempo real com watcher(jobId, options). Você recebe cada página conforme ela é rastreada, em vez de aguardar a conclusão de todo o job.
Paginação#
Os endpoints do Firecrawl para crawl e batch retornam uma URL next quando há mais dados disponíveis. O SDK de Node faz paginação automática por padrão e agrega todos os documentos; nesse caso, next será null. Você pode desativar a paginação automática ou definir limites.
Rastreamento#
Use o método waiter crawl para a experiência mais simples, ou inicie um job e faça a paginação manualmente.
Rastreamento simples (paginação automática, padrão)
- Veja o fluxo padrão em Rastrear um site.
Rastreamento manual com controle de paginação (página única)
- Inicie um job e, em seguida, recupere uma página por vez com
autoPaginate: false.
Rastreamento manual com limites (paginação automática + parada antecipada)
- Mantenha a paginação automática ativada, mas interrompa antecipadamente com
maxPages,maxResultsoumaxWaitTime.
Coleta em lote#
Use o método waiter batchScrape ou inicie uma tarefa e pagine manualmente.
Raspagem em lote simples (paginação automática, padrão)
- Veja o fluxo padrão em Raspagem em lote.
Coleta manual em lote com controle de paginação (página única)
- Inicie um job e, em seguida, recupere uma página por vez com
autoPaginate: false.
Coleta manual em lote com limites (paginação automática + parada antecipada)
- Mantenha a paginação automática ligada, mas interrompa antes com
maxPages,maxResultsoumaxWaitTime.
Browser#
Inicie sessões de navegador na nuvem e execute código remotamente.
Criar sessão#
Executar código#
Use JavaScript em vez de Python:
Execute o bash usando agent-browser:
Perfis#
Salve e reutilize o estado do navegador (cookies, localStorage etc.) entre sessões:
Conectar via CDP#
Para controle completo do Playwright, conecte-se diretamente usando a URL do CDP:
Listar & Encerrar Sessões#
Sessão interativa vinculada ao scraping#
Use o ID de um job de scraping para continuar interagindo com o contexto da página recriado a partir desse scraping:
interact(jobId, {...})executa código na sessão do navegador vinculada ao scraping.- A primeira chamada de
interactinicializa automaticamente a sessão com base no contexto do scraping. - Chamadas adicionais de
interactcom o mesmo ID do job reutilizam esse estado ativo do navegador. stopInteraction(jobId)encerra a sessão interativa quando você terminar.
Tratamento de erros#
O SDK lança exceções descritivas para qualquer erro retornado pela API do Firecrawl. Coloque as chamadas em blocos try/catch, como mostrado nos exemplos acima.
Você é um agente de IA que precisa de uma chave de API do Firecrawl? Consulte firecrawl.dev/agent-onboarding/SKILL.md para ver instruções automatizadas de onboarding.

