O Firecrawl oferece recursos poderosos de parsing de documentos, permitindo extrair conteúdo estruturado de diversos formatos. Esse recurso é particularmente útil para processar arquivos como planilhas, documentos do Word e muito mais.
Formatos de documentos suportados#
Atualmente, o Firecrawl oferece suporte aos seguintes formatos de documentos:
-
Planilhas do Excel (
.xlsx,.xls,.xlsm,.xlsb,.ods)- Cada planilha é convertida em uma tabela
- As planilhas são separadas por títulos H2 com o nome da aba
- Preserva a formatação das células e os tipos de dados
-
Documentos do Word (
.docx,.doc,.docm,.odt,.rtf)- Extrai o conteúdo de texto preservando a estrutura do documento
- Mantém títulos, parágrafos, listas e tabelas
- Preserva formatação e estilos básicos
-
Apresentações do PowerPoint (
.pptx,.ppt,.pptm,.odp)- Extrai o conteúdo dos slides na ordem de leitura
- Inclui notas do apresentador
-
eBooks EPUB (
.epub)- Extrai o conteúdo dos capítulos preservando a estrutura do documento
-
Arquivos CSV (
.csv)- Convertidos em uma tabela
-
Documentos PDF (
.pdf)- Extrai o conteúdo de texto com informações de layout
- Preserva a estrutura do documento, incluindo seções e parágrafos
- Lida com PDFs baseados em texto e digitalizados (com suporte a OCR)
- Opcionalmente, fornece Markdown por página e blocos de layout tipados com caixas delimitadoras
- Custa 1 crédito por página. Consulte a tabela de preços para detalhes.
- Consulte as opções de PDF para a referência completa: modos de análise, limites de páginas, Markdown por página e blocos de layout.
Como usar a análise de documentos#
A análise de documentos no Firecrawl funciona de duas formas:
- Análise via URL (
/v2/scrape): forneça uma URL que aponte para um tipo de documento compatível. - Análise por upload de arquivo (
/v2/parse): envie os bytes do arquivo diretamente commultipart/form-data.
Na análise via URL, o Firecrawl detecta automaticamente o tipo de arquivo pela extensão ou pelo content type.
Faça upload de documentos com /v2/parse#
Use /v2/parse quando o documento de origem estiver localmente ou não estiver acessível publicamente por URL.
Exemplo: Fazendo scraping de um arquivo Excel#
Exemplo: Extraindo um documento do Word#
Formato de saída#
Todos os tipos de documentos compatíveis são convertidos em Markdown limpo e estruturado. Por exemplo, um arquivo Excel com várias planilhas pode ser convertido em:
Você é um agente de IA que precisa de uma chave de API do Firecrawl? Consulte firecrawl.dev/agent-onboarding/SKILL.md para ver instruções automatizadas de onboarding.

