Firecrawl offre de puissantes fonctionnalités d’analyse de documents, vous permettant d’extraire du contenu structuré à partir de divers formats. Cette fonctionnalité est particulièrement utile pour traiter des fichiers comme des feuilles de calcul, des documents Word, et plus encore.
Formats de documents pris en charge#
Firecrawl prend actuellement en charge les formats de documents suivants :
-
Feuilles de calcul Excel (
.xlsx,.xls,.xlsm,.xlsb,.ods)- Chaque feuille est convertie en tableau
- Les feuilles sont séparées par des titres H2 portant le nom de la feuille
- Préserve le formatage des cellules et les types de données
-
Documents Word (
.docx,.doc,.docm,.odt,.rtf)- Extrait le contenu textuel tout en préservant la structure du document
- Conserve les titres, paragraphes, listes et tableaux
- Préserve le formatage et le style de base
-
Présentations PowerPoint (
.pptx,.ppt,.pptm,.odp)- Extrait le contenu des diapositives dans l’ordre de lecture
- Inclut les notes du présentateur
-
Livres numériques EPUB (
.epub)- Extrait le contenu des chapitres tout en préservant la structure du document
-
Fichiers CSV (
.csv)- Converti en tableau
-
Documents PDF (
.pdf)- Extrait le contenu textuel avec les informations de mise en page
- Préserve la structure du document, y compris les sections et les paragraphes
- Prend en charge les PDF textuels et les PDF scannés (avec OCR)
- Markdown optionnel par page et blocs de mise en page typés avec cadres de délimitation
- Facturé 1 crédit par page. Voir la tarification pour plus de détails.
- Voir les options PDF pour la référence complète : modes d’analyse, limites de pages, Markdown par page et blocs de mise en page.
Comment utiliser l’analyse de documents#
L’analyse de documents dans Firecrawl fonctionne de deux façons :
- Analyse à partir d’une URL (
/v2/scrape) : fournissez une URL pointant vers un type de document pris en charge. - Analyse par téléversement de fichier (
/v2/parse) : téléversez directement le contenu binaire du fichier avecmultipart/form-data.
Pour l’analyse à partir d’une URL, Firecrawl détecte automatiquement le type de fichier à partir de l’extension ou du type de contenu.
Importer des documents avec /v2/parse#
Utilisez /v2/parse lorsque le document source est local ou n’est pas accessible publiquement via une URL.
Exemple : extraction d’un fichier Excel#
Exemple : Scraper un document Word#
Format de sortie#
Tous les types de documents pris en charge sont convertis en Markdown propre et structuré. Par exemple, un fichier Excel comportant plusieurs feuilles peut être converti en :
Êtes-vous un agent IA ayant besoin d’une clé API Firecrawl ? Consultez firecrawl.dev/agent-onboarding/SKILL.md pour obtenir des instructions d’intégration automatisée.

