Skip to main content

Analyse de documents

Découvrez les capacités d'analyse de documents.
2 min read

Firecrawl offre de puissantes fonctionnalités d’analyse de documents, vous permettant d’extraire du contenu structuré à partir de divers formats. Cette fonctionnalité est particulièrement utile pour traiter des fichiers comme des feuilles de calcul, des documents Word, et plus encore.

Formats de documents pris en charge#

Firecrawl prend actuellement en charge les formats de documents suivants :

  • Feuilles de calcul Excel (.xlsx, .xls, .xlsm, .xlsb, .ods)

    • Chaque feuille est convertie en tableau
    • Les feuilles sont séparées par des titres H2 portant le nom de la feuille
    • Préserve le formatage des cellules et les types de données
  • Documents Word (.docx, .doc, .docm, .odt, .rtf)

    • Extrait le contenu textuel tout en préservant la structure du document
    • Conserve les titres, paragraphes, listes et tableaux
    • Préserve le formatage et le style de base
  • Présentations PowerPoint (.pptx, .ppt, .pptm, .odp)

    • Extrait le contenu des diapositives dans l’ordre de lecture
    • Inclut les notes du présentateur
  • Livres numériques EPUB (.epub)

    • Extrait le contenu des chapitres tout en préservant la structure du document
  • Fichiers CSV (.csv)

    • Converti en tableau
  • Documents PDF (.pdf)

    • Extrait le contenu textuel avec les informations de mise en page
    • Préserve la structure du document, y compris les sections et les paragraphes
    • Prend en charge les PDF textuels et les PDF scannés (avec OCR)
    • Markdown optionnel par page et blocs de mise en page typés avec cadres de délimitation
    • Facturé 1 crédit par page. Voir la tarification pour plus de détails.
    • Voir les options PDF pour la référence complète : modes d’analyse, limites de pages, Markdown par page et blocs de mise en page.

Comment utiliser l’analyse de documents#

L’analyse de documents dans Firecrawl fonctionne de deux façons :

  1. Analyse à partir d’une URL (/v2/scrape) : fournissez une URL pointant vers un type de document pris en charge.
  2. Analyse par téléversement de fichier (/v2/parse) : téléversez directement le contenu binaire du fichier avec multipart/form-data.

Pour l’analyse à partir d’une URL, Firecrawl détecte automatiquement le type de fichier à partir de l’extension ou du type de contenu.

Importer des documents avec /v2/parse#

Utilisez /v2/parse lorsque le document source est local ou n’est pas accessible publiquement via une URL.

Exemple : extraction d’un fichier Excel#

Node

Exemple : Scraper un document Word#

Node

Format de sortie#

Tous les types de documents pris en charge sont convertis en Markdown propre et structuré. Par exemple, un fichier Excel comportant plusieurs feuilles peut être converti en :

Êtes-vous un agent IA ayant besoin d’une clé API Firecrawl ? Consultez firecrawl.dev/agent-onboarding/SKILL.md pour obtenir des instructions d’intégration automatisée.