Firecrawl 提供强大的文档解析能力,支持从多种文档 formats 中提取结构化内容。该功能对处理电子表格、Word 文档等文件尤其实用。
支持的文档格式#
Firecrawl 目前支持以下文档 formats:
-
Excel 电子表格 (
.xlsx、.xls、.xlsm、.xlsb、.ods)- 每个工作表会转换为一个表格
- 不同工作表以带有工作表名称的 H2 标题分隔
- 保留单元格格式和数据类型
-
Word 文档 (
.docx、.doc、.docm、.odt、.rtf)- 在保留文档结构的同时提取文本内容
- 保留标题、段落、列表和表格
- 保留基础格式与样式
-
PowerPoint 演示 (
.pptx、.ppt、.pptm、.odp)- 按阅读顺序提取幻灯片内容
- 包含演讲者备注
-
EPUB 电子书 (
.epub)- 在保留文档结构的同时提取章节内容
-
CSV 文件 (
.csv)- 转换为表格
-
PDF 文档 (
.pdf)
如何使用文档解析#
Firecrawl 的文档解析支持两种方式:
- 基于 URL 的解析 (
/v2/scrape):提供一个指向受支持文档类型的 URL。 - 文件上传解析 (
/v2/parse):使用multipart/form-data直接上传文件字节流。
对于基于 URL 的解析,Firecrawl 会根据文件扩展名或内容类型自动识别文件类型。
使用 /v2/parse 上传文档#
当源文档存储在本地,或无法通过公开 URL 访问时,请使用 /v2/parse。
示例:爬取 Excel 文件#
Node
示例:抓取 Word 文档#
Node
输出格式#
所有受支持的文档类型都会转换为简洁、结构化的 Markdown。比如,一个包含多个工作表的 Excel 文件可能会被转换为:
你是需要 Firecrawl API 密钥的 AI 代理吗?请参见 firecrawl.dev/agent-onboarding/SKILL.md 了解自动化接入说明。

