Dify 官方插件: marketplace.dify.ai/plugins/langgenius/firecrawl
Dify 团队官方插件 • 安装量超过 170,000 次 • 支持 Chatflow 和代理应用 • 免费使用
Dify 集成概览#
Dify 是一个开源的 LLM 应用开发平台。通过官方 Firecrawl 插件,您可以直接在 AI 工作流中抓取和爬取网页。
使用 Firecrawl 节点构建用于提取数据的可视化流水线
让 AI 代理能够按需抓取实时网页数据
Dify 中的 Firecrawl 工具#
该插件提供七个 actions。
搜索
进行网页搜索,并可选择抓取返回的结果,一步获取最新的结果元数据或完整页面内容。
使用场景: 研究助手、发现竞争对手、基于实时来源为答案提供依据。
抓取
将任意 URL 转换为干净的结构化数据,将原始 HTML 转化为可直接使用的洞察。
使用场景: 提取产品数据、抓取文章内容、通过 JSON 模式获取结构化数据。
爬取
递归爬取网站及其子域名,收集大量内容。
使用场景: 全站内容提取、文档抓取、多页面数据收集。
映射
生成网站中所有 URL 的完整映射。
使用场景: 网站结构分析、SEO 审核、为批量抓取发现 URL。
爬取任务
根据任务 ID 获取抓取结果,或取消正在执行的任务。
使用场景: 监控长时间运行的爬取任务、管理异步抓取工作流、按需取消操作。
创建监控
创建定时监控,按固定周期重新检查目标。
使用场景: 保持已采集数据的时效性、监控变更日志、跟踪竞争对手。
监控检查
获取监控详情及检查结果,仅对发生变化的页面采取操作。
使用场景: 增量更新知识库、变更告警、触发下游流程。
快速开始#
安装 Firecrawl 插件
前往 Dify 插件市场,安装 Firecrawl 工具
获取 Firecrawl API 密钥
前往 Firecrawl API 密钥 页面,创建新的 API 密钥
在 Dify 中授权
进入 插件 > Firecrawl > 待授权,输入您的 API 密钥
添加到工作流
将 Firecrawl 工具拖入您的 Chatflow、工作流或代理应用
配置并测试
设置参数并测试工作流
使用模式#
可视化流水线集成
- 将 Firecrawl Node 添加到流水线
- 选择操作 (Map、Crawl、Scrape)
- 定义输入变量
- 依次执行流水线
示例流程:
自动化数据处理
构建包含以下内容的多步骤工作流:
- 定时抓取
- 数据转换
- 数据库存储
- 通知
示例流程:
AI 驱动的网页访问
为代理提供实时网页抓取能力:
- 将 Firecrawl 工具添加到代理
- 代理自主决定何时抓取
- LLM 分析提取的内容
- 代理提供有据可依的响应
**使用场景:**可引用实时文档的客户支持代理
常见用例#
构建由 RAG 驱动、可抓取并引用实时网站内容的聊天机器人
可通过抓取和分析多个来源来研究主题的代理
跟踪竞争对手网站并在发生变更时发出告警的自动化工作流
从网站提取并丰富数据,再导入结构化数据库
Firecrawl actions#
| 工具 | 描述 | 最适用场景 |
|---|---|---|
| 搜索 | 可选返回页面内容的网页搜索 | 基于实时来源生成答案 |
| 抓取 | 单页数据提取 | 快速获取内容 |
| 爬取 | 多页面递归爬取 | 全站内容提取 |
| 映射 | URL 发现和网站映射 | SEO 分析、URL 列表 |
| 爬取任务 | 异步任务管理 | 长时间运行的操作 |
| 创建监控 | 定期重新检查目标 | 保持已采集数据最新 |
| 监控检查 | 监控详情和检查结果 | 仅处理发生变化的页面 |
最佳实践#
- 让代理自行决定何时抓取
- 使用自然语言指令
- 在 LLM 设置中启用工具调用
- 大规模抓取时监控 token 使用量
- 对大型网站,先使用 Map,再使用 Crawl
- 设置合适的爬取限制
- 添加错误处理节点
- 先用小型数据集进行测试
Dify 与其他平台对比#
| 功能 | Dify | Make | Zapier | n8n |
|---|---|---|---|---|
| 类型 | LLM 应用平台 | 工作流自动化 | 工作流自动化 | 工作流自动化 |
| 最适用场景 | AI 代理和聊天机器人 | 可视化工作流 | 快速自动化 | 开发者自主控制 |
| 定价 | 开源 + 云服务 | 按操作次数 | 按任务次数 | 按执行次数 |
| AI 原生 | 是 | 部分支持 | 部分支持 | 部分支持 |
| 自托管 | 是 | 否 | 否 | 是 |
专业提示: Dify 擅长构建需要代理动态访问网页的 AI 原生应用,非常适合需要实时数据的聊天机器人、研究助手和 AI 工具。
将网站同步到 Dify 知识库#
Firecrawl 还可以将网页抓取为 Markdown,并通过 Dify Cloud 将其导入 Dify 知识库。
配置 Firecrawl#
打开头像菜单,前往 DataSource 页面,并配置 Firecrawl 凭据。
登录你的 Firecrawl 账户,获取 API 密钥,然后在 Dify 中输入并保存。
抓取目标网页#
在知识库创建页面中,选择“Sync from website”,选择 Firecrawl 作为提供商,并输入要抓取的 URL。
配置选项包括:是否爬取子页面、页面爬取上限、页面抓取最大深度、排除路径、仅包含路径,以及内容提取范围。完成配置后,点击“Run”以预览解析后的页面。
查看导入结果#
导入的页面文本会存储在知识库文档中。查看结果,然后点击 Add URL 导入更多页面。


